报告概述

报告介绍Kimi K2.5,一个开源的多模态智能体模型,旨在推进通用智能体智能。该模型强调文本与视觉的联合优化,通过联合预训练、零视觉SFT和联合多模态强化学习实现跨模态增强。在此基础上,报告提出Agent Swarm,一个自驱动的并行智能体编排框架,能够动态分解复杂任务为异构子问题并并发执行。报告详细阐述了模型架构、训练方法、评估结果及应用价值,为研究和部署可扩展的智能体系统提供参考。

报告的核心结论

文本与视觉联合优化实现双向增强。

Kimi K2.5采用文本与视觉联合预训练、零视觉SFT及联合强化学习,实验表明视觉RL不仅提升视觉任务性能,还意外增强了文本任务表现(如MMLU-Pro提升1.7%),证明跨模态训练的双向收益。

Agent Swarm并行框架显著降低延迟并提升性能。

Agent Swarm通过动态任务分解和并行子智能体执行,在WideSearch上将推理延迟降低3-4.5倍,同时提升Item-F1从72.7%到79.0%,有效解决了顺序执行在复杂任务中的瓶颈。

零视觉SFT即可激活多模态能力。

仅使用文本SFT数据,不依赖人工标注的视觉轨迹,即可激活模型的视觉推理和工具使用能力。这得益于联合预训练建立的强视觉-文本对齐,使泛化自然发生。

早期融合低视觉比率的预训练策略更优。

在固定视觉-文本令牌预算下,早期引入视觉数据且保持较低视觉比率,相比晚期高比率融合在视觉知识、推理、OCR及文本任务上均表现更好,避免后期域迁移带来的性能扰动。

报告回答的关键问题

Kimi K2.5是什么模型?

Kimi K2.5是由Kimi Team开发的开源多模态智能体模型,依据报告,它统一了视觉与语言、思考与即时模式、聊天与智能体功能,在编码、视觉、推理和智能体任务上达到业界领先水平。

Agent Swarm如何提升任务执行效率?

Agent Swarm通过可训练的主控制器动态创建专业化子智能体并分配子任务,并行执行不同子问题。报告显示,在WideSearch上它比单智能体基线快3-4.5倍,并提高任务F1得分,有效将线性延迟转化为并行处理。

视觉强化学习对文本能力有何影响?

报告发现,视觉强化学习不仅提升视觉理解,还显著改善文本任务性能。例如,在MMLU-Pro上从84.7%升至86.4%,在GPQA-Diamond上从84.3%升至86.4%,表明跨模态迁移的存在。

Kimi K2.5在编程和软件工程方面表现如何?

根据报告,Kimi K2.5在SWE-Bench Verified上得分76.8%,在LiveCodeBench v6上达85.0%,超越同类模型,展现了强大的真实软件工程和实时编码挑战能力。

报告中的代表性数据

96.1%

AIME 2025得分

2025年,在数学竞赛AIME 2025上,Kimi K2.5得分96.1%,接近GPT-5.2的满分,高于Claude Opus 4.5的92.8%。

78.4%

Agent Swarm在BrowseComp上的准确率

评估时,使用Agent Swarm后,Kimi K2.5在BrowseComp基准上达到78.4%准确率,远超单智能体版本的60.6%及GPT-5.2 Pro的77.9%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的模型架构描述:包括MoonViT-3D视觉编码器、MLP投影器、Kimi K2 MoE语言模型,以及原生多模态预训练的具体策略和实验结果对比。
  • 预训练数据的详细构成:涵盖文本、代码、数学、知识以及七类视觉数据(字幕、交叠、OCR、知识、感知、视频和智能体数据),并说明了数据筛选和质量控制流程。
  • 监督微调(SFT)和强化学习(RL)的训练细节:包括零视觉SFT方法、联合多模态RL、令牌高效RL(Toggle算法)、奖励函数设计和生成式奖励模型。
  • Agent Swarm的完整框架:包括PARL训练范式、奖励定义、关键步骤约束、提示构造,以及与单智能体对比的实验结果。
  • 评估设置与基准:详细列出所有测试基准(文本、编码、智能体、图像、视频、计算机使用)及其配置,确保结果可重复。
  • 广泛的基准结果表格:包含Kimi K2.5与Claude Opus 4.5、GPT-5.2、Gemini 3 Pro等前沿模型的详细对比数据,覆盖数十项指标。
  • Agent Swarm性能分析:包括在BrowseComp、WideSearch和内部Swarm Bench上的加速比、准确率提升,以及动态子智能体创建和上下文管理效果的讨论。
  • 定性示例:展示Agent Swarm分析24小时游戏视频的完整流程,以及工具增强的视觉推理案例(迷宫求解、饼图分析、找不同)。
  • 训练基础设施详情:包括Decoupled Encoder Process(DEP)技术、并行策略(PP/EP/ZeRO-1)、数据存储与加载系统,以及统一的智能体强化学习环境。
  • 附录中的完整贡献者列表、预训练学习曲线和详细配置参数。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告