报告概述

本报告聚焦强化学习(RL)在AI能力扩展中的核心作用,深入分析后训练阶段如何通过构建专业化RL环境推动模型性能提升。报告覆盖从UI克隆到复杂软件工程环境的多层次环境构建方法,探讨数据铸造厂模式(如Surge、Mercor等)以及多智能体架构(如GPT-5.2 Pro、Gemini Deep Think)的最新进展。同时,报告剖析了RL在生物学、材料科学等领域的应用挑战与前景,为理解AI前沿实验室的策略提供了独特视角。

报告的核心结论

强化学习扩展是解锁AI能力的关键路径

过去几个月,主要能力提升来自RL算力的规模化投入。OpenAI使用同一基础模型GPT-4o,通过后训练和RL扩展在18个月内持续驱动性能增长,验证了后训练的有效性。

后训练数据需从零构建,催生环境建设产业

与预训练依赖互联网数据不同,RL任务和环境必须专门创建,目前已有超过35家公司提供RL环境构建服务,包括UI gyms和代码环境,形成新兴产业链。

多智能体架构可显著提升模型推理能力

通过组合多个模型协同思考,如Grok 4 Heavy、GPT-5.2 Pro等产品,能在不增加模型参数的情况下提升解决复杂问题的能力,尤其适用于科学发现和编程领域。

RL在科学领域面临数据稀疏和长周期挑战

生物实验代价高、周期长,导致奖励信号稀疏。实验室正通过过程奖励、轨迹复用和自动化工具体系来应对,但仍需更高效的算法和架构变革。

报告回答的关键问题

为什么强化学习扩展对AI进步至关重要?

报告指出,OpenAI在18个月内仅通过后训练和RL算力扩展就实现了性能持续提升,而预训练优化收益递减。RL扩展能解锁模型在代码、数学、工具使用等领域的深度能力,成为当前AI进步的主要驱动力。

后训练与预训练的数据来源有何不同?

预训练有整个互联网作为语料,但RL数据和任务必须从零创建,需要人工或自动化构建环境。例如通过GitHub PR挖掘合成编码任务,高信号用户数据也用于后训练,数据采购模式成为实验室战略的核心部分。

哪些公司正在构建强化学习环境?

超过35家初创公司涌现,如Habitat、DeepTune、Fleet、Turing、Mechanize等,专注于网页克隆、软件工程环境或工具封装。Anthropic是激进买家,与十余家环境公司合作;OpenAI则自建内部数据团队以减少第三方依赖。

多智能体架构如何提升模型性能?

多智能体架构通过多个模型分工协作,如采样器、集成模型和验证器组成进化循环,或四个子智能体分别测试、分析、编辑和实现,从而在编码和科学问题上获得显著加速。AlphaEvolve和ARC-AGI记录是典型案例。

报告中的代表性数据

71%

GDPval评估得分

2025年,OpenAI创建的GDPval评估涵盖44个职业1000+任务,GPT-5.2得分71%表示在71%的情况下模型输出与人类专家持平或更优。

超过35家

RL环境公司数量

截至2025年,在RL扩展热潮中,专门提供RL环境构建的公司已超过35家,覆盖从UI克隆到复杂软件工程环境。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • RL环境构建的详细方法论:从GitHub PR挖掘(SWE-rebench)到合成缺陷生成(SWE-smith)的全流程解析,包括自动化配置、验证和环境容器化技术。
  • 主要AI实验室的采购模式对比:Anthropic的广泛供应商生态策略、OpenAI的内部团队建设与高支出、Google DeepMind的分散化采购及平台优势。
  • RL即服务(RL as a Service)市场分析:包括OpenAI的RFT服务、Anthropic的类似服务以及YC初创公司的低成本竞争,探讨Trainium芯片的经济性优势。
  • 多智能体架构的案例深度分析:AlphaEvolve的进化循环、ARC-AGI记录方法、CUDA内核优化中的四智能体协作,以及递归语言模型在长上下文任务中的表现。
  • 科学领域RL应用专题:生物学中数据稀疏和长周期挑战的解决方案(过程奖励、飞行中权重更新),以及Periodic Labs和Medra的实验室自动化案例。
  • 平台政治与访问限制:Amazon屏蔽ChatGPT Agent等案例,揭示生态控制权争夺对AI代理部署的影响,以及OpenAI与亚马逊的商业谈判细节。
  • 中期训练(Mid-Training)技术详解:其与预训练和后训练的关系,以及如何利用环境轨迹数据提升模型领域知识,Meta和OpenAI的规模对比。
  • 未来展望:自主AI研究员目标(OpenAI 2028年)、Anthropic的2027年突破预测,以及RL从软件向物理世界扩展的深远影响。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告