报告概述
报告由OECD发布,基于OECD的AI能力指标(beta版),系统分析了至2030年AI发展的四种可能情景:进步停滞、进步放缓、进步持续和进步加速。报告回顾了AI近期进展趋势与关键不确定性,包括缩放定律、推理训练、算法效率、物理能力等,并构建了每种情景下的能力评分和任务时间线外推。研究采用了文献综述、专家访谈、战略预见方法和趋势外推等多重输入,旨在为政策制定者提供一个严谨的参考框架,理解AI可能的发展方向及其对经济社会的潜在影响。
报告的核心结论
AI进步到2030年存在从停滞到加速的四种可能情景。
报告基于当前证据和专家意见,提出进步停滞、放缓、持续和加速四类情景均具有合理性。进展停滞情景中,能力基本停在2025年水平;加速情景中,AI在多数认知能力上达到或超越人类水平。当前数据无法排除任何一种可能性。
专家对AI进步速度的预测高度不确定且信心较低。
受访专家认为,尽管在语言、推理等某些能力上进步较快,但物理能力、创造力、持续学习等仍存瓶颈。专家对2030年AI能力水平的判断跨度极大,从接近当前水平到人类级别以上,均被认为可能。这种不确定性源于近期进步极快,而关键驱动因素(如缩放定律的持续性)未知。
政策制定者应考虑所有可能的情景来制定AI政策。
报告强调,政府应基于完整的情景范围来设计政策,以捕获AI进步的收益并管理潜在冲击,包括继续进步和停滞两种情况。例如,若进展加速,需提前准备劳动力转型和治理框架;若停滞,则需调整对AI驱动的生产力增长的预期。
缩放定律和推理训练是未来进步的关键变量。
过去十年,缩放模型规模(参数、数据、算力)是进步的核心驱动力,但其持续有效性存疑。2024年起,推理训练(如o1系列)成为新引擎,但泛化能力有限。算法效率提升(每8个月减半算力需求)也可能持续或放缓。这些变量共同决定了2030年AI能达到的水平。
报告回答的关键问题
到2030年AI可能达到多高的能力水平?
报告指出,AI能力到2030年的水平存在巨大不确定性,范围从接近当前能力(进步停滞)到在大多数认知维度上超越人类(进步加速)。具体表现在:停滞情景下AI可胜任需数小时完成的任务,但需大量人类支持;加速情景下AI可自主完成月级别复杂任务,且物理能力大幅提升。专家意见分歧很大。
哪些因素可能导致AI进步放缓或停滞?
可能导致放缓的因素包括:缩放定律收益递减,更大模型带来的性能提升不如预期;推理训练难以泛化到数学和编码之外的领域;算力和数据缩放面临能源、水、投资等物理约束;算法创新速度下降;以及AI本身对软件开发效率的提升有限(部分研究显示对资深开发者反而拖慢效率)。
AI进步加速的可能触发因素是什么?
加速可能来自:缩放定律继续有效,训练算力到2030年可扩大1万倍(相对GPT-4);推理训练泛化成功,推动多领域推理能力;算法创新持续(如变压器架构级别的突破);AI辅助软件工程显著加快AI研发本身,形成自我加速循环。此外,大规模投资(美国五家企业2025-2026年资本支出达7360亿美元)也为加速提供了资源。
报告中的代表性数据
前沿模型训练算力年增长率
2010-2024,用于训练前沿AI模型的算力每年增长4倍以上,是近期AI能力进步的核心驱动力。
AI在软件工程任务中的可自主完成任务时长(50%成功率)
2025年(GPT-5),GPT-5能以50%成功率自主完成需人类专家217分钟的软件工程任务,相比GPT-4o的2分钟(80%成功率)有显著提升。任务时长每7个月翻倍。
专家认为AI可替代人类工作的比例
2025年,在涵盖44个职业的精确定义数字任务基准测试中,领先AI系统的输出质量被专家评分者认为匹配或优于人类输出。该数据反映了AI在特定任务中已达接近人类水平的表现。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 基于OECD AI能力指标的9项能力(语言、社交互动、问题解决、创造力、元认知与批判性思维、知识与记忆、视觉、物理操作、机器人智能)的详细情景评分表,展示每种情景下到2030年各能力达到的等级(1-5级)。
- 每种情景(停滞、放缓、持续、加速)的主情景及两种变体的完整描述,包括如何进入该情景、历史类比、以及任务时长(如软件工程、科学推理、自动驾驶)的外推数据。
- 对8种变体情景(如AI作为窄工具、简单AI代理、简单机器人、社会受限AI、健忘AI、纯数字AI、AGI、超级智能)的详细分析和能力指标评分对比。
- 对专家访谈的完整记录,包括专家对每种能力(如语言、推理、物理、创造力等)的预期进步速度、关键不确定性、以及对2030年AI水平的不同判断。
- AI基准测试的趋势分析(图1),展示AI系统在阅读理解、图像识别、数学问题求解等多项基准上超越人类的时间线,以及基准测试的局限性讨论。
- 对AI输入(算力、数据、算法效率)未来趋势的详细分析,包括算力缩放至2030年的约束估计(图3)、推理训练算力增长预测(图4)、以及算法创新速度(每8个月算力需求减半)。
- 任务时长基准的外推方法(附件D),包含7类任务(科学推理、数学推理、软件工程、网页导航、计算机使用、模拟机器人、自动驾驶)的当前能力水平和翻倍时间,以及四种情景下的外推曲线。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





