报告概述
本报告是东吴证券AI系列深度研究的第二期,围绕通用人工智能(AGI)这一核心主题展开系统梳理。报告首先辨析了全球机构对AGI定义的四类锚点,指出不同评价体系是分歧的根源;随后梳理了OpenAI、DeepMind等主要机构的分级框架与路线图,并对比了通往AGI的多种技术路径。在衡量方面,报告分析了现有基准的饱和问题及新涌现的替代标尺。经济影响部分,报告对比了五种测算方法及结果差异。报告还讨论了AI风险治理中的审慎派与加速派立场,并将AGI发展映射到产业投资方向,特别指出智能驾驶作为物理AI代表场景的值得关注性。对于希望理解AGI概念、行业判断与投资含义的读者,本报告提供了较为完整的分析框架。
报告的核心结论
AGI定义存在四类锚点,口径决定判断。
全球机构对AGI的理解分为经济价值、能力分级、技能获取效率、世界理解四类锚点。以结果和经济价值为口径的机构更容易宣布接近AGI,而以机制和世界理解为口径的机构门槛更高。报告指出,同一进展被乐观者称为前夜、被审慎者判为尚在山脚,根源正在于评价体系不同。这为理解业界分歧提供了底层框架。
AGI是一条能力阶梯,而非单一时点。
报告梳理OpenAI五级路线图和DeepMind L0-L5分级体系,认为AGI更接近一个连续的能力进阶过程。OpenAI以经济价值和自主程度为主轴,从对话者、推理者、智能体、创新者到组织级AI;DeepMind以性能和通用性二维刻画。这种阶梯化视角比简单追问何时到来更符合行业实际,也便于映射商业化进度。
通往AGI的路径分歧集中在范式能否外推。
激进阵营认为规模化、测试时推理、强化学习和智能体可继续推进;审慎阵营强调现有模型缺世界模型、因果和稳健泛化,可能需要新范式或物理具身;务实阵营更重应用落地。报告认为这一分歧并非对错问题,而是对智能来源和衡量标准的不同回答,同时商业激励差异也放大了表面分歧。
AGI衡量与经济价值缺乏统一标准。
传统基准趋于饱和,ARC-AGI、METR、GDPval等新标尺各自测量推理、任务时长、经济活动或能力层级,但行业尚无权威评测机构。经济测算从十年拉动GDP约1%到每年数万亿美元增加值,差异主要来自劳动替代比例、用例边界和自动化假设。报告强调测算口径决定价值判断,需谨慎看待各类数字。
短期关注高价值职能渗透,中长期跟踪技术拐点。
在产业映射上,报告认为短期可观察的是AI对高价值职能的渗透,以及推理、智能体、具身智能等工程化拐点;中长期需跟踪测试时计算、强化学习、世界模型、机器人等路径能否跨越当前可验证的任务边界。报告特别指出,物理AI在AI当前发展阶段可能成为增量更大的方向,智能驾驶是最先跑通闭环的代表场景。
报告回答的关键问题
什么是AGI?如何定义通用人工智能?
AGI通常被理解为具备跨领域通用能力、能像人一样学习并解决新问题的系统。但报告指出,全球机构对它的定义并未统一,主要落在四类锚点上:经济价值(能否替代有经济价值的工作)、能力分级(性能与通用性的组合)、技能获取效率(在陌生任务上快速学习的能力)、世界理解(是否具备世界模型与因果推理)。不同定义回答的是不同问题,没有简单的对错。
OpenAI和DeepMind的AGI分级有何不同?
OpenAI的五级路线图以经济价值和自主程度为主轴,从对话者、推理者、智能体、创新者到组织级AI,直观且便于映射商业化进度,目前被认为处于L2向L3过渡。DeepMind的L0-L5体系以性能和通用性两个维度衡量,更学术化、更保守,当前前沿模型仅处于通用新兴一格。两者分别适合商业沟通与学术比较。
AGI何时会到来?业界预测如何?
报告汇总了多种预测方法:乐观的实验室CEO表态在2026-2030年之间,预测平台Metaculus给出通用AI约2028年、强AGI约2033年,而AI Impacts对数千名研究者的问卷调查显示HLMI中位数约2047年。AI从业者的预期明显比企业高管保守。报告强调,时间表高度依赖对AGI的定义和口径,单一预测并不可靠。
AGI能带来多大的经济价值?
报告对比了五种测算方法:麦肯锡的用例增加值法估计生成式AI每年可新增2.6-4.4万亿美元;OpenAI和IMF的任务暴露法显示约80%美国劳动力和全球约40%岗位受到影响;Acemoglu的宏观task-based法测算未来十年AI对GDP拉动约1%;PwC估计2030年AI贡献15.7万亿美元;还有全自动化情景下的增长爆发理论。数字差异巨大,核心在于自动化假设不同。
通往AGI的主要技术路径有哪些?
报告归纳了七大技术路径:训练时规模化、测试时计算与强化学习、新架构与学习目标、世界模型与具身、神经符号与可解释、自我改进与开放式进化、以及智能体系统编排层。各实验室押注方向不同,例如OpenAI重视测试时计算,LeCun主张世界模型,宇树等具身阵营强调物理交互。智能体属于系统层,争议在于AGI是模型问题还是系统问题。
报告中的代表性数据
生成式AI年度经济价值(麦肯锡估算)
2023年,用例增加值法,自下而上拆解约60+类用例并映射企业职能,加总得年度新增价值。约75%集中于客户运营、营销、软件工程、研发四大职能;若叠加嵌入既有软件,潜在价值约6.1-7.9万亿美元/年。
AI对GDP的拉动(Acemoglu测算)
未来十年,宏观task-based法,基于Hulten定理,计入确实自动化的任务成本节约。TFP提升不超过约0.66%,GDP拉动约1%,比麦肯锡等自下而上测算低约一个数量级,且可能偏高。
AI从业者预计AGI到来中位数年份
专家问卷,来自AI Impacts/Grace对数千名AI研究者的调查,HLMI(高水平机器智能)中位数为约2047年,明显晚于部分乐观CEO的2026-2030年表态。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 全球主要机构对AGI的理解谱系:报告用表格梳理了OpenAI、DeepMind、Meta、微软、百度、腾讯等二十余家机构代表对AGI的独特理解与锚点,帮助读者快速了解行业立场全景。
- 主要机构已公开的AGI分级框架盘点:详细对比OpenAI五级路线图、DeepMind L0-L5、阿里三阶段、智谱L1-L3、Anthropic ASL安全等级、Salesforce智能体成熟度模型等,并指出哪些机构未发布官方路线图。
- 主要技术路径对照与三大分歧的根源:逐一分析训练时规模化、测试时计算、新架构、世界模型、神经符号、自我改进、智能体等路径的代表机构与依据,并深入解释激进、审慎、务实、具身阵营的底层分歧。
- AGI到达时间的五类预测方法论:对比专家问卷、预测平台、任务时长外推、算力/生物锚、实验室CEO表态的原理、关键假设和结论,帮助读者理解不同时间预测的来源与局限。
- 主流评测基准与替代标尺详解:介绍ARC-AGI、GPQA、HLE、FrontierMath、SWE-bench、GDPval、METR的测法、采纳度与饱和情况,以及经济价值、泛化效率、自主时长、能力分级等替代标尺的优劣势。
- AI经济价值五种测算方法对照:展开麦肯锡用例增加值法、OpenAI/IMF任务暴露法、Acemoglu宏观task-based法、PwC行业咨询综合法、全自动化增长模型,并分析差异根源在于测的对象和关键假设不同。
- 风险治理审慎派与加速派观点及措施:梳理Hinton、Bengio、Russell等审慎派的监管主张和已采取行动,以及LeCun、吴恩达、Andreessen等淡化派的开源与反监管立场,并介绍中间务实路线的做法。
- 风险提示与产业投资含义:报告在结尾列出技术迭代、大模型厂商ARR增速、云服务商资本开支、智能驾驶及机器人商业化落地四大风险,并结合分析指出物理AI及智能驾驶作为增量方向的关注价值。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





