报告概述
本报告是东吴证券AI系列深度报告的开篇之作,研究对象覆盖数字AI与物理AI两大领域,核心聚焦于二者之间的技术演进关系与能力迁移路径。报告从AI发展的主线三问出发,系统复盘数字AI如何通过Transformer成为通用底座,并深入探讨物理AI在表征、数据、学习范式与部署时延等方面面临的独特挑战。分析框架上,报告以智能驾驶为核心样本,沿着架构、表征、数据、训练、部署五条线索展开,结合大量学术论文与厂商实践,对比国内外主流技术路线。读者可通过本报告建立理解物理AI的概念坐标系,把握从数字AI到物理AI的演进逻辑,并为判断智能驾驶、机器人等物理AI赛道的投资机会提供研究参考。
报告的核心结论
数字AI通用底座已跑通,物理AI需建立真实世界闭环
报告指出,数字AI已在语言、视觉与多模态任务中实现通用底座模型的跑通,但难以完成物理世界的建模闭环。物理AI将在连续、实时、安全约束的真实世界中建立感知—行动—反馈—优化闭环,并与数字AI并列成为任务通解,成为物理世界场景的AI解决方案。
Transformer是数字AI通用底座,物理AI与之技术同源
报告认为,Transformer以注意力加位置编码提供跨领域通用的关系建模,叠加Scaling规律后,统一模型在能力迁移、研发效率与工程复用上的优势持续扩大,推动语言、视觉、生成与多模态收敛于统一基础模型范式。物理AI同样以Transformer为核心技术底座,因此复盘数字AI有助于理解物理AI的演进。
物理AI面临表征、数据、学习范式三重差异,世界模型是核心抓手
报告指出,物理AI缺少天然Token,长尾极端场景稀缺且采集成本高,模仿学习受限于人类驾驶上限,这三点与数字AI存在系统性差异。世界模型能够向前承担潜在空间表征训练,向中游生成高价值长尾数据,向后为强化学习提供可规模化试错环境,从而形成表征—数据—学习的闭环。
智能驾驶是物理AI最先跑通闭环的代表场景
报告认为,随着VLA范式演进、世界模型与强化学习闭环走向成熟、云车部署逐步兑现,物理AI有望由能力展示走向大规模落地。智能驾驶因其对感知、决策、控制闭环的完整需求,成为当前阶段最具成长弹性的方向,也是验证物理AI技术体系的最佳样本。
强化学习从可选增强成为物理AI闭环关键环节
报告分析称,数字AI的强化学习更多承担对齐与推理增强角色,而物理AI的模仿对象是平均水平人类司机,安全目标却远超人类,单纯模仿学习上限较低。强化学习通过与世界模型结合,在闭环环境中持续试错,能够突破能力边界,成为从80分提升至95分的关键路径。
报告回答的关键问题
数字AI和物理AI是什么关系?
数字AI与物理AI具有技术同源性,Transformer是二者共同的核心技术底座。数字AI已在语言、视觉等数字信号任务中跑通通用底座,但难以处理物理世界的连续时空与行动反馈。物理AI在数字AI底座上叠加感知、预测和行动能力,两者将在一段时间内并列,分别成为数字世界和物理世界场景的AI解决方案。
Transformer为什么能成为通用底座?
报告指出,Transformer以弱先验的注意力加位置编码替代CNN和RNN的强归纳偏置,支持并行计算与大规模数据训练,从而能够充分利用大算力与大数据。语言、视觉、生成与多模态任务逐步将Transformer作为统一骨干,叠加Scaling规律后,统一模型在能力迁移、研发效率和工程复用上的优势持续扩大,最终收敛为通用基础模型范式。
物理AI与数字AI的本质差异是什么?
两者存在三方面系统差异。表征上,物理世界的连续光子、点云等输入缺乏天然通用Token,需要BEV、占用网络、VAE等重型网络自主构建表征;数据上,物理AI最需要的长尾、极端与事故场景天然稀疏,采集成本高且有安全风险;学习范式上,物理AI模仿的是平均人类司机,而目标要显著超越人类,必须依赖强化学习持续试错。
世界模型在物理AI中起什么作用?
世界模型在物理AI中承担三重角色:一是通过预测未来提供自监督信号,在潜在空间训练物理世界表征;二是作为数据工厂,生成长尾、极端和Corner Case场景,弥补真实数据稀疏的不足;三是为强化学习提供可控、可重置、可注入危险事件的高保真试错环境,使模型能在闭环中反复试验和迭代,是突破物理AI瓶颈的核心抓手。
智能驾驶为什么是物理AI的代表场景?
智能驾驶需要在连续、实时、安全约束的三维空间中完成感知、决策与行动,完整覆盖物理AI的感知—行动—反馈—优化闭环。报告以智能驾驶为样本梳理了数字AI能力向物理AI迁移的层级,从BEV、UniAD等架构理念到Waymo EMMA、理想MindVLA等模型迁移,均体现了物理AI的技术演进路径。同时,智能驾驶的商业化需求迫切,成为最先跑通闭环的代表场景。
报告中的代表性数据
证明自动驾驶安全性所需路测里程
2016年(RAND研究),RAND公司情景测算显示,要在95%置信度、±20%精度下证明自动驾驶致死率达标,约需88亿英里路测里程,以百辆车规模车队计算需要数百年。该数据说明物理AI真实路测数据获取的瓶颈,凸显世界模型生成合成数据的必要性。
DeepSeek-V3模型总参数与激活参数
2024年发布,DeepSeek-V3采用混合专家架构,每个Token仅激活一小部分专家,将模型容量与单次推理算力解耦。该数据用于说明云端大模型通过稀疏激活降低推理成本,为车端部署提供技术基础。
华为乾崑ADS4云端世界引擎难例密度
2026年报告披露,华为乾崑ADS4以云端世界引擎的难例扩散模型生成场景,难例密度可达真实世界的约1000倍,为强化学习提供高密度危险场景训练环境,说明世界模型在数据制造与闭环训练中的价值。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整报告包含AI系列深度报告的框架说明与主线三问,帮助读者理解AI全景图与系列研究思路,建立从数字AI到物理AI的统一概念坐标系。
- 包含数字AI两次爆发的详细技术复盘,涵盖CNN、RNN、Transformer等架构演进、Scaling Law六阶段演进、语言、视觉、生成、多模态四大智能领域的技术时间轴与代表成果。
- 包含数字AI能力向物理AI迁移的完整框架,梳理从架构理念到模型迁移的层级,并以表格形式对比数字AI与物理AI在表征、数据、学习范式上的系统性差异。
- 包含VLA(视觉-语言-动作)模型的详细分析,介绍四大阶段演进、三大核心模块,并对比Waymo EMMA、理想MindVLA、小鹏、元戎启行、千里科技等代表性厂商的技术路线与公开指标。
- 包含物理世界表征演进的完整主线,从原始像素、BEV、Occupancy、矢量化到多模态Token与潜在状态,并分析BEV、占用网络、VAE、3D编码器等重型网络作为物理AI分词器的作用。
- 包含世界模型作为数据工厂的深入讨论,介绍生成式世界模型的发展时间轴、Corner Case制造的两类思路(外生受控生成与内生问题驱动生成),以及各厂商的实践案例。
- 包含强化学习在物理AI闭环中的角色分析,梳理特斯拉、小鹏、理想、Momenta、地平线、华为、Waymo、小马智行等厂商的端到端+世界模型+强化学习技术布局。
- 包含云端训练与车端部署的时延分工与压缩方法,介绍云端稀疏激活、KV缓存压缩、视觉Token剪枝等算法优化,以及车端模型蒸馏、快慢双系统、量化推理等工程手段,并附主流车端算力平台对比。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





