报告概述

本报告系统定义了物理AI——一种能感知、理解并在真实物理世界中执行复杂操作的模型,被视为人工智能从虚拟智能迈向具身智能的关键桥梁。报告覆盖基础模型层(VLA、VLM、世界模型)、工具层(仿真平台、工业软件)以及两大核心应用场景(智能驾驶与人形机器人),采用“大脑—身体—环境”三层产业链框架,并梳理了海内外厂商的布局路径。报告旨在帮助读者理解物理AI的技术收敛趋势、产业生态格局以及数据-模型飞轮的商业逻辑,为关注具身智能、机器人及自动驾驶领域的投资者提供参考。

报告的核心结论

VLA、VLM与世界模型三条技术路径加速收敛

基础模型层呈现VLM负责长程规划与慢思考,VLA将指令直接转化为动作,世界模型则作为后台数据工厂生成合成训练数据的格局。三者协同构成物理AI的完整技术栈,英伟达凭借仿真平台、世界模型及基座VLA占据领先地位。

海外由英伟达主导生态,国内则由人形机器人厂商主导模型

英伟达凭借Omniverse/Isaac、Cosmos及GR00T等全栈工具,力图构建“机器人安卓”平台;国内人形机器人厂商如智元、银河通用等自建基础模型团队,大厂仍在追赶,路径差异源于算力分配与硬件能力。

仿真平台与工业软件是物理AI工具层中被低估的核心环节

高质量仿真平台是基础模型训练的关键数据来源,英伟达Omniverse/Isaac主导市场,国内智元Genie Sim等开源生态加速追赶。物理AI同时从仿真训练和数字孪生两个维度拉动工业软件需求,英伟达已与Cadence、西门子等五大巨头深度合作。

智能驾驶与人形机器人两大场景加速数据-模型飞轮构建

车企从端到端切换至VLA/世界模型路线,小鹏、华为、理想等采用VLA方案;人形机器人进入量产阶段,Figure、Tesla、智元等厂商推动数据闭环,随着部署量提升,模型有望进入“数据增长—模型迭代—能力提升—场景扩张”的正反馈循环。

报告回答的关键问题

什么是物理AI?它与生成式AI有何不同?

物理AI由黄仁勋于2024年提出,指能感知、理解并在真实物理世界中执行复杂操作的模型,覆盖人形机器人、智能驾驶和工业机器人三大场景。与生成式AI相比,物理AI的训练数据成本高昂(真机数据采集),输出为连续动作空间,需要毫秒级响应,安全责任更重,商业模式以卖硬件+服务订阅为主。

VLA、VLM和世界模型在物理AI中分别扮演什么角色?

VLM(视觉语言模型)作为长程规划的“大脑”,负责视频理解与高层任务规划;VLA(视觉语言动作模型)充当“小脑+脊髓”,将指令直接转化为关节级动作;世界模型作为后台数据工厂,生成合成训练数据与仿真环境,为下游模型提供低成本训练与闭环评估。三者协同构成完整的技术栈。

国内物理AI基础模型的发展路径与海外有何不同?

海外由英伟达主导全栈生态,Google、Figure AI等多家布局;国内则由人形机器人公司(如智元、宇树)主导基础模型研发,大厂(字节、腾讯等)主要提供大模型支撑。原因在于国内大厂算力和注意力集中于AGI路线,而人形机器人公司技术融资能力强,自建模型团队。

物理AI催生了哪些工业软件需求?

物理AI从两个维度拉动工业软件:一是仿真训练直接需求,物理AI训练需要CAE求解器提供精确物理一致性,每台部署设备对应数千小时CAE仿真;二是数字孪生规模化落地,用于机器人在真实工厂部署前先在数字孪生中迭代。英伟达已与Cadence、达索、PTC、西门子、Synopsys等合作,将CUDA-X、Omniverse注入工业软件生态。

报告中的代表性数据

智元机器人累计下线10000台;宇树科技2026年目标1-2万台;Figure BotQ产能12000台/年;Tesla Optimus自用部署1000+台;Boston Dynamics 2026年产能售罄

人形机器人厂商2026年累计部署量级

2026年,各厂商公布的人形机器人累计部署或产能目标,反映量产加速趋势,数据来源为厂商发布信息。

12倍

理想汽车MindVLA-o1推理效率提升

2026年,理想汽车在NVIDIA GTC 2026上公布的VLA方案,推理效率提升12倍,响应时延小于80ms。

2亿个预训练视频片段

英伟达Cosmos-Predict 2.5世界基础模型预训练数据规模

2026年,英伟达Cosmos-Predict 2.5版本包含2B/14B参数,使用2亿个预训练视频片段加后训练数据。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 物理AI的定义与边界详解:对比生成式AI与物理AI在训练数据、输出空间、推理延迟、评估体系等方面的差异,明确物理AI覆盖人形机器人、智能驾驶、工业机器人三大场景及其商业成熟度。
  • 人工智能、具身智能与物理AI的关系图谱:通过图表展示AI与机器人技术如何交汇形成具身智能,以及物理AI作为“感知—理解—执行”闭环的核心桥梁。
  • 物理AI产业链全景图:按“大脑(基础模型)—身体(硬件)—环境(工具与应用)”三层划分,梳理各层级的关键参与方与技术节点。
  • VLM、VLA与世界模型三者的技术原理与代表性项目:详细分析NVIDIA Cosmos Reason、Google RT-X、Figure Helix等模型的架构,以及世界模型的三种技术路线(视频生成、3D生成、物理引擎混合)。
  • 海外厂商布局深度对比:用表格列出NVIDIA、Google、Figure AI、Physical Intelligence、Tesla等公司的核心模型、数据策略与商业模式,突出英伟达的“机器人安卓”战略。
  • 国内厂商基础模型布局:介绍智元机器人、银河通用、宇树科技、星动纪元、字节跳动、商汤、腾讯、阿里等公司的模型与工具,分析国内大厂与人形机器人公司路径差异的原因。
  • 智能驾驶领域从端到端到VLA/世界模型的演进:详细分析小鹏第二代VLA、华为乾崑ADS 5、理想MindVLA-o1、蔚来NWM、小米XLA、百度Apollo 11.0、特斯拉FSD V14.3等技术方案,包括架构亮点与性能指标。
  • 人形机器人量产进度与数据飞轮建设:以Figure、Tesla、智元、宇树、Boston Dynamics等厂商为例,给出2026年部署量与关键数据节点,解析“产能即数据”的逻辑。
  • 仿真平台核心能力深度解析:介绍物理引擎、渲染引擎、生成式数据引擎的技术门槛,以及英伟达Omniverse/Isaac工具生态(Isaac Sim、Isaac Lab、Cosmos系列、OSMO、GR00T Blueprint等)的详细功能。
  • 国内仿真平台与工业软件合作生态:涵盖智元Genie Sim 3.0、华为SIM Space、COMSOL、51Sim、索辰开物等平台,以及英伟达与Cadence、达索、PTC、西门子、Synopsys在CAE、数字孪生、EDA等方面的联合创新案例。
  • 完整风险提示:包括AI技术变革不及预期、政策落地不及预期、行业竞争加剧及研报信息更新不及时等风险。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告