报告概述

本报告由DeepRoute.ai在NVIDIA GTC 2026发布,核心阐述如何通过统一的基础模型(Foundation Model)推动自动驾驶迈向L5。报告围绕三大主题展开:模型缩放——构建40B参数的视觉-语言-动作(VLA)基础模型,作为统一的驾驶员、分析员和评判员;数据缩放——利用基础模型驱动数据闭环,将200K辆车的接管数据高效转化为训练样本,实现从5天到12小时的10倍加速;仿真——通过3D重建、风格迁移和物体插入技术生成长尾场景,并借助强化学习优化策略。报告揭示了传统数据闭环的瓶颈,展示了端到端视频预测预训练、分阶段训练(预训练、中训练、后训练)以及实时推理KV缓存等关键技术路径,为行业提供了从规模法则迈向L5的可行方案。

报告的核心结论

模型与数据缩放速度决定L5进展

报告指出,迈向L5的速度等于模型缩放速度乘以数据缩放速度。当前行业虽已采用端到端方案,但L5时间表不断推迟,根本原因在于模型容量不足(小模型饱和)和数据管道依赖人工、无法规模化。DeepRoute.ai通过统一基础模型同时解决两大瓶颈:40B VLA模型提供足够容量,FM驱动的数据管道将迭代周期从5天压缩至12小时,形成模型×数据的飞轮效应。

基础模型是数据管道的核心引擎

传统数据闭环中,问题发现、根因分析、数据挖掘、标注、训练和评估每个节点都依赖人工或规则,效率低且不随迭代积累。DeepRoute.ai用同一个基础模型赋能所有环节:自动诊断接管原因、AI挖掘高价值片段、链式思维(CoT)自动生成标注、动作评分替代人工审查。这一变革使原始数据到高质量训练样本的转化效率提升10倍以上,且每次迭代产生的标注数据可直接用于模型中训练。

仿真生成是解决长尾场景的终极手段

低频高风险的长尾场景无法等待自然发生。报告展示了基于NVIDIA开源工具链的3D场景重建(3DGUT+修复器)以及Cosmos风格迁移和DiPIR插入式编辑,可系统生成夜间、雨雪、眩光等天气变体,以及行人、骑车动物等突发障碍物。这些合成数据保留了真实几何与语义标签,用于后训练中的强化学习优化,使模型在极端边缘情况下做出更安全、精准的决策。

统一VLA模型兼顾驾驶、分析与评判

40B VLA基础模型通过分阶段训练统一三种角色:作为驾驶员输出动作序列,作为分析员/评判员对驾驶行为进行推理、评分和解释。其训练流程包括大规模视频预训练(预测每一像素,利用100%数据监督)、视觉-动作中训练(学习驾驶技能)、视觉-语言-动作中训练(加入结构化推理),以及后训练的强化学习策略优化。实时推理中通过KV缓存、MTP和量化加速,达到10-15Hz闭环控制,满足量产需求。

报告回答的关键问题

为什么当前端到端自动驾驶难以达到L5?

报告认为传统端到端自动驾驶虽然正确,但执行速度是瓶颈。具体表现为两个障碍:模型容量不足(小模型饱和,加入更多数据不再提升),以及数据管道依赖人工和规则,每个节点(挖掘、诊断、标注、评估)都需要人工参与,导致闭环迭代缓慢(超过5天)。DeepRoute.ai的解决方案是用一个40B VLA基础模型同时解决模型缩放和数据缩放,将迭代速度提升10倍,从而加速L5进程。

VLA基础模型如何实现实时推理?

VLA模型在推理时每次步进包括视觉编码(约30ms)、推理生成文本(15-40ms)和动作生成(约15ms),总计60-85ms。为达到10-15Hz的实时控制,报告采用了KV缓存避免历史重复计算、多令牌预测(MTP)以及量化加自研推理引擎调优。整个系统在500 TOPs以上的计算平台上运行,可实现毫秒级的闭环决策。

如何利用仿真生成自动驾驶长尾数据?

报告展示了两种方法:一是利用NVIDIA 3DGUT进行高保真3D场景重建,并通过修复器自动修复伪影,生成新视角(如纵向制动避让、横向绕行避让);二是结合NVIDIA Cosmos风格迁移(将白天场景转为夜间/雨/雪/眩光)和DeepRoute DiPIR插入式编辑(在真实数据中插入3D模拟的突然障碍物如行人、骑车动物),系统化生成难以捕获的长尾风险场景。这些合成数据保留了真实几何与语义,可直接用于后训练强化学习。

报告中的代表性数据

200,000辆

已交付车辆数

截至2026年GTC,DeepRoute.ai截至演讲时已有20万辆车交付,作为数据飞轮的起点,目标向100万辆迈进。

13亿+公里

实际道路测试里程

截至2026年GTC,报告显示累计真实世界行驶里程超过13亿公里,用于基础模型验证与迭代。

从5天以上缩短至12小时

数据管道处理时间压缩

对比传统与FM驱动管道,传统数据闭环(人工挖掘、诊断、标注、训练、评估)耗时超过5天(100+小时),而基础模型驱动的全自动化管道将时间压缩至12小时,实现10倍加速。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整报告包含40B VLA基础模型的四阶段训练细节(预训练视频预测、中训练A/B/C阶段、后训练RL策略优化),以及每阶段的数据规模、模态组合和训练目标。
  • 实时推理系统的延迟分解表(视觉编码30ms、推理15-40ms、动作生成15ms)以及KV缓存、MTP、量化等加速技术原理。
  • 传统数据管道与FM驱动管道的对比流程图,展示从问题发现到模型部署各节点的角色变化,以及时间消耗对比。
  • 数据挖掘、接管诊断、链式思维标注、动作评分四项任务中,规则/专用模型、SOTA大语言模型与DeepRoute FM的召回率、准确率、人机一致性、相关性等指标对比柱状图。
  • 3D场景重建(3DGUT+修复器)的原始视图与新视角(纵向制动、横向绕行)效果图,以及Cosmos风格迁移和DiPIR插入编辑的示例图像。
  • 后训练强化学习(RLCS)的框架图,说明FM驾驶员生成多个轨迹、FM评判员评估推理-动作一致性、规则奖励函数联合优化边缘案例。
  • 从基础模型到产品线的映射图,展示不同计算平台(100 TOPs/500 TOPs/更大)对应的VA与VLA模型,以及Robotaxi、城市NOA等具体应用。
  • 报告总结了从20万辆到100万辆的规模化路径,强调统一基础模型作为产品引擎和数据引擎的双重角色,最终通过接管率归零实现L5。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告