一条人类数据没用实现SOTA,小米L3智驾模型封神了

博主:fm5i0dxdb2j0考研资深辅导 2026年09月08日 11:42:25

人类不再是 AI 的老师,反而成了制约和累赘???

这一天迟早会来,但没想到来的这么快:

王乃岩——首个将深度学习应用于目标追踪的学者、深度学习框架 MXNet 的核心开发者,曾任图森未来联合创始人及中国 CTO、也是小米 L3 自动驾驶负责人——带领团队刚刚做出了一项里程碑、转折点意义的 SOTA 成果:

让 AI 自己学会开车,然后教给 AI史上第一个不依赖任何人类数据,却全面超越人类的端到端系统——

不是老张的激进风格,也不是老李的保守路线,AI 自己知道该怎么开。

而且,在标准化测试中,它开得比人类司机还稳、还顺、还安全。

怎么做到的?用一句话概括就是:让适合学开车的东西学开车,让适合看路的东西看路,最后让会看路的东西学会开车。

要解决什么问题,解决的怎么样?

目前绝大多数端到端自动驾驶系统,走的都是模仿学习路,也就是让模型看大量人类驾驶的视频和轨迹数据,然后学着复制人类在不同 case 下的操作。

这条路有两个根本性的天花板。

第一,你永远无法超越老师。 模型最多学到和人类司机一样好,但不可能比人类更好。因为监督信号的上限就是人类轨迹的质量。

第二,人类日志覆盖不了所有场景。 每个场景只记录了一条轨迹——人类实际走的那条。但现实中,同一个路口,左转、右转、直行都可能合理。更麻烦的是,紧急避让、失控恢复这类关键场景在日志里极其稀少。一旦模型遇到训练数据里没见过的状态,误差就会累积放大,越开越偏。

这就是 DriveZero 要打破的困局。

先看解决的结果,论文在三个难度递进的 benchmark 上给出了答案。

NAVSIMv1 是伪闭环评估,基于真实数据回放,考验模型在给定场景下的规划质量:

DriveZero-Scale 拿到 95.3 PDMS,超越人类驾驶员的 94.8——这是历史上第一次有端到端模型在这个榜单上超过人类

NAVSIMv2 加了第二阶段的难度:用高斯溅射技术对自车状态加入扰动,考验模型在感知不完美时的鲁棒性:

DriveZero-Scale 达到 57.1 EPDMS,不仅碾压所有纯视觉方案,甚至超过了使用真实符号输入的 PDM-Closed。

HUGSIM 是真正的闭环仿真,车辆在逼真的虚拟环境中实时决策。DriveZero 在没有做任何 HUGSIM 数据微调的情况下零样本迁移,平均 HD-Score 达到 46.6,比前一任 SOTA 高出 8.1 分:

三个 benchmark 的含金量在于它们覆盖了从 " 离线规划质量 " 到 " 带扰动的鲁棒性 " 再到 " 真实闭环交互 " 的全链路评估。

能在三个维度同时拿到 SOTA,说明 DriveZero 不是某个指标上微调,而是整体架构的创新。

不靠人却比人还强,怎么做到的?

DriveZero 的架构可以用一个词概括——解耦。

传统端到端是 " 端到端 " 地训练一个模型:图像进去,轨迹出来,所有能力混在一起学。DriveZero 反其道而行:把 " 感知 " 和 " 决策 " 分开,各自用最适合的方式预训练,最后再蒸馏合并

整个系统分三步走。

第一步:教 " 动作模型 " 开车—— DriveRL,是一个特权教师。它不看任何图像,只看结构化信息:周围车辆的位置和速度、地图向量、交通灯状态、自车状态。

DriveRL 用纯强化学习(PPO) 从零开始训练,没有任何模仿学习预热。

训练环境是混合智能体仿真——基于真实的 nuPlan 驾驶日志构建交互世界,背景车辆一部分按日志回放,一部分由 IDM 规则控制,还有一部分由正在训练的同一个策略控制(自博弈)。

DriveRL 就在这样的环境里不断试错,通过奖励函数(安全优先、兼顾效率和舒适)学会开车。

结果是什么?DriveRL 在 nuPlan 六个闭环评估上全部超过 Log-Replay 专家——也就是说,它从零学出的驾驶行为,比生成它训练场景的那些原始日志还要好。

研究还引入了一个测试时搜索(TTS) 机制:用 Critic 网络对多个候选动作做短视距推演打分,只在高分动作显著优于当前策略时才替换执行,正是这个机制让 DriveRL 的平均分从 93.01 提升到 93.57。

第二步,是教 " 感知模型 " 看路—— DriveVFM

这是一个视觉主干网络,负责把摄像头图像变成有意义的特征表示。它的训练方式很特别:不标注任何东西。没有 3D 框、没有车道线、没有分割 mask

DriveVFM 同时蒸馏四个冻结的视觉基础模型—— DINOv3(空间结构)、SigLIP2(语义理解)、SAM(边界和分割)、Depth Anything V2(深度和几何)——把它们的知识凝练到一个统一的 ViT 主干里。

训练数据混合了 LAION、ImageNet 等通用图像和 nuPlan、Waymo 等驾驶场景,所以 DriveVFM 既懂 " 世界长什么样 ",也懂 " 道路长什么样 "。

第三步,蒸馏统一—— DriveZero

现在有了会开车的教师(DriveRL)和会看路的主干(DriveVFM)。怎么把驾驶能力传给视觉模型?

答案是轨迹蒸馏

DriveZero 接收多视角摄像头图像(通过 DriveVFM 编码)和导航指令,输出多条轨迹候选。训练时,对每一个离线日志帧,用冻结的 DriveRL 教师在结构化状态上滚动生成 20 步的未来轨迹,作为学生网络的监督目标。

关键来了:教师是目标条件化的,意思是同一个场景,你可以给教师不同的导航目标(比如 " 前方 50 米左转 "vs" 前方 50 米右转 "),它就能生成完全不同的合理轨迹

这让训练数据的多样性大幅提升——同样的图像、不同的目标,对应不同的监督信号。人类日志做不到这一点,因为日志里只记录了一条轨迹、一个目标。

论文的消融实验证实了这一点:用 DriveRL 轨迹做监督,PDMS 是 93.61,略低于人类轨迹的 93.92;但加上目标增强之后,PDMS 飙升到 94.41,不仅反超人类轨迹监督,还高出 0.49 分。

整个流程串起来就是:

在结构化仿真环境里用强化学习训出一个超强的 " 闭眼开车 " 教师→

在海量图像上蒸馏四个基础模型训出一个超强的 " 睁眼看路 " 视觉主干→

用教师在不同目标下滚动的轨迹作为监督信号,把驾驶能力蒸馏给视觉学生。

最终得到一个只靠摄像头就能开车的端到端模型,而且比人类开得更好。

最后总结一下,DriveZero 最核心的创新可以这样理解:

把 " 驾驶技能 " 和 " 视觉理解 " 当成两种不同的能力,分别用最合适的算法和数据去训练,再通过蒸馏合二为一。

驾驶技能需要试错和闭环反馈——强化学习最合适;视觉理解需要海量多样化的图像——特征蒸馏最合适。

强行端到端地同时学这两件事,互相牵制。分开学,各自发挥到极致,再合并,反而突破了各自的天花板。

复杂长程物理任务,AI 首次超越人类

不依靠人类数据,首次超越人类能力——尽管数值超越不算多,但这样的 SOTA 本身如何 mark 都不为过。

从技术路径来看,DriveZero 的核心贡献在于验证了一条可规模化的训练范式。

传统端到端依赖大量标注数据(3D 框、车道线、分割)和人类驾驶日志,成本极高且扩展性有限。

DriveZero 的感知不需要不需要任何人类轨迹,唯一需要的是仿真环境和图像——这两样东西都可以低成本、大规模地获取,数据飞轮真正转起来了

其二,它打破了 " 模仿学习天花板 " 的认知。 业界长期默认 " 先模仿人类、再用 RL 微调 " 是自动驾驶的最平衡、高效、可靠路径。

但 DriveZero 证明:从零开始的纯 RL,配合设计良好的仿真环境和奖励函数,可以直接学到超越人类的驾驶策略——然后再把这个策略蒸馏给视觉模型模仿学习不再是必经之路

放到更大的视野里,DriveZero 的意义其实超越自动驾驶。

它是 " 物理 AI" 和 " 具身智能 " 训练范式的一个示范。

任何需要在物理世界中行动的智能体——机器人、无人机、工业机械臂——都面临同样的困境:在真实世界里试错成本太高、风险太大;在仿真世界里学到的策略又难以迁移到真实感知输入上。

DriveZero 的 " 三阶段 " 解法——仿真中强化学习掌握技能 → 真实图像上预训练感知 → 蒸馏把技能迁移给感知模型——提供了一个通用框架:

把 " 决策智能 " 和 " 感知智能 " 解耦,各自在最合适的环境里学习,最后再融合。

这对于任何 " embodied AI " 场景都有借鉴意义。

更根本的启示在于:智能体不应该只通过观察人类来学习如何行动。

DriveZero 始于一个朴素的观察:人类演示从来不是智能的唯一来源,甚至未必是最好的来源。

AlphaGo 当年没有去模仿人类棋谱,而是通过自我对弈从零开始,最终下出了人类棋手从未见过的手法。

DriveZero 在驾驶场景里验证了同样的逻辑,这个结论在围棋棋盘上成立过,在驾驶场景里也成立了一次。

所以现阶段定量看,DriveZero 不像 AlphaGo 超越人类的程度那般震撼,但本质同一件事:——让系统自己探索、试错、优化,不再被人类数据的天花板所束缚,它就能触及人类从未到达的高度。

而除了自动驾驶之外,这套方法论的边界还能推到多远?

王乃岩的下一步,值得多看几眼

—  联系作者  —

—    —

【智能车参考】原创内容,未经账号授权,禁止随意转载。

点这里关注我,记得标星,么么哒~

The End