详解新一代开启辅助驾驶详解新一代开启辅助驾
2026-07-01
辅助驾驶,究竟如何才能抵达自动驾驶的终局?
伴随着新一代 SU7 上市,其搭载的 Xiaomi HAD 小米辅助驾驶软硬件同步升级,给出了一条来自小米汽车的解题新思路。
硬件不分高低配,新一代 SU7 全系「满配」高规格辅助驾驶硬件: 700TOPS 算力 Thor 芯片,激光雷达、4D 毫米波雷达、11 个高清摄像头以及 12 个超声波雷达,标准版的配置就堪比行业 Max,甚至 Ultra 版,为辅助驾驶体验提供坚实的基础。
软件升级新架构,新一代 SU7 全系升级小米 XLA 认知大模型: 具备更多模态、更高效、更可控三大特点,通过让系统开始具备理解世界的能力,从而持续扩展系统的能力边界,标志着小米辅助驾驶正式从「数据驱动」迈入「认知驱动」的新范式。
01
为什么要升级到「认知驱动」?
相信用过辅助驾驶的朋友可能都有一种微妙的感受:即便「端到端」系统在很多常见路况下都表现得挺不错了,但跟人类老司机相比,机器开车的整体体验还是差一截火候。我们认为,老司机和机器的核心区别就在于「是否具备对真实世界的认知」。
传统的端到端技术高度依赖模仿学习,通过输入海量视频 Clips 让机器模仿人类的开车行为,这也就是所谓的「数据驱动」。
「数据驱动」类似「背诵题库」,学习过的场景系统就能快速掌握,但遇到陌生场景就很难「举一反三」。而真实路况复杂多变,施工改道、临停占道、行人横穿……每天都有无数个"系统从未见过的"长尾场景在发生。我们无法穷尽物理世界的所有情况来让系统充分学习,因此传统的端到端也注定无法解决所有问题。辅助驾驶要想继续进步,就必须跨越「死记硬背」的阶段,学会像人类一样认知世界,并基于认知做出思考与推理。
02
如何让辅助驾驶具备「认知」能力?
在回答这个问题之前,先来聊聊时下最热门的具身机器人。前不久,我们发布了一段小米机器人在汽车工厂「实习」的视频。视频中,机器人代替工人,连续从自动送钉设备中精准抓取自攻螺母,并准确放置在定位工装上。这种高精度的物理交互,体现的正是机器的「认知与空间推理能力」。
(视频待上传,大小限制)
我们很早就察觉到了这一点,并把「室内机器人精细操作」和「室外辅助驾驶任务」进行混合训练,得到了一个统一的物理 AI 基座模型——Xiaomi MiMo-Embodied 具身基座大模型。这种创新性的训练方式产生了强大的跨域协同效应,大幅提升模型整体的空间感知与空间推理能力。截至2026年4月实验数据证明,在涵盖辅助驾驶与具身机器人感知、决策、规划等 29 项核心基准测试中,Xiaomi MiMo-Embodied 取得了领先的成绩,打造了开源具身基座模型的新标杆。基于这一基座模型,小米辅助驾驶升级了全新的车端架构:Xiaomi XLA 认知大模型。
03
为什么是 XLA,而不是 VLA?
人类驾驶,实际上是一个多模态感知与复杂推理的过程。除了视觉,我们还会依靠听觉去捕捉环境音,依靠身体的体感去感知加减速的惯性,更会调动大脑中海量的记忆与经验。参考这一理念,我们将行业主流的 VLA 技术扩展成为了 XLA 架构。
X 代表着原生支持多模态的数据输入。XLA 架构可以将激光雷达的精准测距、视觉的丰富语义、导航的全局视野、声音的动态反馈、乃至机器人物理 AI 交互数据进行有机融合。
借助多模态输入能力,在新一代 SU7 上,现在动动嘴就能用语音指令控制辅助驾驶的行车、泊车功能。可以说"小爱同学,向左变道"来切换车道,也可以说"小爱同学,离前车远点",不用抬手、不用分心,大幅提升了辅助驾驶的操作便利性。
(视频待上传,大小限制)
从某种意义上说,Xiaomi XLA 让新一代 SU7 具备更丰富的感官输入和更广阔的全局知识,从而更全面地感知复杂的交通环境,更深刻地理解真实的物理世界。
04
为什么 XLA 不显示 CoT 思维链?
如果说「X」赋予了车辆更全面的认知,那么 Xiaomi XLA 的「L」语言,则是开启深度逻辑推理的那把钥匙。传统 VLA 模型在处理 CoT 思维链时面临着一个两难的困境:要么输出大段自然语言文本,严重拖延系统的反应时间;要么干脆去掉语言,无法进行复杂的逻辑推演。但显然,高效和推理都是下一阶段辅助驾驶必须的能力。为了打破这个瓶颈,我们在 Xiaomi XLA 中引入了突破性的潜空间推理(Latent CoT)模式,兼顾了系统低时延和推理能力。简单来说,系统不再需要把思考过程翻译成人类语言,而是在潜空间中直接使用高维机器语言进行推演,从而极大提升了思考速度。
但不显示人类语言,不代表不能了解模型的思考过程。为了避免「端到端」时代的黑盒问题,Xiaomi XLA 依然保留了整个推理过程的可解释性与可追溯性。在需要分析模型思考过程的时候,我们可以把「潜空间推理」解码成人类能看懂的语言。这也是我们平时复盘路测常用的方法,借助这一方法,研发工程师可以清晰了解系统的决策路径,及时发现问题并进行有效修正。
05
小米还会使用世界模型吗?
2025年 11 月,我们在发布 Xiaomi HAD 增强版时曾向大家深入介绍过「强化学习+世界模型」这套机制。当时行业里有很多探讨:未来的辅助驾驶,到底应该选 VLA 路线,还是选世界模型路线?针对这一问题,我们始终认为,VLA 技术与世界模型技术并非非此即彼,而是可以相辅相成。
在 Xiaomi XLA 架构中,我们也无缝接入了「强化学习+世界模型」技术。世界模型就像是一个高保真的模拟器,它负责在虚拟世界中源源不断地生成海量、复杂的驾驶场景;再结合强化学习,在这个模拟器中进行无数试错与策略优化,走错了就扣分,对了就加分,在奖励机制下不断尝试,寻找最好的开车思路,从而让算法实现更高的上限。
借助这套闭环训练机制,我们让系统拥有了持续进化的能力,真正做到越开越稳、越开越像老司机。
06
结语
通过向机器注入「认知」能力,Xiaomi XLA 持续扩展能力边界,小米辅助驾驶由此开启了一个全新的发展阶段。新一代 SU7 交付即搭载 Xiaomi XLA 认知大模型,并且在第一个版本就实现了例如「语音控车」、「商场地库车位级领航」等行业新功能,后续我们将持续迭代体验。
最后,我们也再次呼吁,辅助驾驶不是自动驾驶,驾驶仍需保持专注,始终确保在紧急必要时控制车辆。