3. NVIDIA 的 Alpamayo 2 Super 把视觉、因果解释与轨迹生成塞进 34B 自动驾驶 VLA

发生了什么:NVIDIA 在官方技术文章中发布 Alpamayo 2 Super。窗口内资料显示,它是用于自动驾驶的视觉语言行动(VLA)模型,规模为34B 参数,由32B 视觉语言主干2.3B 扩散行动解码器构成,可从多相机视频生成规划轨迹、因果解释和元行动;采用 OpenMDW-1.1 许可,可商业使用。

为什么重要:自动驾驶和机器人不缺“看懂画面”的模型,也不缺单独的控制模块;难处在于如何把感知、对场景的解释和下一步动作连成可评估的链路。Alpamayo 2 Super 同时输出轨迹与解释,意味着它不仅试图做驾驶策略,也试图成为离线教师、评估器或数据引擎。

具体证据:官方文章强调多相机视频输入、轨迹预测、因果推理和场景问答;窗口内另一篇报道还提到其可处理长尾事件,并给出了 LingoQA、AlpaSim 的基准表现描述。与此同时,NVIDIA 的世界动作模型文章把同样的思路延伸到机器人操作:先理解世界动态,再进行动作后训练。

编辑判断:物理 AI 的价值不会由“模型会不会描述画面”决定,而由它能否在数据闭环中帮助生成、检查和改进动作决定。把可解释轨迹作为输出,是朝这一工程闭环迈出的一步;其安全性与真实道路泛化仍需独立测试,而不能仅凭基准或发布材料下结论。

高密度快讯

3. NVIDIA 的 Alpamayo 2 Super 把视觉、因果解释与轨迹生成塞进 34B 自动驾驶 VLA | AI 趋势