引言
视觉-语言-动作(VLA)模型正成为自动驾驶研究的热点,但语言生成对闭环驾驶的实际影响缺乏系统量化。本文揭示语言仅在少数场景有益,却消耗大量计算,由此提出高效语言使用的解决思路。
简介
本文提出 BLUE,一种面向自动驾驶视觉-语言-动作模型更优语言使用的极简方法。通过约 2000 GPU 小时的闭环分析发现,语言生成仅在 14.5% 的路线上显著改善驾驶,在 23.6% 的路线上主动损害性能,而对大多数路线无显著影响。基于预训练 VLA 的隐藏状态已编码语言效用信号这一关键发现,BLUE 在冻结主干上训练轻量门控,逐帧决定是否激活语言生成或直接预测动作。该门控仅 0.11M 参数,无需修改主干网络或额外人工标注。如图1所示,BLUE 大幅减少不必要的语言生成以实现显著加速。
图1:Bench2Drive 路线语言影响分布与推理加速分析。上:路线按语言影响(有益/中性/有害)的分布;下:原始 VLA 与 BLUE 的推理时间分解对比,BLUE 通过减少不必要语言生成实现 2.54 倍加速。方法
本节介绍 BLUE,其利用预训练 VLA 隐藏状态逐帧预测是否激活语言生成。图 3 展示整体框架。
图3:BLUE 方法总览。上:轻量门控接收冻结 VLA 主干的隐藏状态,逐帧决定激活语言生成或直接输出轨迹点;下:门控训练流程,标签由路线级成功率对比推导并经帧级重建细化,视觉编码器与 LLM 主干保持冻结,仅轻量 MLP 门控可训练。图2:全部 44 类 Bench2Drive 场景的语言效应逐场景分布。每根柱代表一个场景,显示语言生成对驾驶成功率有帮助、中性或有害的路线比例。
隐藏状态编码语言必要性。 为预测何时需要语言生成,我们在模型内部寻找信号。我们发现,在 VLA 最后一层隐藏状态上训练的简单逻辑回归即可区分语言有帮助和无帮助的帧,无需依赖任何外部特征。这表明预训练隐藏状态可能已编码语言效用信号,为构建轻量门控提供基础。
数据收集与标注。 我们在训练路线上以两种模式(语言模式和直接动作模式)重复实验,收集每帧最终 token 位置的最后一层隐藏状态 。数据划分细节见附录 C.1,额外标注细节见附录 C.4。该位置对应语言或轨迹点生成开始前模型的表示,两种模式共享以确保特征对齐。更多数据划分和标注细节见附录 C.4.2。每条路线 首先根据成功率差距分配二元标签:
| $$y_r = \mathbb1}\left[\frac{1}{ S | \sum_{s \in S} \left(\text{SR}{(r,s)}^{\text{lang}} - \text{SR}{(r,s)}^{\text{direct}}\right) > \tau\right], \tag{1}$$ |
其中 为随机种子集合,SR 表示成功率, 为边际阈值。该设计默认采用更快的直接动作模式,除非语言显示明确优势。
我们在两个粒度构建训练标签。在路线级标注中,路线 上的每帧共享相同标签 。在帧级标注中,我们进一步细化从语言受益的路线(),仅标记语言模式与直接动作模式行为差异最大的关键区域 。这些区域从行为差异的空间模式中识别。详见附录 C.4.2。帧级标签为:
𝟙𝟙
| 其中 为路线 的跨种子语言优势, 为帧 的空间坐标。第一个指示函数选择语言有益路线,第二个将正标签限制于这些路线内的关键片段。训练时混合两种粒度样本,使门控同时学习路线级偏好和帧级激活。为解决时间冗余(如车辆停止时近相同特征),我们将余弦相似度高于 0.99 的连续帧分组为冗余片段,并将长度 的片段下采样至 个代表性样本。 |
门控设计。 门控为单隐藏层 MLP,参数量可忽略,以二元交叉熵损失训练。这一精简设计足以将预训练隐藏状态映射到二元门控决策,同时降低过拟合风险并保持推理开销可忽略。
按需语言使用。 训练后的门控以可忽略开销集成到 VLA 推理流程。每帧模型通过两种模式共享的前向传播计算 。门控输出分数 :若超过阈值 ,模型继续语言生成;否则直接产生动作。阈值 控制推理时门控触发语言生成的选择性。
实验与结果
Bench2Drive 闭环性能。 表1呈现 Bench2Drive 上的主要比较结果。BLUE 在所有方法中取得最高成功率和驾驶得分,成功率达 76.2%,驾驶得分 90.58,超越其主干 SimLingo 及所有其他基线。值得注意的是,BLUE 仅使用单目前视相机、无激光雷达,以极简设置超越了采用六相机、激光雷达或更大可训练参数的方法。
图6:阈值对语言激活比例与成功率的影响。语言使用率随阈值单调递减,阈值在 [0.6, 0.8] 区间可获得强劲成功率。
图5:Bench2Drive 评估路线逐帧平均延迟分布。虚线为总体均值,BLUE 对两个主干均显著降低延迟,分别实现 2.54 倍和 4.50 倍加速。方法 | 传感器 | 成功率 ↑ | 驾驶得分 ↑ |
|---|
TCP | 单目+雷达 | 51.5 | - |
ThinkTwice | 六相机+雷达 | 61.2 | - |
UniAD | 六相机+雷达 | 71.8 | - |
SimLingo | 单目 | 67.3 | 88.2 |
BLUE | 单目 | 76.2 | 90.6 |
表1:Bench2Drive 主要结果比较
多能力细分。 表2进一步报告 Bench2Drive 多能力细分结果。BLUE 平均能力得分排名第二,接近最优方法(该方法依赖六相机),在超车和紧急制动方面有明显提升。
能力 | BLUE | 最优六相机方法 |
|---|
直行 | 92.3 | 94.1 |
转弯 | 78.5 | 79.2 |
超车 | 85.7 | 76.4 |
紧急制动 | 91.2 | 82.6 |
平均 | 86.9 | 88.1 |
表2:Bench2Drive 多能力细分(部分)
Longest6 v2 闭环结果。 表3呈现长程基准 Longest6 v2 的结果。BLUE 在所有比较方法中取得最高驾驶得分 36 和路线完成度,同时所需 GPU 小时大幅减少,表明 BLUE 有助于在长距离上保持稳健驾驶。
方法 | 驾驶得分 ↑ | 路线完成度 ↑ | GPU 小时 |
|---|
LBC | 18 | 42% | - |
ROACH | 24 | 58% | - |
SimLingo | 28 | 65% | 48 |
BLUE | 36 | 78% | 12 |
表3:Longest6 v2 长程基准结果
推理效率。 如表4所示,BLUE 相比 SimLingo 实现 2.54 倍加速,平均延迟从 1.40 秒降至 0.55 秒,在所有比较方法中延迟最低。门控本身为单隐藏层 MLP,增加开销可忽略。
方法 | 平均延迟 (s) | 加速比 |
|---|
SimLingo | 1.40 | 1.00× |
CriticVLA | 3.42 | 1.00× |
BLUE (SimLingo) | 0.55 | 2.54× |
BLUE (CriticVLA) | 0.76 | 4.50× |
表4:推理效率比较
门控激活模式分析。 如图4所示,门控跳过大多数帧的语言生成,但激活时形成连续片段而非孤立帧,表明其从隐藏状态中捕捉了时间相干模式。图5显示所有评估路线的逐路线延迟分布,BLUE 将整个分布移向更低延迟。
图4:门控学习到的语言激活模式。每列代表一条路线,按路线级语言收益分组,颜色编码各进度区间内语言生成激活的帧比例,门控以稀疏且连续的方式激活语言。跨模型泛化性。 将 BLUE 应用于 CriticVLA 时,Bench2Drive 和 Longest6 v2 上各项指标全面提升,尤其在 Longest6 v2 路线完成度上提升显著,所得系统超越所有其他基线。但跨模型迁移实验表明,匹配门控始终明显优于迁移门控,说明每个模型应训练自己的门控。
与基于规则方法的比较。 表7显示,基于车速、加速度或转向角的规则门控,以及基于场景复杂度的门控,均远低于 BLUE,仅获边际提升。随机门控表现更差。这证实 VLA 隐藏状态联合编码感知和上下文信息,是远强于运动学特征或场景复杂度的预测信号。
门控设计敏感性。 表8显示,门控隐藏层维度从 128 增至 256 未带来明显提升,但 dropout 提供显著收益。采用带 dropout 的较小门控为默认配置,以最小化过拟合风险。
阈值敏感性。 图6显示,语言激活比例随阈值 θ 增加单调递减,θ ∈ [0.6, 0.8] 均取得良好结果。θ=0.66 时成功率 76.18%,而 θ 很低时降至 66.91%,θ 很高时为 69.55%,确认门控产生校准良好的分数。
训练数据规模影响。 如图7所示,随着训练数据从 10% 增至 100%,成功率和驾驶得分稳步提升,仅使用一半数据时已超越 SimLingo 主干,表明语言效用信号可从中等规模数据学习。
图7:训练数据规模对门控性能的影响。成功率与驾驶得分随训练数据增加快速提升后趋于饱和。语言影响的一致性。 表9显示,在标注粒度(简洁)、语言(汉语)和主干网络(CriticVLA)变化时,语言仅在少数路线有益、部分有害、大多数无影响的模式保持一致,支持 BLUE 向不同 VLA 模型扩展。
类别 | 设置 | 有帮助 | 中性 | 有害 |
|---|
原始 | SimLingo | 14.5% | 61.8% | 23.6% |
粒度 | 简洁 | 21.8% | 52.7% | 25.5% |
语言 | 汉语 | 18.6% | 58.2% | 23.2% |
模型 | CriticVLA | 19.5% | 52.3% | 28.2% |
表9:不同设置下的语言有用性分布
结论
本文提出 BLUE,一种面向自动驾驶 VLA 模型的高效语言使用极简方法。核心发现是:预训练 VLA 的隐藏状态已编码语言效用信号,仅凭场景复杂度或运动学特征难以预测。基于该发现,BLUE 以仅 0.11M 参数的门控逐帧决策是否生成语言,在 Bench2Drive 上达到 76.2% 成功率,在 Longest6 v2 上达到 36 的驾驶得分,均创下新的最优水平,同时实现 2.54 倍推理加速。结果表明,VLA 驾驶中更好的语言使用并非来自生成更多语言,而是仅在语言能提升性能时生成语言。BLUE 为高效语言增强自动驾驶提供了实用路径,证明 VLA 模型能以极低成本保留语言优势。
文章转载自公众号:数源AI