1. 简介

自动驾驶技术正迎来一个全新的发展阶段。来自UCLA的研究团队在2025年6月发布了一项突破性研究成果——AutoVLA(Adaptive Vision-Language-Action Model),这是一个专为端到端自动驾驶设计的视觉-语言-动作模型。该模型成功地将自适应推理能力与强化微调技术相结合,为解决当前自动驾驶系统面临的复杂决策问题提供了全新的解决方案。
在这里插入图片描述

图1:AutoVLA是一个基于视觉-语言模型的端到端自主驾驶框架,它将世界知识融入驾驶策略。该框架以视觉观测、车辆状态和语言指令作为输入,并结合链式推理(CoT reasoning)和物理动作标记化(physical action tokenization)直接生成规划轨迹。该模型通过监督微调进行训练,以共同学习推理和动作,并进一步应用强化微调,以实现通过快速和慢速思维模式的自适应推理,从而提高性能和效率。

随着大语言模型技术的快速发展,视觉-语言-动作(VLA)模型在自动驾驶领域展现出了巨大的潜力。这类模型通过利用丰富的世界知识和强大的推理能力,为端到端自动驾驶系统带来了新的希望。然而,现有的VLA模型在实际应用中仍然面临诸多挑战,包括动作输出的物理可行性问题、模型架构的复杂性以及推理效率的优化等。

AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning》的出现正是为了解决这一核心矛盾,它能够根据驾驶场景的复杂程度自适应地选择推理模式,既保证了决策的准确性,又确保了系统的实时性能。模型通过统一的自回归生成框架,将推理和动作生成融合在同一个架构中,避免了传统方法中多模块级联可能带来的问题。代码可以等一波开源:Github

在这里插入图片描述

图2:用于端到端自动驾驶的四种视觉语言模型(VLMs)范式。与其他方法相比,我们提出的基于视觉语言架构(VLA)的范式使得从视觉输入直接进行轨迹规划和自适应推理成为可能。通过将物理动作的标记化融入语言模型,我们的模型有效地整合了高层次的场景推理和低层次的轨迹规划。

2. 主要贡献

2.1 统一的自回归生成框架

AutoVLA的首要贡献在于提出了一个统一的自回归生成框架,该框架巧妙地将场景推理与轨迹规划融合在同一个模型架构中。这种设计突破了传统方法中推理与行动分离的局限性,使得模型能够在理解场景的同时直接生成可执行的驾驶轨迹。该框架采用统一的自回归Transformer解码器,能够同时处理视觉和文本输入,并生成相应的推理和动作token。这种统一性不仅简化了系统架构,更重要的是保证了推理过程与行动决策的一致性,避免了传统多模块方法中可能出现的信息丢失和延迟问题。

2.2 连续轨迹的离散化token化方法

在技术创新方面,研究团队引入了连续轨迹的离散化token化方法,将复杂的连续轨迹规划问题转化为语言模型擅长的序列生成任务。具体而言,模型将连续车辆轨迹离散化为一系列物理动作token,每个token代表短期空间位置和航向运动(∆x, ∆y, ∆θ)。通过K-均值聚类方法构建包含2048个离散动作token的车辆运动码本,涵盖了绝大多数车辆运动模式。这种创新性的表示方法使得大语言模型能够直接处理物理世界的运动规划问题,为AI模型在具身智能领域的应用开辟了新的可能性。

2.3 自适应推理机制

AutoVLA另一个重要贡献是实现了自适应推理机制,模型具备了"快速思维"和"慢速思维"两种工作模式。在快速思维模式下,模型直接预测物理动作token而无需生成冗长的推理步骤,从而能够在简单场景中快速响应。相比之下,慢速思维模式涉及结构化的思维链(CoT)推理,其中模型首先分析环境,识别关键要素,推理潜在结果,然后再决定最终的驾驶行为。这种双重思维能力的实现,使得模型能够根据场景复杂度自适应地选择合适的处理策略,真正做到了智能化的资源分配。

2.4 强化学习的创新应用

此外,研究团队还创新性地将强化学习引入到视觉-语言-动作模型的训练过程中。通过基于组相对策略优化(GRPO)的强化微调方法,模型不仅能够优化规划性能,还能学会在不同场景下合理分配计算资源。该方法使用可验证的规划奖励函数,结合思维链长度惩罚机制,实现了自适应推理能力在规划准确性和效率之间的最优平衡。这种强化微调方法不仅提高了规划性能,还通过最大限度地减少不必要的推理来提高运行效率。

3. 相关工作

3.1 端到端自动驾驶

在端到端自动驾驶领域,近年来涌现出了许多重要的研究成果。UniAD和VAD等经典方法通过统一的Transformer架构,将感知、预测、规划等多个驾驶任务整合在一起,显著提升了系统的整体性能。这些方法的核心思想是通过端到端的训练方式,让模型能够学习到从原始传感器数据到最终驾驶决策的完整映射关系,避免了传统方法中多个模块级联可能带来的误差累积问题。

ParaDrive等研究深入探讨了端到端驾驶架构中的必要组件,指出要构建真正智能的自动驾驶系统,必须具备强大的场景理解和推理能力。GenAD和DiffusionDrive等生成式方法虽然在轨迹生成的多样性和连续性方面取得了进展,采用生成模型来保持轨迹连续性并产生多模态驾驶轨迹,但在整合世界知识和处理复杂语义推理方面仍然面临挑战。然而,将世界知识整合到端到端驾驶系统中仍然是一个挑战,主要由于语义推理的瓶颈和在复杂环境中的有限适应性。

3.2 VLA和VLM在自动驾驶中的应用

语义推理和物理动作之间的鸿沟仍然是VLA和VLM在端到端自动驾驶中面临的关键挑战。当前研究大致遵循三个方向:第一个方向是将驾驶问题完全转化为语言中心问题,利用VLM通过标题生成或问答来理解场景。这种方法的优势在于能够利用大语言模型强大的语义理解能力,但难以直接产生可执行的驾驶动作。

第二个方向是利用VLA或VLM生成高级元动作或驾驶决策,然后用于监督或指导传统规划器或端到端模型。虽然这些方法促进了集成,但它们阻止了完全的端到端优化。这种方法在一定程度上解决了语义理解与动作执行之间的鸿沟,但破坏了端到端优化的完整性。

第三个方向,也是最具挑战性的方向,是直接将VLM与动作生成整合到VLA模型中,能够直接预测潜在动作token或最终驾驶轨迹。然而,这些方法中采用的简单轨迹解码器(例如MLP或GRU)可能产生不切实际的轨迹并遭受模式崩溃。为了解决这个问题,ORION将生成式规划器集成到VLM架构中,增强了轨迹可行性,但增加了模型复杂性和计算需求。

3.3 强化微调技术

强化微调(RFT)在提高大语言模型的性能和适应性方面显示出了相当大的前景,正如DeepSeek-R1等模型的优异表现所证明的那样。在自动驾驶领域,Gen-Drive和TrajHF采用RFT来使轨迹生成模型与安全约束和人类驾驶偏好保持一致。RAD结合了3D高斯泼洒来生成场景并进行闭环强化学习训练。

然而,RFT在基于端到端VLM/VLA的自动驾驶中的应用仍然处于起步阶段。虽然之前的方法(如AlphaDrive)利用GRPO而不是直接偏好优化(DPO)来增强规划性能并确保训练效率和稳定性,但它们仍然局限于仅涉及高级元动作的简化设置。在这项工作中,研究团队通过将RFT应用于在场景推理和低级规划中优化端到端VLA框架来推进这个方向,并采用GRPO来加速收敛并增强训练稳定性。

4. 核心算法

4.1 模型架构设计

AutoVLA框架由两个主要组件组成:VLM主干网络和物理动作token生成模块。VLM主干网络能够处理视觉和文本输入,并生成相应的token(推理和动作),采用统一的自回归Transformer解码器。物理动作token生成模块扩展了语言模型解码器,使其能够输出与车辆运动直接对应的物理动作token,这些token的设计遵循物理约束,可以可靠地转换为物理上可行的规划轨迹。

在这里插入图片描述

图3:AutoVLA模型及其训练过程概览。一个预训练的小型视觉语言模型(VLM)被用作AutoVLA的主干。模型接收多视角摄像头流、系统提示、驾驶指令和车辆状态作为输入,并输出文本推理和物理动作令牌。在监督微调(SFT)阶段,一个具有强大视觉理解能力的大型VLM模型被用于收集推理数据,该数据与轨迹数据一起用于训练AutoVLA模型。在强化微调(RFT)阶段,我们利用GRPO(Generalized Reward Proportional Optimization)来训练模型,以便更好地与经过验证的奖励函数进行对齐,同时通过惩罚过度推理实现自适应推理。

模型的基础架构采用了Qwen2.5-VL-3B作为视觉-语言主干网络,这个选择既保证了模型的视觉理解能力,又兼顾了车载部署的效率要求。Qwen2.5-VL是一系列强大的多模态大语言模型,具备强大的视觉理解能力,其开源特性使其能够针对特定任务进行微调。3B参数的规模在性能与资源消耗之间找到了最佳平衡点,使得模型能够在有限的车载计算资源下实现实时推理,非常适合部署在车载设备中。

4.2 输入处理机制

模型的输入设计充分考虑了自动驾驶的实际需求。AutoVLA接收来自车载摄像头的多视角、多帧摄像头数据、高级导航指令以及车辆自身状态作为输入,并执行场景推理和轨迹规划。具体而言,系统利用三个RGB摄像头,分别位于车辆的前部、左前部和右前部。每个摄像头数据流以2Hz的频率捕获四个连续帧,包括当前帧和前三个帧,为场景动态提供时间信息。

此外,模型使用高级导航指令(例如,左转和直行)来明确指定预期方向。车辆自身状态包含当前速度、加速度和历史动作。这种设计不仅确保了视野的全面覆盖,更重要的是为模型提供了理解场景动态变化的能力,使得模型能够全面理解当前的驾驶环境和任务需求。

4.3 动作token化技术

动作token化是AutoVLA最具创新性的技术突破之一。为了在语言模型中进行轨迹规划,研究团队将连续车辆轨迹离散化为一系列物理动作token,其中每个token由短期空间位置和航向运动(∆x, ∆y, ∆θ)表示。这将规划任务转化为下一个token预测问题,可以在语言模型中进行。

研究团队构建动作码本,使用K-均值聚类方法,涵盖大多数车辆运动模式。最终获得一个由2048个离散动作token组成的车辆运动码本。这些动作tokens作为附加tokens合并到VLM中(即<action_0>、<action_1>等)。在推理过程中,模型输出这些动作tokens的序列,随后使用动作码本将这些动作tokens解码为规划轨迹。这种设计的巧妙之处在于将复杂的连续轨迹规划问题转化为语言模型擅长的离散序列生成任务,同时确保生成的轨迹在物理上是可行的。

4.4 统一推理与动作生成

AutoVLA在单个自回归Transformer框架内统一了推理和动作生成,从而能够根据驾驶场景在快速和慢速思维之间自适应切换。在快速思维模式下,AutoVLA直接预测物理动作tokens而无需生成冗长的推理步骤,从而能够在简单场景中快速响应。相比之下,慢思考模式涉及结构化的CoT推理,其中模型首先分析环境,识别关键要素,并推理潜在结果,然后再决定最终的驾驶行为。

为了实现这种双重思考能力,AutoVLA采用直接行动监督和推理增强数据相结合的训练方式。系统设计了系统提示和响应格式,一致地支持这两种模式。这种统一的架构使得模型能够根据场景复杂度自适应地选择合适的处理策略,真正做到了智能化的资源分配。

4.5 监督微调策略

监督微调用于训练模型生成推理和动作序列。给定多帧摄像头图像、高级导航指令和车辆自身状态,训练模型生成一系列输出tokens。输出序列由用于推理的语言token和动作token组成。为了在SFT期间同时实现快速和慢速思考,使用真实助手响应来整理训练数据,这些响应要么仅包含最终动作token,要么将CoT推理与相应的动作token相结合。

第一个监督信号是标准因果语言模型目标函数,它最小化目标token序列的负对数似然,并增强推理能力。另一个监督信号侧重于规划准确性,针对动作token引入辅助损失。为了联合优化推理和动作生成,将语言模型损失和动作损失合并为一个SFT损失函数。为了解决推理数据和纯动作数据之间的不平衡问题,并鼓励模型从包含CoT推理的示例中学习,根据真实数据中CoT的存在情况,为每个样本应用一个加权因子。

4.6 强化微调算法

为了进一步提升AutoVLA的性能,使其与驾驶需求和特定任务的奖励保持一致,引入一种基于强化学习的训练后方法。该RFT阶段使模型能够进行自适应推理并优化规划性能。采用GRPO算法,该算法可以稳定训练并提高收敛效率。此外,规划固有的多模态性(即同一场景下存在多条可行轨迹)与GRPO基于组的优化框架自然契合。

给定一个场景输入查询,包括传感器图像、自车辆状态和驾驶指令,从旧策略中采样一组候选输出。然后使用归一化的群相对优势来优化当前策略。最终奖励函数综合考虑了驾驶质量和推理效率,对于nuPlan数据集,采用预测驾驶员模型评分(PDMS)作为驾驶奖励,该评分涵盖安全性、舒适性、行驶效率和其他驾驶质量指标等方面。为了避免不必要的过长推理链,在奖励函数中加入CoT长度惩罚。

5. 实验

5.1 数据集与基准测试

AutoVLA的实验验证覆盖了自动驾驶领域最具权威性的数据集和基准测试,充分展现了模型的综合性能。研究团队在nuPlan、nuScenes、Waymo和CARLA等多个具有代表性的数据集上进行了全面的评估,这些数据集分别代表了不同的场景特点和技术挑战,确保了实验结果的可靠性和普适性。

nuPlan(Open-Scene)数据集包含120小时的大规模驾驶数据,包含八路摄像头数据流和物体标注。Waymo端到端驾驶数据集包含4,021个20秒的驾驶片段,包含八路摄像头视图和自主车辆轨迹,尤其关注具有挑战性和长尾场景,例如穿越施工区域或危险路况。nuScenes数据集提供1,000个城市驾驶场景,包含六个摄像头视图。CARLA-Garage数据集提供来自CARLA模拟器的超过500,000帧摄像头数据。
在这里插入图片描述

6. 结论

AutoVLA的成功不仅代表着端到端自动驾驶技术的重大突破,更为人工智能在具身智能领域的应用开辟了新的路径。该研究最重要的贡献在于证明了视觉-语言-动作模型能够在复杂的现实环境中实现真正的端到端学习,为自动驾驶技术向更高智能水平发展提供了可行的技术路线。研究团队成功地将物理动作tokens直接集成到预训练的VLM主干网络中,从而支持直接学习自回归规划策略,其统一架构无缝集成了推理和动作生成,允许在直接轨迹生成和CoT推理之间进行自适应切换。

Logo

助力广东及东莞地区开发者,代码托管、在线学习与竞赛、技术交流与分享、资源共享、职业发展,成为松山湖开发者首选的工作与学习平台

更多推荐