【导读】VLA模型虽然已具备完成任务的能力,但在真实机器人上的部署效率却往往不尽如人意。针对这一痛点,四川大学雷印杰教授团队提出了名为“PolicyTrim”的优化方案。该方案无需重新训练模型,而是通过扩展可靠的动作序列并剔除冗余步骤,帮助机器人更直接、高效地完成任务,从而大幅提升整体执行速度。
视觉-语言-动作模型将视觉观测、语言指令和机器人动作统一到了一个策略模型中,使机器人能够基于自然语言完成复杂操作。从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。
然而,当VLA模型真正部署到机器人上时,一个关键瓶颈立刻显现:任务总时间不仅取决于单次推理速度,更取决于策略需要执行多少次推理和物理动作。在同一任务的多次rollout中,VLA模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。此外,动作chunk尾部不可靠(误差累积)以及物理动作冗余(纠错、回退动作多)也是主要问题。
传统的优化手段多集中在计算侧,如剪枝、量化或推理加速,但这无法解决策略本身冗余的问题。强行拉长动作chunk长度又会降低成功率。PolicyTrim应运而生,它是一个面向“策略效率”的两阶段强化学习后训练框架,旨在不改变模型架构和数据的前提下,优化已有预训练策略的执行行为。
PolicyTrim实现了多项性能指标的提升:动作chunk利用率提高3倍,物理步数减少51.4%,在LIBERO Object和π0.5任务上最高实现5.83倍的端到端加速。
PolicyTrim的核心目标是从“算得更快”转向“做得更快”。它通过两个阶段实现这一目标:
1. **扩展可靠动作序列**:通过动态探索不同长度的执行窗口,鼓励模型将原本不可靠的尾部动作变得可用。
2. **压缩冗余物理步骤**:引入奖励机制,鼓励模型用更少的物理步骤完成任务,同时防止投机取巧导致的成功率下降。
实验表明,PolicyTrim在保持任务成功率稳定的同时,实现了显著加速。在LIBERO任务中,π0.5模型最高达到5.83倍的端到端加速;在真实机器人部署中,平均加速达1.86倍,且在动态干扰场景下保持鲁棒性。
PolicyTrim证明了,提升机器人部署效率不仅来自更快的模型推理,更来自更高效的策略行为。通过让机器人学会“少走弯路”,同样能带来巨大的性能提升。
