论文详情

在候选信息与下一步动作之间切换,统一管理今日论文。

Google Scholar Alert 已全文快扫 趋势记录

Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation

2026 · T5 Google Scholar Alerts personal keywords

推荐理由

Vision-language-action (VLA) models let robots follow language instructions, but their language backbones of several billion parameters are the main obstacle t…

核心判断

论文摘要(中文)

论文研究如何恢复结构化剪枝后视觉语言动作模型的操作能力。方法缓存一次教师模型前向得到的隐状态,用离线隐状态蒸馏训练剪枝学生模型,无需在线采样轨迹;在 OpenVLA-OFT 上剪掉 63% 参数后,约 8 GPU 小时即可把成功率恢复到距教师 3.5 个百分点以内。

研究动机(中文总结)

VLA 的数十亿参数语言骨干难以在机器人硬件运行;大幅剪枝会严重损害任务成功率,而已有恢复方法需要在线 rollout 和大量 GPU 时间。

创新与贡献(中文总结)

利用宽度剪枝保留教师与学生隐状态的相同维度,直接做离线隐状态蒸馏,无需投影层、在线 rollout 或奖励信号。

方法与证据

方法(中文总结)

先对教师模型执行一次前向并缓存隐状态,再以缓存监督被剪枝学生模型;系统比较九种剪枝比例、两种骨干以及宽度剪枝和深度剪枝的恢复效果。

实验结果(中文总结)

在 OpenVLA-OFT 剪枝 63% 时,离线蒸馏约用 8 GPU 小时将学生恢复到距教师 3.5 个百分点内;在真实 6 自由度机械臂上,72% 剪枝的蒸馏模型成功率为 77.5%,监督恢复为 59.5%,且板载运行快 2.23 倍、内存少 62%。