论文详情

在候选信息与下一步动作之间切换,统一管理今日论文。

Google Scholar Alert 已全文快扫 趋势记录

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

2026 · T5 Google Scholar Alerts personal keywords

推荐理由

存在代码/项目页线索,利于进入复现

核心判断

论文摘要(中文)

论文提出 PHR-VLA,为视觉语言动作模型加入规划时域推理。训练时用轻量未来状态预测头,把模型内部表示与未来观测得到的潜在动力学对齐;测试时仍由 VLA 根据当前输入输出动作。

研究动机(中文总结)

多数 VLA 主要根据当前图像和指令预测动作,没有显式推理未来任务动态;这一缺陷在精细、接触密集的操作任务中特别明显。

创新与贡献(中文总结)

利用训练期间可见的未来观测构造特权潜在动力学监督,使 VLA 学到面向规划时域的表示,而无需在执行时直接访问未来信息。

方法与证据

方法(中文总结)

添加轻量辅助未来预测头,将 VLA 隐表示与未来观测提取的潜在动力学对齐;比较腕部相机、第三人称视角以及 patch 级监督。

实验结果(中文总结)

腕部相机的局部接触区域 patch 级监督使 LIBERO 成功率从 84.1% 升至 88.4%,真实拆解任务从 63.3% 升至 82.5%;第三人称监督使 MetaWorld 从 56.70% 升至 57.8%。