论文详情

在候选信息与下一步动作之间切换,统一管理今日论文。

arXiv 已全文快扫 相邻启发,暂不精读

AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios

2026 · T3 V2X VLM LLM reasoning

推荐理由

与当前方向有可迁移方法或背景价值,但不是本轮核心问题;注意:更像自动驾驶多模态/大模型背景材料,V2X 约束不足

核心判断

论文摘要(中文)

论文提出 AnchorReasoning 长尾驾驶视觉推理数据集,包含 416,119 帧和 395,379 个决策关键元素,并把元素定位、属性影响、驾驶动作理由与轨迹规划组织成视觉依据链。作者还提出课程式监督微调和考虑目标尺寸的 grounding 指标。

研究动机(中文总结)

现有驾驶数据对“哪些视觉证据影响决策,以及证据如何支撑推理和规划”的监督不足,限制了视觉语言模型在长尾场景中的可靠性。

创新与贡献(中文总结)

提供大规模、分层的视觉依据推理数据,并将目标定位、语义影响、动作理由和轨迹规划连成一条可训练、可评估的链路。

方法与证据

方法(中文总结)

基于 WOD-E2E 标注决策关键元素并构造 VG-CoT;使用课程式 SFT 逐步训练模型理解元素、推断影响、解释动作并生成轨迹,同时提出目标尺寸感知的定位评价指标。

实验结果(中文总结)

在八种通用、具身和自动驾驶模型上的实验中,摘要报告 5 秒 ADE/FDE 分别降低 7.84/11.86,RFS Frame/Cluster 分别提升 1.66/1.70;推理 token 平均减少 18.5,延迟降低 0.32 秒/帧。