ARTICLE · 人工智能
ACL2026 | K 个隐推理 token 加锚点查询:语义与定位解耦的图像推理分割
一语总结本文解读 ACL2026 论文 AnchorSeg,提出将单一<SEG>标记扩展为 K 个隐推理标记加一个锚点标记的语言锚定查询库,显式解耦语义推理与空间定位,并在 ReasonSeg 上取得 SOTA 性能。
本文对 ACL2026 论文 AnchorSeg 进行系统性解读。针对推理分割中单一
- 单一<SEG>标记将语义推理与空间定位隐式压缩在同一嵌入中,导致复杂推理场景性能受限。
vanilla 范式(如 LISA)依赖单一分割标记隐式桥接语言推理与掩码解码,语言语义与视觉表示的对齐机制未被探索,且 token 级空间响应与像素级掩码监督存在分辨率鸿沟。
- AnchorSeg 提出语言锚定查询库,将推理分割重构为结构化条件生成问题。
引入 K 个可学习隐推理标记与一个<SEG>锚点标记,构成有序查询序列;上下文查询编码中间推理状态提供语义调制,锚点查询产生显式空间定位信号,查询序列的自回归顺序天然编码角色依赖关系。
- 因子化语言锚定空间条件建模使锚点查询与图像 token 相似度产生空间先验,注入 SAM 视觉特征。
空间响应集合被因子化为锚点查询决定的定位信号与上下文查询提供的语义调制,相似度图经双线性插值、归一化、裁剪还原等操作后与 SAM 稠密视觉特征逐元素相加。
- TMCC 双向循环一致性目标在 token 级空间响应与像素级掩码监督之间实施跨分辨率对齐。
Token 到 Mask 方向用二元交叉熵与 Dice 损失监督上采样后的空间图;Mask 到 Token 方向将软目标掩码下采样后与 token 级响应对齐,两项联合优化形成闭环约束。
- 实验显示 AnchorSeg 在 ReasonSeg、RefCOCO(+/g)、gRefCOCO 等基准上全面优于 GSVA、LISA、RSVP-GPT 等同规模方法。
ReasonSeg 测试集 67.7% gIoU/68.1% cIoU 领先 RSVP-GPT 约 4-6 个百分点;长查询场景增益更显著;查询序列长度 N=8 时性能最优,消融实验验证了各组件必要性。
ACL2026 | K 个隐推理 token 加锚点查询:语义与定位解耦的图像推理分割
本文对 ACL2026 论文 AnchorSeg 进行系统性解读。针对推理分割中单一
文章金句
"现有推理分割方法把"分割什么"和"在哪里分割"压缩进同一个<SEG>标记的嵌入里。
"锚点查询决定在图像中关注哪里,上下文查询则为空间定位提供语义调制。
"TMCC 双向目标在 token 级空间响应与像素级掩码监督之间强制跨分辨率对齐。
"查询序列内部从粗粒度语义响应到精细空间定位的渐进精化过程,为上下文查询与锚点查询的角色分工提供了直观证据。