ARTICLE · 人工智能

ACL2026 | K 个隐推理 token 加锚点查询:语义与定位解耦的图像推理分割

作者:CV51 来源:CV51 2026-09-03 23:22 36 分钟 12 阅读 8951 字
多模态AI计算机视觉图像分割AI研究前沿模型评测与基准
一语总结

本文解读 ACL2026 论文 AnchorSeg,提出将单一<SEG>标记扩展为 K 个隐推理标记加一个锚点标记的语言锚定查询库,显式解耦语义推理与空间定位,并在 ReasonSeg 上取得 SOTA 性能。

AI 总结

本文对 ACL2026 论文 AnchorSeg 进行系统性解读。针对推理分割中单一标记将语义推理与空间定位隐式压缩进同一嵌入的瓶颈,作者提出语言锚定查询库(language grounded query banks),将 K 个可学习隐推理标记与一个锚点标记组成有序查询序列。锚点查询在图像 token 层面产生显式空间响应,上下文查询通过自回归推理塑造语义调制,两者解耦后共同条件化 SAM 掩码解码器。同时提出 TMCC(Token-Mask Cycle Consistency)双向循环一致性训练目标,在 token 级空间响应与像素级掩码监督之间实施跨分辨率对齐。实验显示 AnchorSeg-7B 在 ReasonSeg 验证集取得 68.3% gIoU 与 75.9% cIoU,测试集 67.7% gIoU 与 68.1% cIoU,全面超越 RSVP-GPT 等基线;在 RefCOCO(+/g)与 gRefCOCO 上也稳定优于 GSVA。消融实验验证了查询序列长度、空间先验注入、上下文查询与 TMCC 各组件的必要性。

核心要点
  1. 单一<SEG>标记将语义推理与空间定位隐式压缩在同一嵌入中,导致复杂推理场景性能受限。

    vanilla 范式(如 LISA)依赖单一分割标记隐式桥接语言推理与掩码解码,语言语义与视觉表示的对齐机制未被探索,且 token 级空间响应与像素级掩码监督存在分辨率鸿沟。

  2. AnchorSeg 提出语言锚定查询库,将推理分割重构为结构化条件生成问题。

    引入 K 个可学习隐推理标记与一个<SEG>锚点标记,构成有序查询序列;上下文查询编码中间推理状态提供语义调制,锚点查询产生显式空间定位信号,查询序列的自回归顺序天然编码角色依赖关系。

  3. 因子化语言锚定空间条件建模使锚点查询与图像 token 相似度产生空间先验,注入 SAM 视觉特征。

    空间响应集合被因子化为锚点查询决定的定位信号与上下文查询提供的语义调制,相似度图经双线性插值、归一化、裁剪还原等操作后与 SAM 稠密视觉特征逐元素相加。

  4. TMCC 双向循环一致性目标在 token 级空间响应与像素级掩码监督之间实施跨分辨率对齐。

    Token 到 Mask 方向用二元交叉熵与 Dice 损失监督上采样后的空间图;Mask 到 Token 方向将软目标掩码下采样后与 token 级响应对齐,两项联合优化形成闭环约束。

  5. 实验显示 AnchorSeg 在 ReasonSeg、RefCOCO(+/g)、gRefCOCO 等基准上全面优于 GSVA、LISA、RSVP-GPT 等同规模方法。

    ReasonSeg 测试集 67.7% gIoU/68.1% cIoU 领先 RSVP-GPT 约 4-6 个百分点;长查询场景增益更显著;查询序列长度 N=8 时性能最优,消融实验验证了各组件必要性。

ACL2026 | K 个隐推理 token 加锚点查询:语义与定位解耦的图像推理分割

本文对 ACL2026 论文 AnchorSeg 进行系统性解读。针对推理分割中单一标记将语义推理与空间定位隐式压缩进同一嵌入的瓶颈,作者提出语言锚定查询库(language grounded query banks),将 K 个可学习隐推理标记与一个锚点标记组成有序查询序列。锚点查询在图像 token 层面产生显式空间响应,上下文查询通过自回归推理塑造语义调制,两者解耦后共同条件化 SAM 掩码解码器。同时提出 TMCC(Token-Mask Cycle Consistency)双向循环一致性训练目标,在 token 级空间响应与像素级掩码监督之间实施跨分辨率对齐。实验显示 AnchorSeg-7B 在 ReasonSeg 验证集取得 68.3% gIoU 与 75.9% cIoU,测试集 67.7% gIoU 与 68.1% cIoU,全面超越 RSVP-GPT 等基线;在 RefCOCO(+/g)与 gRefCOCO 上也稳定优于 GSVA。消融实验验证了查询序列长度、空间先验注入、上下文查询与 TMCC 各组件的必要性。

文章金句

"

现有推理分割方法把"分割什么"和"在哪里分割"压缩进同一个<SEG>标记的嵌入里。

"

锚点查询决定在图像中关注哪里,上下文查询则为空间定位提供语义调制。

"

TMCC 双向目标在 token 级空间响应与像素级掩码监督之间强制跨分辨率对齐。

"

查询序列内部从粗粒度语义响应到精细空间定位的渐进精化过程,为上下文查询与锚点查询的角色分工提供了直观证据。