GLaQ 用「视觉检索」取代自回归潜态:5 项细粒度视觉基准平均提升 5.99%-9.66%

发布时间:2026/9/1 13:14:26

GLaQ 用「视觉检索」取代自回归潜态:5 项细粒度视觉基准平均提升 5.99%-9.66%
GLaQ 用「视觉检索」取代自回归潜态5 项细粒度视觉基准平均提升 5.99%-9.66%这篇论文提出一种让多模态模型在推理时直接「检索」原始图像证据的新方法取代过去靠自回归潜态一路「想下去」的做法在 5 项细粒度视觉理解基准上平均提升 5.99% 到 9.66%并在所有对比的视觉潜态推理方法中排第一。方法名叫 GLaQ取自 Grounding Latent Queries接地潜查询。多模态大模型已经从图像加文字的混合输入里完成不少推理任务。但有一个老问题一直没解决干净模型在推理时视觉细节会被「翻译」成文字而文字是有损的。论文瞄准的正是这个瓶颈。一、多模态推理的瓶颈细粒度视觉证据留不住思维链Chain-of-Thought大幅提升了多模态大模型的问题求解能力。模型先写一段中间推理再给出答案。问题在于这段中间推理是文字而图片里的很多关键证据是「只能看、很难说」的一只猫的耳朵位置、两块砖之间的缝隙、图表里某个数据点的确切坐标。当模型把这些视觉细节压缩进文字理由里细节就丢了论文把这称为信息瓶颈。你让模型描述一张零件图它可以写「左上角有一个缺口」但模型在后续推理里真正要用的是「缺口到底多大、边缘长什么样」这类像素级信息文字描述撑不住。越是细粒度的视觉理解任务这个瓶颈越致命。二、两条老路外部工具与自回归潜态为了绕开文字瓶颈之前的研究走了两条路各有各的代价。第一条路叫「带着图像思考」thinking-with-images推理过程中不把图像只当成一次性输入而是允许模型反复访问图像做裁剪、放大、画标注等操作。这样每一步推理都能重新「看到」新鲜证据。代价是要预先定义一堆工具推理时还要额外处理图像流程重、开销大。第二条路叫「连续视觉潜态推理」continuous visual latent reasoning把中间推理放到模型的隐藏状态里不写成文字用一个紧凑的潜向量序列携带视觉语义。这条路保留了图像的连续信息看起来很美。但它有一个隐藏的毛病潜态序列是按自回归方式逐个生成的每个潜态都依赖前一个这跟语言生成是同一套逻辑可视觉证据并不适合这么排队。论文用相似度图证明了这个问题自回归生成的潜态越往后越像形成一大块高相似区域。也就是说后面的潜态在重复前面已经有的内容而不是补充新的视觉细节。潜态序列越长重复越多信息增益越少这就是「想下去」的边际收益递减。三、GLaQ 的做法接地潜查询GLaQ 的思路是把「持续想下去」改成「按需查一次」。它用一个固定大小的查询块每个查询都直接「接地」在原始图像的视觉 token 上。也就是说模型不是用一个自回归链去推演潜态而是用一组上下文条件化后的查询去原始视觉表征里做一次集中的、协调的检索再把检索结果注入回生成阶段。这句话有点绕可以打个比方。自回归潜态就像一个人闭着眼睛在心里默背清单背到后面全是重复GLaQ 像一个人睁开眼睛直接看黑板需要什么信息就派一个查询去看一眼。查询块是固定容量的所以额外开销是「有界」的不管图像多大、任务多长接地检索的成本不会随着潜态数量无限增长这一点正好治了自回归潜态「越长越贵」的病。更关键的是因为查询直接对接原始视觉 tokenGLaQ 保留了整张图的完整上下文不需要外部视觉操作也不需要反复处理图像。论文把这种设计称为以接地换取补充潜态之间不再需要互相传递信息每个查询都直接从源头拿。四、训练局部视图自蒸馏加 DePO 强化学习光有架构还不够GLaQ 的训练用了两段式每一段解决一个具体问题。第一段是局部视图监督配合自蒸馏。为了让查询学会「检索有用的地方」训练时先给模型看图像的局部特写ROI 视图让查询在特写上学会关注哪些区域再把这份「注意力」蒸馏回全图通路。论文把它称为潜查询自蒸馏局部视图的监督信号被转移到全图推理路径上从而让全图推理也具备细粒度定位能力。第二段是强化学习。论文用 DePO一种在任务级奖励下的策略优化方法同时优化两类动作一类是文字 token 的生成一类是接地查询的取舍。消融实验显示在同样的训练数据、奖励和 rollout 设置下只做文字 token 的 GRPO 优化已经能带来实质提升而 DePO 在这个基础上再提升 0.52% 到 1.37%。这证明接地查询不是被动地放在那里而是可以当作可优化的潜动作接受任务级反馈来不断改进。五、实验结果5 项基准全涨吞吐还更快GLaQ 以 Qwen2.5-VL-7B 为骨干在 5 项细粒度视觉理解与感知基准上做了评测。结果是较基座模型平均提升 5.99% 到 9.66%在所有对比的视觉潜态推理方法中排名第一。拿最难的 V基准看GLaQ 较基座提升 8.90 个点同时端到端吞吐提升 7.62%。与另外两个代表方法对比V准确率较 DeepEyes 高 2.09 个点、较 HyLaR 高 4.19 个点吞吐较 DeepEyes 高 20.11%、较 HyLaR 高 5.70%。换句话说GLaQ 不是拿准确率换速度而是准确率更高、速度也更快把「准确性到效率」的前沿同时往前推。推理范式视觉证据如何访问推理时额外开销信息冗余情况外部工具带着图像思考裁剪、缩放、标注反复处理图像需要预定义工具流程重低但代价高自回归潜态潜态之间顺序传递随潜态数量增长后期状态重复信息增益递减GLaQ 接地潜查询查询直接检索原始视觉 token固定容量开销有界查询互补无重复链论文还单独验证了「接地」本身的价值控制变量下正是「潜查询重新获得对源 token 的直接访问」和「固定容量块内保持协调」这两点带来了全部提升。这指向一个明确结论显式的源图像接地可以替代自回归潜态构造成为连续视觉推理的一种新范式。六、意义与局限GLaQ 的意义有两层。第一层是效率它证明视觉推理不必依赖越来越长的自回归潜态链固定容量的接地查询块就能做到更高准确率而且开销有界这让长上下文多模态推理在工程上更可控。第二层是研究范式它把「连续潜态推理」从「按语言逻辑排队」拉回到「按视觉证据组织」源图像接地成为可解释、可优化的对象为后续工作打开了空间。局限同样明显。论文只在一个 7B 骨干上做了评测模型规模扩展后接地查询的收益是否保持还没验证。查询块是固定容量的任务复杂度变化时可能不够灵活。训练依赖辅助的局部视图监督如果能把对这种监督的依赖降下来方法会更实用。论文把这些都列进了未来方向模型规模扩展、自适应查询分配、以及减少对局部视图的依赖。对做多模态研究的人来说这篇论文值得记住一句话视觉推理的连续性不一定要靠「接着上一个想」也可以靠「直接看源头」。

相关新闻

多模态 Agent 一半的思考都在自说自话:剪掉 64% 推理 token,准确率反而全场最高

多模态 Agent 一半的思考都在自说自话:剪掉 64% 推理 token,准确率反而全场最高

2026/9/1 13:14:26

多模态 Agent 一半的思考都在自说自话:剪掉 64% 推理 token,准确率反而全场最高 一个多模态智能体在跑多步任务时,模型自己生成的推理文字能占到上下文一大半。把这些文字剪掉超过六成,任务准确率不但没掉,反而在同类…

设计模式实战:构建可维护的动态图形编辑器

设计模式实战:构建可维护的动态图形编辑器

2026/9/1 13:14:26

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

ChatGPT Plus订阅与Codex CLI配置报错排查全攻略

ChatGPT Plus订阅与Codex CLI配置报错排查全攻略

2026/9/1 13:14:26

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

如何三分钟跑通AI出题:DeepTutor 出题功能快速上手指南

如何三分钟跑通AI出题:DeepTutor 出题功能快速上手指南

2026/9/1 14:24:29

如何三分钟跑通AI出题:DeepTutor 出题功能快速上手指南 【免费下载链接】DeepTutor DeepTutor: Lifelong Personalized Tutoring. https://deeptutor.info/. 项目地址: https://gitcode.com/GitHub_Trending/dee/DeepTutor 复习课前,你打开一学期…

AI代理插件开发实战:从标准理解到本地部署与集成

AI代理插件开发实战:从标准理解到本地部署与集成

2026/9/1 14:24:29

这类工具最值得先看的不是功能列表,而是能不能在普通环境里稳定跑起来,以及它到底解决了AI代理开发中的哪些具体痛点。Agent Plugins标准的出现,核心是解决一个老问题:不同AI代理之间、代理与外部工具之间,如何用一种统…

Sunshine 完整搭建指南:零月费游戏串流服务器,10 分钟把 PC 游戏库投到客厅电视

Sunshine 完整搭建指南:零月费游戏串流服务器,10 分钟把 PC 游戏库投到客厅电视

2026/9/1 14:24:29

Sunshine 完整搭建指南:零月费游戏串流服务器,10 分钟把 PC 游戏库投到客厅电视 【免费下载链接】Sunshine Self-hosted game stream host for Moonlight. 项目地址: https://gitcode.com/GitHub_Trending/su/Sunshine 花大钱买的电脑&#xff0c…

大模型稳定输出JSON的工程化解决方案:从提示词到函数调用

大模型稳定输出JSON的工程化解决方案:从提示词到函数调用

2026/9/1 14:24:29

1. 先搞清楚为什么大模型输出JSON会不稳定 如果你正在开发基于大模型的智能体或应用,想把大模型的回答直接变成结构化的JSON数据,大概率会遇到这个问题:模型输出的JSON格式时好时坏,有时多一个逗号,有时少一个引号&…

AI编程提示词精简80%效果更佳:Claude Code高效协作实践

AI编程提示词精简80%效果更佳:Claude Code高效协作实践

2026/9/1 14:24:29

在AI编程助手日益普及的今天,许多开发者都曾有过这样的体验:精心编写了长篇大论的提示词,试图让AI助手理解复杂的项目背景、编码规范和特殊要求,结果却发现AI的响应要么偏离重点,要么直接忽略了部分指令。这种“提示词…

智能车PID控制实战:从原理到参数整定与调试技巧

智能车PID控制实战:从原理到参数整定与调试技巧

2026/9/1 14:14:29

在实际嵌入式开发、机器人控制和智能车竞赛项目中,很多团队在初期都能快速搭建出能跑的基础模型,但一到比赛现场,面对复杂的赛道元素、变化的灯光和电磁干扰,车辆就会出现冲出赛道、识别错误、速度控制不稳等问题,最终…

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

2026/9/1 1:53:39

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

2026/9/1 9:55:14

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

2026/8/31 17:18:46

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

远程协作的工作台整理

远程协作的工作台整理

2026/9/1 0:03:36

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/1 0:03:36

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/1 0:03:36

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

远程协作的工作台整理

远程协作的工作台整理

2026/9/1 0:03:36

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/1 0:03:36

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/1 0:03:36

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…