论文笔记 · 2026/07/15
Thinking with Images
MLLM 的新的推理范式
#推理范式
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers[https://arxiv.org/abs/2506.23918]
本论文整理了过去的MLLM的推理范式,并提出了一种名为 Think with Images 的推理范式的趋势
早期的MLLM的推理范式是基于CoT的
- 我想这一点是初期由LLM转为MLLM带来的,由于涉及到MLLM架构上是基于LLM加上多模态处理模块,所以很自然地将LLM上推理效果很好的CoT范式迁移到MLLM上了
- 基于CoT的范式是:输入的以图片为代表的多模态输入会作为静态的输入,通过视觉编码器表示为image tokens,然后和text tokens一起进入LLM在语言空间中进行推理并输出
基于CoT这样会带来的问题
- 图像空间是连续的、稠密的、空间化的,语言空间是离散的、符号化的;将图像空间一次性地压缩为视觉特征会带来信息损失,比如:
- 一些难以转写为文字的信息
- 一些微小区域容易在编码中被忽略
- 图像空间是连续的、稠密的、空间化的,语言空间是离散的、符号化的;将图像空间一次性地压缩为视觉特征会带来信息损失,比如:
所以作者提出 Thinking with Images——“用图像思考”
- 图像不再是作为一次性的,静态的输入,而是作为一个可以持续操作的认知工作区,可以在推理的过程中产生新的视觉中间步骤(就像CoT产生新的语言中间步骤一样)
- 具体而言,这样的视觉中间步骤可以是:局部放大、添加辅助线、生成想象的未来场景……
- 核心是:视觉信息能否像文字思维链中的句子一样,成为推理链中的中间思维
具体的Think with Images的范式
- 作者分为三类
- 调用固定的工具
- 生成程序
- 内在想象
- 第一类:调用固定工具的方式
- 模型维护一个固定的工具集合
- 工具包括:
- 语义落地类:OCR、图像描述、图像问答等
- 探索感知类:图像裁剪、方法、语义分割、物体检测等
- 视觉推理辅助类:添加辅助线、加框、标号等
- 每次推理的时候,模型决定调用哪一个工具、具体使用的参数、如何解释工具返回的结果
- 具体实现方式有:Prompt-based、SFT、RL
- 优点是具有可解释性、实用、易于调试,可以使用成熟的工具
- 缺点是:模型只能选择已有工具,不能创造工具箱里没有的操作
- 第二类:程序化视觉操作
- 承接第一类方式,第二类就可以使用编写脚本进行灵活的工具组合
- 操作包括
- 视觉操作:检测、裁剪、缩放、绘制辅助线、OCR等
- 逻辑操作:条件、循环、排序、计数等
- 复合操作:组合完成复杂算法
- 具体实现方法有:few-shot prompting、SFT、RL
- 优点是组合灵活、非线性控制、具备可解释性和可控性
- 缺点:依赖外部解释器和运行环境;模型必须把视觉意图翻译成严格代码,仍存在语义转换鸿沟。
- 第三类:内在视觉想象
- 承接第二类方式,第三类直接在推理过程中生成新的图
- 在每一步,模型决定下一种思维模态:
- 产生文本思想;
- 产生视觉思想;
- 或在二者之间交替。
- 生成的新图像会加入推理状态,成为下一轮推理的视觉上下文
- 生成方式包括:
- 隐式的潜空间推理:不渲染出人类可见的图片,而是使用潜空间中进行转换。带来高效的同时带来了不可解释性和不确定性
- 显式的视觉推理:生成可见的中间推理图像,比如添加辅助线、想象未来时刻的位置
- 交错式推理:文本和图像交替出现,比如:使用文字提出假设,生成图像验证假设、阅读图像并使用文字反思、生成迭代优化的假设……
- 具体实现方法:SFT、RL
- 不一定需要照片级想象
- 人类思考时往往使用:简笔画;轮廓;空间关系;语义掩码;3D 结构;稀疏特征
- 如果模型每次都生成高清图片,成本高而且可能引入无关细节。抽象视觉表示可能更高效、更可靠。
- 想象必须由世界模型约束
- 生成一张“看起来合理”的图片,不等于正确模拟现实
- 用于机器人或科学推理时,模型必须理解:物理规律;因果关系;时间连续性;物体恒常性;空间尺寸。
- 否则所谓视觉想象只是流畅的视觉幻觉
- 作者分为三类
测评基准和实现框架
测评任务
- 数学推理:几何、代数、函数图像,需要画辅助线或图形;
- STEM:物理、化学和工程中的动态、因果过程;
- 谜题与游戏:长程规划和未来状态模拟;
- 感知推理:高分辨率细节、计数、定位和多步视觉判断;
- 代码生成:从截图、图形或 UI 恢复可执行代码;
- 图表与表格推理:提取、比较、标记趋势和重建图表;
- 真实世界任务:在噪声大、结构不规则的日常图像中综合推理。
现有很多多模态推理基准存在的问题:
- 只检查最终答案。这无法证明模型真的使用了中间视觉步骤,因为模型可能:依靠语言先验猜答案;记住数据模式;生成一张中间图却完全忽略它;用错误过程碰巧得到正确答案。
更合理的评测应该检查:每个视觉步骤是否有证据支撑;中间图是否逻辑连贯;中间图是否真的必要;删除某个视觉步骤后,性能是否下降;模型是否在不需要时浪费视觉计算
训练方式实现的框架
- Prompt 和代理编排框架,用于连接工具和多模态输入;
- SFT 框架,用于训练工具调用、程序轨迹和图文交错序列;
- RL 框架,用于大规模 rollout、工具交互和视觉奖励优化。
作者认为现有通用框架可以作为基础,但对真正的视觉交互式推理仍缺少原生支持,尤其是在视觉工具执行速度、中间奖励和多轮图像状态管理方面。
应用
- GUI Agent:由于GUI的特性,需要不断的进行视觉输入以及视觉推理
- 具身智能:机器人在真正行动前,先在内部模拟结果。部分空间任务中,图像序列规划可能比语言描述更自然
- AI4S:科学图像往往依赖专门知识,对于图像的理解需要结合领域工具、科学先验和可验证的中间步骤
- 医疗:需要强调视觉推理过程中的可信性、可解释性、受到专业知识约束并且安全
- 教育:边解释边画辅助线;动态生成图表;标记关键区域;根据学生的问题修改示意图。
未来方向:
- 计算效率和认知效率
- 计算效率指的是减少图像token、工具调用次数、图像生成次数、通信时间损耗
- 认知效率是指模型是否知道什么时候值得进行视觉思考,关于动态路由选择
- 安全和可信性
- 如果链条中间某一步出现偏差,那么后续推理就会看起来连贯,但是是虚假错误的
- 攻击也可能发生在整个循环中:
- 工具被污染;
- 模型被诱导关注错误区域;
- 中间图像植入误导信息;
- 偏见在多轮自我反馈中被强化。
- 因此需要审计的是工具选择、注意区域、生成内容和自我反馈组成的整个视觉推理过程。
- 新的测评方法
- 不能只关注结果是否正确,应该关注视觉步骤的真实性、必要性和因果贡献
- 未来基准必须设计成“不进行视觉操作就无法完成”,例如:
- 必须画辅助线才能求解;
- 必须修改机械结构图;
- 必须在迷宫中绘制路线;
- 每次操作都会改变场景的互动任务
- 从图像扩展到音频、视频和世界
- 视频增加了时间维度。模型不仅要选择“看哪里”,还要选择:
- 什么时候回放;
- 跳到哪个时间点;
- 哪些帧值得放大;
- 缺失的中间事件是什么;
- 未来可能发生什么。
- 最终,作者设想的是 Thinking with the World:思维进入持续的感知—行动循环,模型先通过内部模拟排练动作,再真正影响物理世界
- 视频增加了时间维度。模型不仅要选择“看哪里”,还要选择:
- 和Agent的辨析
- Thinking with Images中存在类似Agent中function calling的操作
- 核心的差别在于
- Thinking with Images关注的是模型内部如何思考,中间的产物也是内部思考的产物(如添加辅助线、进行局部放大、视觉草稿、想象的场景)
- Agent关注的是对外部如何采取行动,比如API调用、执行代码、操作鼠标等
- 未来蓝图
- 需要一个路由判断是否需要进行深度视觉推理(简单任务直接回答即可)
- 需要一个路由判断需要选择哪一种范式进行推理:Stage 1:使用可靠工具; Stage 2:生成专门程序; Stage 3:进行内在想象; 或在三个阶段之间切换
- 最终给出统一的输出接口
- 计算效率和认知效率
作者认为从CoT转变为“Think with images”的转变使视觉从被动信息源成为动态认知工作区,但该领域仍处于早期阶段,效率、鲁棒性、泛化、世界模型和安全问题都没有得到根本解决
心得
- LLM如果单纯输入文本,输出是文本,那么思考过程全是文本,很合理,所以CoT很合理。但是如果输入中含有图像,粗暴地把表意丰富的图像塞进潜空间会带来一波信息损失,只用语言进行推理又带来一波信息损失,所以不合理,所以引入将图像作为MLLM的推理中间步骤很合理
- 这篇论文最重要的是扩展了模型可以使用的思维媒介,过去一直默认思考过程是text tokens,图像只能是单纯的输入或者输出,这篇论文扩展了图像也可以作为推理状态的一部分,并且这一部分还可以反复读取修改,重新定义了多模态推理中的“中间步骤”
- Stage 1解决的是如何选择已有操作,Stage 2解决的是如何组合和创造操作,Stage 3解决的是如何把视觉生成和视觉模拟内化为模型自身的能力
- 很多时候,可靠的OCR、检测或者测量工具比生成一张看起来合理的图更有价值,因此我觉得论文最后提出的元认知控制器,可能比单独提升某一个阶段更加关键:模型不仅需要“会思考”,还需要知道什么时候应该使用哪一种方式思考
- 一个真正强的视觉推理系统在于能否动态地组织感知、工具、代码、视觉想象和语言推理
- Thinking with Images和Agent、world model、具身智能其实会逐渐汇合,最终形成持续的感知—思考—模拟—行动—反馈闭环
- 对Stage 3仍然会保留一些谨慎
- 生成模型很擅长产生视觉上连贯的内容,但是视觉连贯不等于物理正确、空间正确或者因果正确
- 如果模型使用自己生成的错误图像继续推理,错误可能会在闭环中不断被强化
- 因此Stage 3能否真正工作,关键可能不只是图像生成质量,还在于世界模型、验证器以及回退机制是否足够可靠
- 关于评测的讨论也比较重要
- 仅仅看到模型输出了中间图,并不能说明模型真的使用这张图进行了推理
- 一张视觉草稿可能只是装饰性的输出,模型也可能仍然依赖语言先验得到答案
- 因此之后判断一个方法是不是有效的Thinking with Images,我觉得至少应该做干预实验:删除中间图、替换成错误中间图或者打乱视觉步骤,再观察最终性能是否发生变化
- 只有视觉步骤对结果具有真实的因果贡献,才能说明图像确实成为了思维的一部分