论文总结 · 2026/09/29
VLM Spatial Reasoning
CVPR 2026
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
https://arxiv.org/abs/2605.30231 个人感觉很棒的一篇论文 相当于是先分析了现有VLM表现不好的根本原因(之一)(跨帧一致性无法有效追踪),然后针对这个问题进行定向改造(设计任务来优化 QK 相似度矩阵) 在每一层的视觉token外面接入一个 head(两层MLP来实现,training-only),通过这个head投影到用于后续匹配的embedding空间。然后设计了两个额外的loss:1. 同一个点,跨帧一致性,使用 InfoNCE 推进同一个点的相似度,推开不同点的相似度(这里的点其实是使用图像patch来实现的);2. 深度估计一致性损失 优化的方向很自然,然后方法设计的也很好,很有启发性
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
https://arxiv.org/abs/2510.18632
能给到夯的一篇,思路很有启发,并且效果也很好 方法是在CoT前面加上一段表示3D几何信息的latent space特殊token的生成(简单投影后使用专有模型监督),训练分为两个阶段,第一个阶段监督生成特殊token,第二个阶段使用GRPO优化下游推理轨迹(同时也监督特殊token生成这一段loss)
VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
https://arxiv.org/abs/2511.21688 比较新颖的是用 MoT 的架构设计,一边是几何transformer,一边是语义transformer 由几何专家和语义专家组成,二者通过共享 self-attention 交互。第一阶段冻结语义专家,训练几何专家及其预测头,使其学会三维几何;第二阶段比较三种损失配置,主模型最终采用冻结几何专家、只用 CE 训练语义专家的方案。空间问答的答案由语义分支生成,而几何分支仍可通过 geometry heads 输出三维预测。
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
https://arxiv.org/abs/2511.23075 认为之前把visual token、spatial token、camera token粗暴的混在一起使用,这样会导致在很多认为任务上区分不出“不同camera位置下的答案不同”,有道理的。 所以这篇主要思想是考虑用“既然 VLM 已经有 semantic representation,VGGT 已经有 geometry representation,那么究竟应该怎样把 geometry 喂给 VLM”这样一个问题 使用的方法是,在原有的视觉特征加一个残差:【由空间信息产生,由相机控制的残差】,用visual feature来做Q,spatial feature来做K和V。同时使用spatial feature和camera feature拼接起来通过MLP来做成residual加到K和V(这里完成主要的创新);同时加上一个可学习的token weight乘到V中;最后还有个设计是在 visual feature 上加了个残差f_{\rm fused} = f_{\rm visual} + g(\text{camera}) \cdot h(f_{\rm visual},f_{\rm spatial},f_{\rm camera}) Grounded 3D-Aware Spatial Vision-Language Modeling https://arxiv.org/abs/2605.30307
ECCV 2026
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models
https://arxiv.org/abs/2605.30161 一个诊断性的论文,揭示VLM倾向于将图片中偏向上方的物体看作“远的”,将靠近下方的物体看作“近的”,left/right 最容易形成稳定表示,above/below 也比较明显,而 near/far 是最弱、最混乱的轴(还是说明2D上表现比3D上好)。 通过统计 EmbSpatial-Bench 和 CV-Bench-3D 数据集,发现受到透视原理的影响,大部分数据都是符合这样的对应关系(远-上,近-下),因此VLM其实是利用了这种捷径进行回答的。一旦事实与这种捷径不符合,表现就不佳。 提出了一个bmk:SpatialTunnel,通过blender构造的合成数据,人为制造“远物体在下面”的反常样本,实验结果发现VLM在符合透视规律的样本上表现比不符合透视规律的样本上表现好得多,但是更强的模型能一定程度摆脱这种捷径。 所以VLM 在空间推理 benchmark 上答对了,看似学会了空间关系,其实是学会了这种统计规律的捷径。VLM并没有学到真正有效的空间关系。
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
https://arxiv.org/abs/2511.19418 个人感觉做的很好的一篇论文,有很多小巧思,把过去发现CoT能对LLM推理大有裨益的时刻带到VLM上了 提出一种推理范式:CoVT,对比CoT多的V就是visual,其实也是很自然的想法,VLM过去不管前面输入的方向加了什么模块,最后推理都是在文本空间进行推理的,那么视觉空间变到语言空间肯定是存在损失的(大约在projector那个地方最严重),而且这个损失其实不太好弥补。所以思想就是监督VLM在输出的时候加上一些空间geometry信息,并且这个添加只多了 20 个token。
具体来看,增加的监督teacher是四类:SAM(segmentation)、DA(depth)、DINO(Semantic feature)、PIDINet(Edge),分别从四个维度来进行监督
训练上也很有小巧思,很自然,如上图的四个阶段 在训练范式上,在消融那里分别对比了:直接在feature上进行MSE对齐(JEPA-style)和加decoder和教师输出进行对齐(主方法),效果是主方法更好,我感觉可能是因为毕竟是图像信息(在feature上会不可避免地造成信息损失,而且图像的话进一步放大这种损失),decoder之后对齐效果更好 总结一下就是:通过 vision-expert supervision,让 VLM 学习一组可以自主生成的 continuous visual reasoning tokens,并把这些 token 插入 reasoning chain,从而将细粒度 perception information 内化到模型自己的 latent space
Make Geometry Matter for Spatial Reasoning
https://arxiv.org/abs/2603.26639 发现 naive geometry injection ≠ geometry utilization,并提出 masking + gated fusion,让 VLM 真正依赖 3D geometry。 之前很多工作利用VGGT、DA等模型,来提取geometry feature,然后和2D图像token合并融合,之后进入推理过程,但是这篇论文发现在标准微调流程下, VLM还是更加倾向于使用原本的2D数据而不是事实上空间信息更多的,同时也是作者们构思费劲最多的geometry feature上。结论是静态场景里 geometry 只带来很小提升,动态场景里甚至可能让性能下降。 那么为什么呢?假设训练集中,仅靠 RGB appearance 就已经能回答很多空间问题,那么从 loss 的角度看,模型根本没有动力去学习:“我应该什么时候读取 geometry token,以及怎么读取。”。所以论文的下一步改进方法也就很自然了:强迫模型去多看 geometry 信息而不是更爱看 RGB 做了两个设计: ● Geometry-Unleashing Masking(让模型不得不用 geometry) ○ 用于故意 mask 掉大量普通 2D visual token,故意破坏掉VLM的舒适圈捷径,这个时候VLM想回答一些空间推理的问题的时候只靠RGB就不够了,于是不得不去看geometry feature。 ○ 这里有一个小 trick:对于 static spatial reasoning,作者直接 random mask vision tokens。但对于 dynamic spatial reasoning,他们做得更聪明:先根据问题,让 geometry tokens 和 query 做 cross-attention,找出哪些 3D token 最相关;然后专门 mask 这些位置对应的 RGB tokens。 ● Geometry-Guided Fusion(让模型学会怎么合理使用 geometry) ○ 用于学习在什么时候、在什么位置来看,看多少 geometry feature ○ 具体做法是做了一个可学习的门控\alpha=\sigma(W[F_V\Vert F_G]+b) 然后 F= \alpha\odot F_V+ (1-\alpha)\odot F_G.,就可以让模型自己学什么时候用RGB,什么时候用geometry 具体的实验中,分为静态(VSI-Bench)和动态(DSR-Bench),模型用的是QWen2.5-VL-7B ● 静态 VSI-Bench 上,baseline:50.7;GeoSR:51.9 ● 动态 DSR-Bench 上,baseline:58.9;GeoSR:66.1;GeoSR(wo geometry):62.8 动态比静态明显的多,原因是静态中即使不给显式 geometry,模型也能猜不少,但是动态中单帧 appearance shortcut 就没那么可靠了。
Attention-based Vision-Language Memory for Spatial Reasoning
https://eccv.ecva.net/virtual/2026/poster/4166
Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
https://arxiv.org/abs/2606.23557 MLLM在进行视觉空间推理的过程中需要依赖于大量丰富语义信息的内容进行推理,但是作者认为现有的训练方式其实是稀疏的(主要表现在奖励信号聚焦于 Ans 而忽视了reasoning) 作者构造的方法是通过VGGT和SAM来构造有明确语义信息的图,以及构造推理trajctory(依次选择哪几个图像进行推理),基于此使用GRPO来依次完成:恢复具有语义信息的认知地图(通过文本进行描述),依次选择合理的图进行推理,reason,回答 训练任务是:\text{多视角图像} \rightarrow \text{全局 CogMap} \rightarrow \text{视角选择} \rightarrow \text{局部 EgoMap} \rightarrow \text{空间推理} \rightarrow \text{答案} 所以一共由四项GRPO奖励信号:地图的几何一致性;视角选择的顺序;答案正确性;输出格式。训练范式上还是先SFT再GRPO
感觉“从多视角图片输入”来推测统一的“认知地图”是很有用的一步,原因是能够将不同视角下的物体以及信息统一在一起,而不是根据单张图片进行“幻觉推理”。
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasonin
https://arxiv.org/abs/2603.06024
感觉方法上还是比较简单,把过去的CoT的过程显式的约束分开,分成三个阶段:,第一个聚焦于提供两张图片中哪些物体相互对应;相机从一个视角移动到另一个视角时发生了什么变化;视角是否发生旋转或平移;物体的相对位置如何变化;哪些物体因为遮挡或视角变化而出现、消失;如何根据这些关系建立跨视角的一致空间解释(而不是相对而言对这两张图进行割裂地描述) 训练数据集由Qwen3-32B-Instruct对数据集中的CoT进行重写 但是个人感觉任务上是不是有一点受限?推广到更加全面的空间推理任务上是不是存在困难?哪怕是作者说的静态多图输入,推断方向这个任务,文章中也只是给出两张图的情景,虽然没有说只能在两张图上work,那么如果推广到多张图,复杂度我感觉会大幅度增加,并且效果可能未必会很好
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning
https://arxiv.org/abs/2609.03729v1 方法个人感觉做的要比显示输出认知地图这类方法自然一些,首先使用SFT来建立模型基础的能力,随后使用GRPO来加强,其中GRPO的任务和奖励设置是创新点:
XY是建立模型跨帧物体定位能力,训练数据是使用深度图反向投影那一套来建立的,帮助模型建立起不同帧,不同视角下统一个点的定位能力 Z是建立模型深度估计的能力,这里没有要求模型输出metric depth而是输出bbox然后根据相对深度来建立的(确实是有道理,metric有点强人所难并且意义不是特别大) T是建立模型对于运动的理解能力,做的方法是给不同视角的帧,然后让模型来找到正向和逆向的camera运动方向,二者都回答正确才给这个奖励信号
最后有一个小点就是把格式奖励直接乘在外面了,而不是像之前很多工作那样作为加在后面的一个因素,肯定是要比加在后面来的直接,个人感觉也更加合理
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning
https://arxiv.org/abs/2607.17599 做的效果很好,VSI-Bench说是能够达到 76.6 ,是我看过的论文里面生成最高的了,感觉都快要通关了()用的backbone是Qwen3-VL-8B-Instruct 具体做的方法是首先用两个encoder来分别获取语义上、空间上的特征、相机位姿和深度图,接着通过相机位姿过滤掉相似度很高的帧,保留差异性的帧,接着找虽然“相机位姿符合阈值要求”但是语义信息相似度比较大的帧进行融合。融合完成之后显式的空间记忆以及隐式的空间记忆就保存在“Geometry-Consistent Memory”里面供后面来检索使用(检索也用了一些小trick)。检索之后就提供context供后续的VLM消费使用。SFT之后做了一个自监督强化学习。
设计的很复杂,个人感觉有点看不明白,可能最work的就是的中间的存储以及检索的trick,但是我感觉我不太能够做类似这个工作的构思,确实是脑袋不太够用了,但是它的VSI-Bench的分数真的很高欸
Visual Spatial Tuning
https://arxiv.org/abs/2511.05491 标题字越少,事越大。 把QWen2.5VL 7B 在 VSIBench表现从 32.7 提升到 61.2,属实是有点变态了 提出不引入额外 3D 编码器的情况下,系统性地提升多模态视觉语言模型(VLM)在 3D 空间感知与推理方面的能力的数据集 ● 数据集设计 (VST Datasets) VST 将空间能力拆解为空间感知 (Spatial Perception) 与 空间推理 (Spatial Reasoning): ● VST-Perception (VST-P, 4.1M 样本):用于建立空间感知 ○ 单图 (Single-Image, 64.8%): 包含 3D 目标检测(9-DoF 边界框)、相对深度估计、距离预测、属性测量与空间场景描述(Scene Caption),消除 2D 像素坐标与 3D 物理世界之间的隔阂 ○ 多图 (Multi-Image, 33.1%): 包含多视角对应点匹配(Correspondence)、跨视角 3D 目标检测、相机运动(Camera Motion)预测等,训练模型理解不同视角间的几何关联 ○ 视频 (Video, 2.1%): 涵盖物体出现顺序、物体计数与时空逻辑,提升时空感知 ○ FoV 统一策略 (Field of View Unification): 针对开源数据相机内参不一致的问题,将所有图像投影至统一虚拟角 FoV 下,消除几何不一致性 ● VST-Reasoning (VST-R, 135K 样本):用于强化空间推理 ○ 鸟瞰图标注提示生成 CoT (Prompting with BEV Annotation): 针对 Teacher VLM 在直接生成多视角 CoT 时容易混淆空间关系的瓶颈,作者引入 3D 鸟瞰图(BEV)作为辅助空间 Prompt,引导 Teacher 模型生成极高质量的文本空间布局重构与推理思维链(CoT) ○ 规则可校验数据 (Rule-Checkable Data): 构建用于在线强化学习(RL)的验证集(包含单选、填空、OCR 及 3D 检测任务) ● 三阶段训练策略 (Training Strategy) 以Qwen2.5-VL 作为基座模型,采用“ViT-MLP-LLM”标准架构进行渐进式训练 Method: ○ Stage 1: 监督微调 (Supervised Fine-tuning, SFT) 混合使用 VST-P 数据集与通用多模态数据(如 LLaVA-OneVision),采用自回归目标训练 Training Strategy。 目的: 注入基础 3D 几何感知知识(如 3D 框定位、相对深度等),同时避免通用能力灾难性遗忘 Training Strategy。 ○ Stage 2: CoT 冷启动 (CoT Cold Start) 利用包含空间推理与通用 reasoning 的 CoT 数据继续训练 2 个 epoch Training Strategy。 目的: 引导模型建立“先用文本重构空间布局,再解答空间问题”的显式思考模式 Training Strategy。 ○ Stage 3: 强化学习 (Reinforcement Learning, RL) 使用 GRPO(Group Relative Policy Optimization)算法,省去 Value 模型,直接基于组内相对 Advantage 进行优化 Training Strategy。 混合奖励设计 (Mixed Reward):
R(y, \hat{y}) = R_{\text{acc}}(y, \hat{y}) + R_{\text{format}}(y, \hat{y}) 格式奖励 R_{\text{format}} 规范推理输出 Training Strategy。 对选择题/开放题采用标准准确率得分 Training Strategy;对 3D 目标检测,创新性地采用 3D IoU + F1 Score 的组合奖励(加权系数 \alpha=0.5):
R_{\text{3d}}(y, \hat{y}) = \alpha R_{\text{iou}}(y, \hat{y}) + (1 - \alpha)R_{\text{F1}}(y, \hat{y}) 这有效地避免了模型因过度预测假阳性(False Positives)来刷高 Recall 的问题 后续还扩展至具身智能 VLA 模型,在 LIBERO 机器人操控基准上,经过 VST 空间增强的模型在不依赖额外机器人预训练数据的情况下,直接微调便取得了 +8.6% 的成功率提升
ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models
https://arxiv.org/abs/2606.29579 妙手偶得,感觉解释性不是很好,不太有启发价值,看完没什么感觉 作者认为,VLM 可能并非完全缺乏空间推理能力,而是已有的空间相关信号被其他激活模式掩盖,因此可以通过重新调整内部激活强度来“唤醒”这些能力。 冻结 VLM 的全部预训练参数,只为每个 Transformer 层的 attention head 学习一个标量。该标量经过有界的tanh函数后,乘到最后一个 token 的 attention-head 输出上,从而放大或抑制不同 head 对最终预测的贡献。以 LLaVA-7B 为例,只需约 1\mathrm{K} 个可训练参数。 ● 在 SpatialEval 上,相比冻结模型,空间推理准确率最高获得 134.1% 的相对提升; ● 使用的参数量比全模型 LoRA 少约 2,500 倍; ● 在 COCOQA、VGQA 等真实世界空间 VQA 任务上,准确率提升至 90% 以上; ● 对 POPE 视觉幻觉测试也有改善; ● ScAle 与 LoRA 结合后,在部分任务上可以超过 LoRA-all,同时使用更少参数。 感觉解释原因有点奇怪“某些 VLM 的空间推理失败,可能部分是激活通路权重失衡,而不是模型完全缺乏空间表示能力。”感觉还是需要进一步的验证,这个解释方法和主流的想法还不太一样。
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
https://arxiv.org/pdf/2606.03988 感觉相当于说是,以前的工作没有让VLM在回答任务的时候,如果这个任务需要的场景并没有通过输入帧显式的展现,不会主动地想象来解决任务的这一个自己没见过的场景,导致回答问题表现不佳。所以本篇工作的主要思想是说,让VLM主动去想象这样一张为了解决问题而使用的可监督的视觉中间目标,然后来回答问题(可选显式生成和内化能力两条线路) ● 训练层面:输入图像和问题 学习生成 IPT 学习预测答案; ● 部署层面: ● 显式模式:输入 生成 IPT 重新编码 答案(耗时长,错误可能累计,效果不如直接回答); ● 直接模式:输入 答案。 这里的想象的图像,是作者设计好的三类任务上分别不一样的:PET:目标位置和方向下的新视角图像; PT:路径中间点的第一人称侧视图; MVC:整合多个视角后的俯视 BEV 图。这些视觉中间目标由三维场景渲染或场景标注构造出来。训练损失有两部分,一个是在 VAR latent 空间对想象图片的监督,另一个是标准的 LM loss。 但是他这里有一个训练小trick:训练的时候将一组数据分为两个线:一个使用GT imagination图来回答得到LM Loss,另一个使用流匹配来优化在 VAE Latent 空间中的生图质量
Vision-Language Memory for Spatial Reasoning
https://arxiv.org/abs/2511.20644 作者的观点是,现有的VLM在空间推理任务上表现不佳的原因在于:看不准3D+记不住跨视角的信息 这两个问题共同导致的。所以给出的解决方案也是针对这两个角度的,分别是采用 View-Consistent 3D Representation 和 Dual Memory 第一个部分的“View-Consistent 3D Representation”将 RGB 帧分别通过两个图像编码器(一个是语义图像编码器,一个是geometry encoder),然后将特征做了一个可学习门控融合 F_t^{pa}=F_t+\alpha_t\odot\phi(C_t)。紧接着在 geometry 信息这一侧,做了一个 Viewpoint-Aware Alignment,将geometry token和geometry encoder提供的 view tokens 融合起来,将后者注入 geometry token 中,G_t^{va}=MLP([G_t;\hat Z_t])。接下来做Semantic-Geometric Fusion H_t=Attention\left(Q(F_t^{pa}),K(G_t^{vc}),V(G_t^{vc})\right),效果大概是 “我是一个看起来像 chair 的 visual token,请告诉我跟我对应的几何结构、3D 位置和 viewpoint 信息。” 上述部分只是完成了感知这一部分,还每开展memory memory的部分其实是维护了两个: Memory 保存什么 类比 Working Memory (W_t) 最近 (L_w) 个 frame representation 短期记忆(FIFO来实现) Episodic Memory (E_t) 固定容量的历史 representation 长期记忆 同样使用atte机制来做query:M_t^w=Attention\left(Q(H_t),K(W_t),V(W_t)\right),相当于是做 “最近看到过的内容里,哪些和我现在看到的最有关?” 。Episodic Memory 的实现和Working Memory类似。 两个记忆库的协同依旧是可学习门控来完成: \gamma_t=\sigma(MLP([M_t^w;M_t^e])) \qquad M_t=\gamma_tM_t^w+(1-\gamma_t)M_t^e
VLM² 的绝大多数空间建模工作都发生在 LLM 前面。最终是: 3D-aware + history-aware visual representation ↓ language reasoning ↓ answer Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM