跳转至

🧠 VLM Reasoning

🧠 NeurIPS2026 · 2 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (171) · 📷 CVPR2026 (150) · 🔬 ICLR2026 (112) · 💬 ACL2026 (32) · 🧪 ICML2026 (31) · 🤖 AAAI2026 (10)

Can Linguistic Reasoning Vectors Enhance Multimodal Reasoning Ability?

LIFT 从基础大语言模型中提取“有无推理过程时,同一答案 token 的隐状态差”,将其注入对应视觉语言模型的语言层,在不更新主干的条件下,把两个模型的六任务平均准确率从 66.6/67.8 提升到静态干预的 68.3/69.0,向量适配后达到 69.1/69.4。

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

OneCanvas 将多视角图像的 patch 特征提升到 3D 后,作为独立连续 token 放到统一全景坐标系,用原生 RoPE 表达角度与帧序、用加性嵌入表达度量位置,再以合成空间课程预训练和真实问答适配,在 SQA3D、VSI-Bench、SPBench 分别取得 65.3、71.3、72.1。