⚡ VLM Efficiency¶
🧠 NeurIPS2026 · 2 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (62) · 📷 CVPR2026 (63) · 🔬 ICLR2026 (18) · 💬 ACL2026 (6) · 🧪 ICML2026 (4) · 🤖 AAAI2026 (5)
- Beyond Selection: Token Parameterization for Extreme Visual Token Compression
-
Braco 不再从原始 patch 中挑出少数 token,而是用 DCT 低频骨干、基坐标嵌入、预算相关的坐标组织与稀疏池化空间残差构成紧凑视觉接口,在 576→16 token 时保留 94.0 的 Vanilla 归一化综合得分,并将全流水线 prefill 延迟降至 40.59 ms。
- G2TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
-
G2TR 在分离编码器统一多模态模型的 LLM 预填充之前,利用 VAE 潜在锚点选择并合并理解侧视觉词元;保留 50% 词元时,BAGEL 的理解相对平均分为 99.0%、编辑为 98.0%,预填充 FLOPs 降低约 1.94 倍,但并非所有任务都无损。