📹 视频理解¶
🧠 NeurIPS2026 · 1 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (110) · 📷 CVPR2026 (187) · 🔬 ICLR2026 (48) · 🧪 ICML2026 (17) · 🤖 AAAI2026 (27) · 🧠 NeurIPS2025 (39)
- TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
-
TT-VidT 用保持完整空间信息的首帧锚点和紧凑的可学习运动 token 重建后续帧,在约 170 万视频、8 epoch 的共享配方下突出提升运动敏感任务,同时将 TT3D 编码器计算量降至 456.1 GF,但不意味着通用视频理解或严格外观—运动解耦的全面领先。