🎬 视频生成¶
🧠 NeurIPS2026 · 8 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (172) · 📷 CVPR2026 (182) · 🔬 ICLR2026 (97) · 💬 ACL2026 (4) · 🧪 ICML2026 (32) · 🤖 AAAI2026 (11)
🔥 高频主题: 视频生成 ×2
- Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
-
SplitMoE 将视频扩散 Transformer 的稀疏专家分成语义与通用两组,用干净 VAE 特征引导语义路由,在总参数 27B、激活参数 14B 的预算下改善同源基线的视频质量,而非让所有专家强行承担等量 token。
- GLARE: Generating Listening Heads with Appropriate Reactions
-
GLARE 将倾听者的点头、微笑等反馈建模为有类别和时间边界的事件,通过韵律条件流匹配与训练期反应监督,在 RealTalk 和 Seamless 上提高反应一致性,但其指标衡量的是单参考一致性,而不是唯一正确的社交反应。
- Motion Forcing: Decoupling Ego and Object Motion via Sparse Inputs for Structured Video Generation
-
Motion Forcing 将稀疏物体轨迹与相机运动先转为动态深度,再用共享扩散骨干渲染 RGB 视频,在 Waymo 上取得 FVD 157.8、FVMD 205.2、Physics-IQ 33.2,以部分视觉分布相似度换取更好的运动一致性与物理合理性。
- PhyProbe: Rethinking Physical Consistency Evaluation in Generated Videos
-
PhyProbe 在冻结的视频编码器上训练轻量评分头,用异构数据提供的排序、严重程度回归与端点锚定共同学习单视频物理违规分数,在四个物理基准中的三个取得最高成对准确率,但其分数仍是感知合理性的代理而非物理定律检验。
- PISCO: Precise Video Instance Insertion with Sparse Control
-
PISCO 用可变密度条件训练、编码前补帧与编码后掩码,以及深度和外观增强,把少量实例关键帧传播到已有视频;在 PISCO-Bench 上,14B 模型的首尾帧控制将全视频 FVD 从 VACE 的 371 降至 204,但比较方法的输入条件并不相同。
- Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models
-
DyMoS 在图像到视频模型的早期去噪中,仅对文本条件分支的“非参考帧查询→参考帧键”自注意力 logits 减去可调偏置,使 Wan 2.2 的 VBench Dynamic Degree 从 51.7 提升至 64.8,但更强动态性并不自动意味着更真实的运动或更高的参考保真度。
- Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution
-
ReMind用事件帧图、可靠锚点训练和保留原始时空地址的KV缓存教视频生成器跨遮挡恢复状态,在STEVO-Bench取得最高总分300.9,但状态推进仅14.5%,证据仍主要支持短时恢复而非长期不可见物理演化。
- ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
-
ViTeX-Bench 用真实视频配对训练数据、冻结评测集和三轴 13 项指标揭示文字正确、运动稳定与背景保留之间的差异,并提供带运动对齐字形条件的 ViTeX-Edit-14B 参考编辑器,其字符准确率均值在受测视频原生编辑器中最高,但并非所有指标最优。