🎬 视频生成¶
🎞️ ECCV2026 · 172 篇论文解读
📌 同领域跨会议浏览: 📷 CVPR2026 (182) · 🔬 ICLR2026 (97) · 💬 ACL2026 (4) · 🧪 ICML2026 (32) · 🤖 AAAI2026 (11) · 🧠 NeurIPS2025 (23)
🔥 高频主题: 视频生成 ×76 · 扩散模型 ×38 · 对齐/RLHF ×10 · 压缩/编码 ×8 · 语音 ×6
- End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
-
Resampling Forcing 用模型自身重采样得到带真实模型误差的历史,再以干净视频为目标训练因果扩散预测器,无需额外教师或判别器,并在原生 15 秒训练下改善长视频时间质量。
- ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
-
ShotStream 将多镜头视频生成改为基于历史画面的下一镜头预测,用稀疏历史条件、显式区分镜头边界的双缓存和两阶段自强制蒸馏,在单张 H200 上以 15.95 FPS 生成视频,并取得 0.978 的镜头切换控制分数。
- MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens
-
MemRoPE 不更新生成器权重,而是把离开局部窗口的历史内容持续汇入长短期 EMA 记忆,并在注意力计算时才给未旋转的键施加 RoPE,在固定缓存下支持小时级生成,LongLive 上 1 小时视频的 VBench-Long 均值为 87.99,对照方法为 87.01。
- AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
-
AnyFlow 将视频蒸馏从“每次预测干净终点”改为“学习任意时间区间的流映射”,再通过三段捷径反向模拟与分布匹配修正学生自身轨迹,使 14B 因果模型在 4 NFE 达到 84.05 VBench,并在 32 NFE 提升到 84.41。
- PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
-
PhyGDPO 提出了一种面向物理合理视频生成的成组直接偏好优化框架,用真实视频作为必胜样本、Plackett-Luce 成组概率模型替代两两对比以捕捉全局偏好,配合 VLM 引导的物理奖励重加权和 LoRA 切换参考机制,在 14B 参数量级下高效实现了优于 Sora2 和 Veo3.1 的物理一致性。
- VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
-
VGGRPO 将视频潜变量直接接入几何基础模型,用相机平滑与重投影一致性两种奖励做 GRPO 后训练,在 Wan2.2-5B 的动态场景测试中取得 66.00% 的运动质量胜率,并将奖励计算时间从 54.73 s 降至 41.33 s。
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
-
针对「从文本同时生成画面 + 同步音效」(T2SV)任务,本文用一个双 agent 的字幕改写框架(CRR)给视频塔和音频塔分别喂互不干扰的模态纯净字幕,再用双塔扩散 BridgeDiT 以双向交叉注意力(DCA)在两塔之间搭桥交换特征,在三个基准上多数指标取得 SOTA。
- Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion
-
Anchor Forcing 将提示切换时的证据保留与长时间生成时的位置分布对齐分别交给锚点引导重缓存和三区域 RoPE,在 60 秒交互视频上将 LongLive 基线的动态程度从 26.37 提升至 73.00、质量分数从 78.92 提升至 82.25。
- HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising
-
HiAR 让视频块依赖前序块在当前去噪步的输出,而非完全干净的预测,并用双向注意力下的教师轨迹正则防止运动坍缩,在 20 秒视频上取得 VBench 总分 0.821、Drift 0.257 和报告的 30 fps 吞吐量。
- PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
-
PackForcing把视频历史分为完整保留的起始锚点、压缩并动态检索的中段历史、完整保留的近期上下文,结合时间RoPE校正,让基于Wan2.1的模型用约5秒训练窗口生成120秒视频,在所测方法中取得最高的60秒与120秒VBench动态程度,但“固定活跃上下文”与“全部历史存储恒定”需要区分。
- Pathwise Test-Time Correction for Autoregressive Long Video Generation
-
本文提出无需训练的路径式测试时校正(Test-Time Correction,TTC),在少步蒸馏模型的采样中用首帧校准外观、重新加噪并恢复历史上下文,使 Self-Forcing 的30秒视频主体一致性从92.5升至94.0,但吞吐量从15.79降至10.53 fps。
- PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models
-
PhysRVG 用碰撞加权的真实轨迹偏差评价视频续写,并在强化学习探索失败时追加 Flow Matching 监督,使 PhysRVGBench 的 IoU 达到 0.64、轨迹偏移降至 15.03,但这些结果主要证明受限刚体场景中的轨迹拟合能力。
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
-
AnchorWeave 不把历史视角硬融合成全局点云,而是检索覆盖互补的局部点云、渲染多个锚点视频并学习协调它们,使 CogVideoX 版本在部分重访评测中的 PSNR 从单锚点的 19.01 dB 提升到 20.96 dB,SSIM 从 0.6145 提升到 0.6727。
- Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability
-
SSVAE 用潜变量掩码重建和局部相关正则,将视频 VAE 的通道谱塑造成少数主成分占优、时空频谱塑造成低频占优,在指定的 17 帧 512p 文本到视频实验中取得约 3 倍 UR 收敛加速,但不把生成改善等同于重建指标全面领先。
- LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing
-
LiveEdit 通过三阶段渐进蒸馏将双向扩散 Transformer 的编辑能力迁移到因果流式编辑器(4 步推理),并利用自注意力层在背景区域的高时序冗余设计 AR 掩码缓存,在保留双向模型编辑质量的同时实现 12.66 FPS 的实时推理。
- OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
-
OmniForcing 将 19B 的双向音视频模型 LTX-2 蒸馏为按秒联合生成的因果模型,以音频 sink 稳定训练、联合自强制缓解误差积累,并在单 H200 的 480p 设置下达到约 0.7 秒首块延迟和约 25 FPS,而非完全无损地保留教师质量。
- DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation
-
DualCamCtrl 将 RGB 与深度作为共同演化、分别建模的生成模态,通过语义优先的双向交互和三维融合改善相机轨迹遵循,在 RealEstate10K 文生视频实验中将 AC3D 的旋转误差从 2.67 降至 1.23,同时将 FVD 从 415.6 降至 408.1。
- Grounding World Simulation Models in a Real-World Metropolis
-
Seoul World Model(SWM)用跨时间街景数据训练检索增强的视频扩散模型,并以几何与语义双路条件、不断更新的虚拟前瞻锚点约束自回归生成,在未参与训练的釜山和安娜堡更准确地生成真实街道,而不是只生成外观合理的虚构城市。
- PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
-
PhysChoreo 将单图中的物体重建为可用语言编辑的部件级物性场,再用时序可编辑仿真驱动预训练视频模型,在论文的 10 个视频评测案例中获得更好的物理合理性与时序指令对齐,但并不保证最终画面严格遵守仿真。
- RefAlign: Representation Alignment for Reference-to-Video Generation
-
RefAlign 提出参考对齐损失(RA loss),在训练时将 DiT 参考分支的中间特征显式对齐到视觉基础模型(VFM)的语义空间——正项拉近同主体特征保证身份一致性,负项推远不同主体特征增强语义判别力——推理时移除对齐模块实现零额外开销,在 OpenS2V-Eval 上 TotalScore 达到 SOTA(60.42%),有效缓解了参考-to-视频生成中的 copy-paste 伪影和多主体混淆。
- WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation
-
WorldWander 将同步的第一/第三人称视频放入 Wan2.2-5B 的联合注意力,并让对应帧共享时间位置编码,以 LoRA 学习无需相机位姿或深度的双向视角转换,在 EgoExo-8K 真实场景的 ego→exo 任务中将 FVD 从微调 ReCamMaster 的 968.1 降至 374.7。
- Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models
-
StEvo-Bench 通过225项自然过程任务,把“遮挡或镜头移开后,世界是否仍在演化”变成可诊断的评测问题,发现所测模型在中断观察时的任务成功率均低于10%,而准确记住旧画面并不等于正确更新世界状态。
- Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention
-
RAD 在视频 DiT 的局部注意力之后加入循环记忆,用逐帧重叠窗口传递细节、用干净隐状态预取加速训练;Minecraft 上 LSTM-f 相比 LSTM-c 将 PSNR 从 14.24 提高至 16.59,但优势并不覆盖所有数据集和指标。
- TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning
-
TinyHistory 先让轻量历史编码器学会从任意时间位置查询画面,再与视频扩散模型联合学习续写,在 Wan 2.1 的 480p 评测中将历史上下文降至 195 tokens/s,同时获得高于滑动窗口的角色一致性与用户偏好。
- Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
-
Unison 将人物视频中的语音和音效分开生成,再用语义门控协调声学信息、用渐进式跨模态 forcing 学习音画互相引导,在自建留出测试集上改善音频质量和整体时间同步,但口型同步与视觉美学并未全面超过 LTX-2。
- Video Generation Models are General-Purpose Vision Learners
-
GenCeption 将 WAN 文本到视频生成模型改造成文本指令控制的单步感知网络,通过 RGB 化目标、稀疏查询 token 和统一 L2 后训练支持多种任务,在多个基准接近或超过专用模型,但稀疏关键点与稠密任务的联合训练仍有明显冲突。
- Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
-
CamVerse 把生成视频与参考视频的三维相机轨迹转化为分段相对位姿奖励,用在线 GRPO 改善相机控制;表 1 中 T2V 平移误差从 SFT 的 0.0395 降至 0.0293,但 I2V 感知质量并非同步提高。
- VOID: Video Object and Interaction Deletion
-
VOID 把视频对象移除从局部补洞扩展为下游交互重写,利用反事实配对训练、VLM 四值掩码和可选的光流噪声第二遍生成,在真实视频七选一人类评测中获得 64.8% 的选择率。
- DeRA: Decoupled Representation Alignment for Video Tokenization
-
DeRA 把一维视频分词器的外观与运动表示分开学习,分别接受图像和视频基础模型的监督,再用对称梯度投影缓解共享编码器上的目标冲突,在相同 1024 token 预算下将 UCF-101 重建 rFVD 从 LARP 的 20 降到 15,并改善下游自回归生成。
- Egocentric World Model for Photorealistic Hand Object Interaction Synthesis
-
EgoHOI 把手部运动学、度量头部运动和首帧物体外观编码为三路条件,注入 Wan 2.1 14B 的视频潜空间,在不提供未来物体状态的前提下生成第一人称手物交互,在 HOT3D 评测中达到 PSNR 21.05、手部缺失比例 5.84%。
- FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
-
FreeSwim 将预训练视频 DiT 的高分辨率细化拆成负责细节的向内滑窗分支和提供全局语义的全注意力分支,通过交叉注意力覆盖与跨步缓存,在不训练新参数的条件下取得 Wan2.1-1.3B 的 1080P VBench 总分 73.7%。
- LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion
-
LatSearch 训练了一个能对去噪轨迹中间态潜在向量(而非解码后视频)直接打分的潜在奖励模型,并用它驱动「奖励引导重采样 + 剪枝(RGRP)」在潜在空间做推理时搜索,从而在视频扩散上做到与 SOTA 相当甚至更好的质量,同时把运行时间最多减少 79%。
- MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
-
MemoBench 用 360 段“可见、消失、重现”视频检验生成模型是否记住并更新视野外的物体状态,评测 10 个模型发现最高目标重现分数 ORS 仅为 0.582,而且不执行镜头运动也能获得虚高的一致性分数。
- PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion
-
PAI-Studio 将前景视频和 1–3 张背景参考图作为联合生成条件,用真实镜头数据、时间位置编码克隆及双向注意力同时学习背景运动、前景保持和重光照,在 Cine-Restore 多参考图设置下获得 MSE 0.00645、SSIM 0.789 和 LPIPS 0.197。
- InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars
-
InteractiveAvatar 将长短期视觉记忆与意图驱动的动作控制接入自回归扩散数字人,在 576p 实验设置下达到 26.68 FPS,并改善长视频中的物体保持和文本指令对齐,但完整交互链路首帧仍需约 2.6 秒。
- MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
-
MMControl 提出首个面向联合音视频生成的多模态统一控制框架,通过 MMCU 将参考图像、参考音频、深度图和姿态序列等异构控制信号统一编码,经双流旁路架构非侵入式注入冻结的 Joint DiT 骨干,并在推理时以模态专属引导缩放因子独立调节视觉与声学控制强度,在身份一致性、音色保真度和结构对齐上全面超越现有单模态控制方法。
- MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
-
MoGAN 在三步 Wan2.1 蒸馏模型上联合学习光流真假判别与分布匹配约束,将 VBench 的 Motion Score 从 DMD 的 0.859 提高到 0.973,同时保持三步推理路径。
- OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data
-
OmniDance 用约 30 万段互联网舞蹈视频和相互配合的音乐注入、课程训练、分模态采样策略,将 Wan2.2-TI2V-5B 扩展为统一的文本/音乐/联合驱动舞蹈视频模型,在 CIPE-Dance 测试集上提升整体质量与控制能力,但联合输入并不保证每项指标都最好。
- Rethinking Reward Signals in Video GRPO: When Scores Become Targets
-
TaRoS 根据同一提示词下候选视频的奖励均值与组内稀疏度动态组合奖励,让视频 GRPO 的优化方向随训练状态调整;在 Wan2.1-T2V-1.3B 上,同用 Qwen2.5-VL-72B 评审器时,VBench 总分由 DanceGRPO 的 79.72 提升至 80.56。
- Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion
-
Stream-DiffVSR 用四步扩散去噪、光流对齐的历史输出引导和时序解码,逐帧恢复高清视频,在不读取未来帧的条件下取得 REDS4 LPIPS 0.099 与 RTX 4090 上 720p 首帧延迟 0.328 秒,但尚非通常意义的实时高清视频处理。
- SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
-
SVG-EAR 不再只保留注意力分数最高的块,而是用簇中心补偿未精算的块、把预算留给补偿误差最大的交互,在无需训练的情况下,使 HunyuanVideo 720p 文生视频相对全注意力达到 31.043 dB PSNR,并获得 1.93 倍端到端加速。
- Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
-
VideoScience-Bench 把视频模型放进需要组合科学概念的实验场景,再用专家五维评分和证据约束的 VideoScience-Judge 检查其生成结果,发现视觉连贯远不等于现象正确,而清单增强评审与专家排名的 Spearman 相关系数达到 0.96。
- Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints
-
本文提出用稀疏3D手部关节点作为显式控制信号驱动第一人称视频生成,通过遮挡移除的上下文聚合、3D深度加权的遮挡感知传播和3D几何嵌入三个关键设计,在WAN 2.1基础上以仅~20k参数的轻量模块实现精细的手物交互视频控制,性能大幅超越现有2D轨迹和隐式姿态方法。
- IC-World: In-Context Generation for Shared World Modeling
-
IC-World 把同一世界的多视角图像拼成一个网格来联合生成视频,再用三维几何与运动一致性奖励做 GRPO 微调,在双视角动态场景测试中将 Wan2.1 基线的 M-FID 从 185.2354 降至 157.6099。
- VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
-
VIGOR 用 VGGT 的浅层注意力挑选可靠几何区域,再以跨帧逐点重投影误差评价视频,通过 SFT/DPO 或推理时搜索改善几何一致性,在 CausVid 的 Best-of-10 实验中将 PSNR 从 19.68 提高到 22.66 dB。
- ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
-
ID-LoRA 用共享的音视频生成骨干读取人物首帧和参考声音,通过负时间位置区分参考与目标、通过身份引导强化音色,在保持人物身份的同时允许文本改变场景和说话方式,跨视频测试的说话人相似度达到 0.477。
- In-Context Sync-LoRA for Portrait Video Editing
-
Sync-LoRA 用高同步合成视频对训练 LTX-Video 的上下文 LoRA,让编辑后的首帧决定外观、干净源视频决定动作,在保留人物身份的同时取得编辑保真与逐帧同步的较好折中,而非每项同步指标均最优。
- Learning to Generate Rigid Body Interactions with Video Diffusion Models
-
KineMask 通过速度掩码控制、逐步撤去未来运动条件的两阶段训练及事件文本条件,让视频扩散模型从单幅图像和初始速度生成后续刚体交互,并在合成测试及真实场景观感评估中改善运动与交互质量。
- Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
-
把主体驱动视频生成(SDV-Gen)拆成「从主体-图像对学身份注入」与「用 4,000 条任意视频守住运动感知」两个交替优化的子任务,在 CogVideoX-5B 上用 200K 主体-图像对 + 4,000 视频、288 A100 小时完成微调(约为既有零样本方案训练算力的 1%),推理时不做任何逐主体调优即可生成保身份、有运动的视频。
- Tuning-free Visual Effect Transfer across Videos
-
RefVFX 用跨内容、同效果的训练三元组和联合视频条件,让一个经过训练的扩散模型把参考视频中的动态特效迁移到另一段视频或图像上,无需针对新效果微调,并在 Neural V2V 用户研究中以 65.7% 的整体匹配胜率超过 Lucy Edit。
- AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors
-
AHOY 从严重遮挡的单目 YouTube 视频中重建完整可动画的 3DGS 化身——先用 DensePose+FLUX+多视角扩散粗建 canonical 化身,再通过 LoRA 微调的 Wan 2.2 视频扩散模型做 RF-Inversion 生成多视角"幻觉"监督视频,最后用 map-pose/LBS-pose 解耦吸收生成数据的不一致性,训练出带姿态依赖形变的高保真高斯图化身。
- AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
-
AR-CoPO 提出分块级对比策略优化框架来对齐少步自回归视频生成器:通过分叉机制在随机选取的 chunk 处构造初始噪声邻域候选、局部 GRPO 更新实现信用分配,绕开了 SDE 式 GRPO 与一致性模型近确定性动力学之间的根本性不匹配;同时设计半在策略训练范式利用固定参考回放和 ratio clipping 信任域来提升文本语义对齐质量,避免纯探索导致运动质量崩溃,在 Self-Forcing 上实现 VBench 和 VideoAlign 双基准联合提升。
- CameraAnything: Refilming Videos with Arbitrary Camera Control
-
CameraAnything 将逐像素相机射线注入视频扩散模型的注意力位置编码,并用可独立变化的合成相机监督训练,在一次生成中联合改变视点、焦距、画幅和镜头切换,在 DAVIS 重拍评测中将旋转误差从 ReCamMaster 的 5.11982 度降至 2.7600 度。
- ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering
-
ControlHair 先让物理仿真器决定头发如何运动,再以逐帧发丝图和人体姿态约束视频扩散模型生成外观,在10段 VEO 2 合成视频的重建任务中取得17.15 dB PSNR,但这一结果验证的是控制信号遵循能力,不是端到端物理精度。
- DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models
-
DiffHDR 把单段 8-bit LDR 视频中被裁剪的高光和被噪声淹没的暗部视为辐射度修复区域,借助 Log-Gamma 映射在冻结的 LDR 视频 VAE 潜空间中生成 HDR;它在 Cinematic Video 的 FOVVDP 上达到 6.89,优于 SingleHDR 的 6.56,并支持文本或参考图控制恢复内容。
- DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
-
RTR-DiT 先自建一套文本/参考图配对的视频风格化数据微调出双向 DiT 教师,再用自强制(Self Forcing)与分布匹配蒸馏(DMD)把它蒸馏成 2 步因果自回归生成器,配合"参考保持"的 KV cache 更新策略,在单张 H20 上对任意长度视频做流式风格化,并支持运行中实时切换文本提示或参考图。
- EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics
-
EcoVideo 把云边视频生成从“大小模型接力去噪”改为“云端生成高信息关键帧、边缘补齐中间帧”,用注意力熵和资源感知调度组织计算,在 Wan2.1 主实验中取得 1.84 倍端到端加速,云端算力受限实验中达到 2.91 倍。
- EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow
-
EFlow 用「可丢 token 的门控局部–全局注意力」加一套「跳层弱路径引导 + 均值速度可加性正则」的解流匹配训练配方,让 4 步视频生成器可以从零、单阶段地训出来,训练吞吐比标准解流匹配高 2.5×,推理延迟比 50 步模型低 23×–234×。
- FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control
-
FlexAM 用掩码视频指定外观、用带有多频位置编码和动态深度的可变密度三维点轨迹指定运动,使同一个视频扩散模型支持外观编辑、相机控制和物体操作,在论文运动迁移实验中取得 32.55 的文本对齐分数和 0.976 的时间一致性分数。
- GimbalDiffusion: Gravity-Aware Camera Control for Video Generation
-
GimbalDiffusion 用重力对齐的全景视频构造极端视角训练样本,再用水平视角生成文本描述以减轻文本与角度的纠缠,使 WAN 2.2 5B 在 SpatialVID-extreme 上的 PitchErr 从无 null-pitch 时的 14.39° 降至 8.36°,但并非所有视觉质量指标都随之改善。
- Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
-
Goku 用分任务合成与渐进过滤构建 200 万视频编辑对,并以带掩码分支和空间引导的 Goku-Edit 将 Goku-Bench 纯指令任务 IF 从 LucyEdit 的 0.549 提高到 0.627,支持外观、结构、参考图和组合编辑。
- LibraGen: Playing a Balance Game in Subject-Driven Video Generation
-
LibraGen 以 9,000 条高质量 SFT 样本适配视频基础模型,通过配对数据对应的 LoRA 合并、互补 DPO 和动态 CFG 保留主体身份与生成能力,在自建基准的表 1 中取得 3.594 的文本对齐分数。
- Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
-
InteractAvatar 用感知规划与视频合成双流并行生成运动和画面,使数字人能在参考图像的原有场景中遵循文本与物体交互并按音频说话,其文本加音频联合生成模式在 GroundInter 上达到 VLM-QA 29.07、PI 0.850。
- MemLearner: Learning to Query Context Memory for Video World Models
-
MemLearner 提出一种基于可学习查询令牌(Q tokens)的自适应上下文记忆机制,让视频世界模型在生成长视频时能端到端地学会"从历史帧里查什么信息有用",而非依赖人工规则检索关键帧。Q tokens 作为 C(context)和 P(predicted)之间的信息桥,在预训练 Video DiT 内部通过 3D 注意力完成上下文查询,配合浅层查询+深层生成的分层策略和注意力裁剪大幅降低计算开销;在遮挡和动态物体场景下,PSNR 比 CaM 提升 1.38 dB,LPIPS 降低 0.057。
- Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors
-
本文提出 NeFIC,将超低码率图像压缩(ULB-IC)中的生成式解码重新解释为从 compact anchor 到最终重建图像的虚拟时间演化过程,利用预训练视频扩散模型(VDM)作为时序先验做下一帧预测,并通过两阶段训练(区间适配 + 单步生成旁路)实现高质量、高效率的极低码率图像压缩。
- OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
-
OmniHuman 将 1 百万段人物视频组织成场景、交互、个体三级监督,并用同层级的 OHBench 诊断生成质量;在其中 20% 数据上微调 LTX-2,改善了音画对齐与多数人物指标,但并非所有指标都提升。
- OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
-
OneVAE 在共享视频 VAE 中交替训练连续与离散重建,并结合渐进初始化和结构改进,使统一训练消融的 PSNR 从 27.22 提升到 28.15,同时让同一压缩配置的模型支持两种潜表示。
- PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
-
PhyDetEx 用 2,588 对正常/物理异常视频对 Qwen2.5VL 7B 做 LoRA 微调,将物理合理性判断和文字解释统一成语言建模任务,在 PID 测试集上取得 75.6% 的异常类准确率、83.5 的报告 F1 和 4.24 的解释评分。
- TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy
-
TryOnCrafter 先把目标服装转入可动画的高斯人体,再与背景点云对齐并沿新相机轨迹渲染,以此引导视频 DiT 生成试衣视频,在 CaM-VVTBench 上取得 75.47 的 Overall Score。
- Versatile Editing of Video Content, Actions, and Dynamics without Training
-
DynaEdit 在预训练 I2V 流模型(WAN2.1 14B)上构造一条从源视频直通编辑视频的"无噪声编辑轨迹",把起始步一路推到纯噪声以释放粗粒时空结构的改写能力,再用相似度引导聚合(SGA)挑出最不偏离源视频的编辑方向、用退火噪声相关(ANC)压掉由此引入的高频抖动,从而在完全免训练的前提下同时支持物体插入/替换、动作改写与全局动态效果三类编辑,效果追平唯一的训练式商用模型 Runway Aleph。
- ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images
-
ViBe 在已有视频 DiT 上只用图像完成分辨率适配,通过推理时移除模态适配器、保留空间适配器,再结合稀疏注意力和高频重构训练,在表 1 的 4K 设置下取得 74.4% 的六指标均值,比 CineScale 高 0.8 个百分点。
- Accelerating Text-to-Video Generation with Calibrated Sparse Attention
-
CalibAtt 将视频扩散模型中跨输入稳定的注意力块稀疏性与空间行重复性离线编译为两种执行路径,在不更新权重的情况下,使 Wan 2.1 14B 的 720p 生成延迟从 1244 秒降至 785 秒,同时保持相近的 VBench 表现。
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
-
AVTok 提出首个统一的音视频 tokenizer,用双流 Transformer 架构(共享编解码器 + 模态特定可学习查询)将音视频对联合编码到单个 1D 离散隐空间,配合 VFAL 分层训练策略和表示对齐学习,在重建质量和下游自回归生成任务(A2V / V2A / 联合生成)上均达到领先水平,且参数量和计算量远小于主流双分支方案。
- ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation
-
ConfCtrl 用首尾帧视频插值提供生成先验,以置信加权的点云投影潜变量改变 rectified flow 的起点,再用预测—更新模块修正相机条件,在 CO3D-Hydrant 上取得 15.54 dB PSNR、0.143 m 平移误差和 0.103 rad 旋转误差。
- Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency
-
Cycle-World 用反向模型检查“当前生成的视频块能否重建它的上一块”,将这一约束同时用于训练和推理期潜变量修正,使 60 秒 VBench 总分达到 82.88,并提升物理一致性,但并未证明任意长度视频都不会漂移。
- DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation
-
DCARL 先联合生成覆盖全程的稀疏关键帧,再以带噪关键帧和干净历史帧约束逐段插值,将 OpenDV-YouTube 上 32 秒视频的 FVD 从 SEVA 的 548.0 降至 203.7,同时将相机轨迹误差 ATE 从 0.294 降至 0.237。
- EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
-
EmbodiedHead 用显式听说状态把单流音频转为连续的 FLAME 头部动作,并通过少步 Rectified-Flow DiT 与可微渲染器联合优化,在单张 RTX 3090 上实现包含渲染的 59 FPS,同时减少倾听时的错误张嘴。
- FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control
-
FlexComposer 把「往已有视频里插入素材」统一成轨迹引导的条件生成:先用 Grounded-SAM2 + SpatialTracker 把静态图或动态视频前景归一到「居中、原地运动」的规范表征,再利用 VAE 隐空间的平移等变性把这份表征无参数地搬到用户 3D 轨迹投影出的隐坐标上,最后由 Wan2.1-I2V-14B 视频扩散 Transformer 负责光照、阴影与遮挡融合,在 DAVIS 的 V2V 设定下把轨迹误差 EPE 压到 2.15、FVD 压到 82.6。
- From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
-
本文把外中心到内中心(Exo2Ego)视频生成从"条件-输出"改写成一条连续序列的生成:用一个冻结的帧插值器在最后一个 exo 帧与第一个 ego 帧之间造出过渡视频、再对相机位姿做 Slerp/线性插值,把 exo、过渡、ego 三段首尾相接成 \(S=(X,I,G)\) 交给 Diffusion Forcing Transformer 逐帧独立加噪建模,在 Ego-Exo4D 的 Health / Bike / Cooking 三个类别上 PSNR、SSIM、LPIPS 全面优于 TrajectoryCrafter、Wan-FCtrl、Wan VACE 与 Exo2EgoSyn。
- HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion
-
HairWeaver 用 CG 物理仿真批量生成约 1,500 段带精确头发运动条件(逐像素 UVW 缓冲)的人体视频,再通过「先训练一个临时的 Style-Alignment-LoRA 把预训练视频 DiT 拉到 CG 域、冻结它之后训练 Motion-Context-LoRA 学运动控制、推理时把 Style-Alignment-LoRA 整个丢弃」的两阶段 sim-to-real 策略,在保住照片级真实感的同时拿到细粒度可控的头发动力学,在自建 CG 测试集与真实人像测试集 NeRSemble 上全面超过 Wan-2.2-Animate、UniAnimate-DiT 等方法,用户研究中以 49.9% 的偏好率领先次优方法的 16.4%。
- Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation
-
InfCam 用无穷单应性提供不依赖深度的旋转条件,让冻结的 Wan2.1 配合可训练控制层学习平移引起的残余视差,再用轨迹和焦距增强消除训练配对偏差,在 WebVid 上将旋转误差从 TrajectoryCrafter 的 5.007 降至 3.162。
- Layer-Aware Video Composition via Split-then-Merge
-
Split-then-Merge(StM)把无标注视频自动拆层后学习重建,通过扰动前景条件和分区加权监督,将已有动态主体融入新背景,在 DAVIS 跨视频合成测试中取得优于比较方法的前景身份、背景身份及动作与背景运动指标。
- Learning Transferable Dynamics Priors from Action to World Modeling
-
提出 A2World,在大规模(215.6 万条轨迹、20+ 机械臂形态)真实机器人操控数据上预训练一个以动作为条件的多视角扩散世界模型,学得的动作→动态先验可适配为长程仿真器(A2World-sim)或指令驱动策略(A2World-policy),在 LIBERO 基准和真实机器人上均达到领先性能。
- Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing
-
Memory-V2V 将历史编辑视频作为可检索、可压缩的视觉约束接入视频扩散模型,在三轮新视角合成中将平均 MEt3R 从 ReCam 独立生成的 0.1892 降至 0.1357,并支持跨片段保持外观的长视频编辑。
- MSEditor: Toward Consistent Multi-Shot Video Editing
-
本文提出首个面向多镜头视频编辑的框架 MSEditor:把多视角视频数据集改造成带几何一致掩码的多镜头监督信号,用零初始化的 Supervisory Adapter 把跨镜头先验注入 Wan2.1 扩散骨干,再用 Cross-Shot Packing 与 Sparse Cross Attention 让语义相关的镜头在同一注意力窗口里交换特征,从而在单次推理内把首帧上的编辑意图一致地传播到所有镜头。
- PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation
-
PhysRAG 将检索增强生成(RAG)引入视频扩散模型:先从手工构建的物理视频数据库中检索与输入 prompt 物理属性最相关的参考视频,再用 VideoMAE V2 编码其时空特征,最后通过一组可学习查询(learnable queries)作为信息瓶颈选择性提取物理先验并注入 DiT 去噪过程,在 PhyGenBench 物理常识基准上以平均分 0.58 达到 SOTA,同时推理开销仅增加 1.24%。
- Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows
-
本文把 2B 参数的预训练潜空间视频扩散模型 LTX-Video 在城市 CFD 数据上微调成 WinDiNet,用不足一秒生成 112 帧 2D 风速序列、在多项指标上超过专门设计的神经算子,并且因为整条前向链路端到端可微,可以把舒适度损失直接反传到建筑坐标上做布局逆优化。
- Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation
-
RCM 将复杂姿态的单张或多张角色图像转成规范 A/T 姿态的高分辨率环绕视频,利用视频先验、逐像素相机条件和三阶段训练改善新视角合成,再由独立的重建模型生成网格。
- Seeing Fast and Slow: Learning the Flow of Time in Videos
-
本文先利用音频变调和时间重采样学习视觉速度感知,再标注 SloMo-44K 慢动作数据,将其用于显式速度控制生成与联合去模糊的时间超分辨率;在模糊输入的 8 倍重建中,FVD 从基础模型的 436.1 降至 134.3。
- SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning
-
SHIFT 用光流残差与长时点轨迹学习运动奖励,将生成样本的优势加权去噪与真实视频的监督锚点结合,在 SVD 上以 SFT 的 2.46 倍单轮训练时间获得 86.70 的 VBench Motion,主要价值是避免微调把视频变得近乎静止。
- SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models
-
SIFT 提出自想象微调范式,抛弃真实视频输入、从纯高斯噪声出发让扩散模型仅凭 LLM 生成的文本提示"想象"并生成视频,结合双分类器运动感知判别监督和渐进式困难样本回放策略,在不依赖运动解耦标注数据的情况下,显著提升 Wan 和 CogVideoX 两个主干模型生成视频的物理合理性与运动解耦能力,VLM 和人类评估均一致优于 SFT 和 VideoREPA 等基线。
- Surprise Forcing: What to Remember, When to Skip in Long Video Generation
-
Surprise Forcing 在已有 LongLive 自回归视频模型上,以惊讶度选择值得长期保存的历史帧,并给简单视频块减少去噪步数,无需额外训练,在 60 秒 VBench-Long 上达到 81.88 质量分、17.18 FPS,但并不比 LongLive 本身更快。
- Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?
-
本文提出 Target-Bench——首个评测视频世界模型"依据自然语言语义目标做无地图路径规划"能力的基准:用四足机器人在真实室内外环境采集 450 个目标导向场景(47 类语义目标、含 72 个隐式目标,附 SLAM 米制轨迹与点云),把模型生成的未来视频经三维重建与段级尺度恢复还原成轨迹,再用趋势导向的指标(终点接近度 SE、通道一致性 AC 与加权总分 WO)量化规划能力;最强的现成模型 Wan2.2-I2V-Flash 只拿到 0.368,而用 325 条真实场景微调开源 5B 模型可把总分从 0.068 提到 0.428。
- Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption
-
ISPA 在视频生成的短暂预热阶段拟合局部注意力与完整注意力的差异,将可压缩层的历史影响吸收到输出投影权重中,使 LongLive 的 ISPA-0.5 在 30 秒测试中仅保留 54.2% 的 KV 缓存、主体一致性由 96.10 变为 95.61,但这并不意味着所有模型和指标都严格无损。
- TriMotion: Modality-Agnostic Camera Control for Video Generation
-
TriMotion 用几何落地的三元组数据将视频、位姿、文本变成统一相机运动条件,再以冻结的潜空间运动预测器约束视频生成,位姿条件 V2V 达到 FVD 221.59、CamMC 3.6797,同时支持跨模态运动组合。
- When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators
-
MotionEcho 保留蒸馏学生的少步生成主干,仅在运动误差需要时调用细步教师修正干净潜变量端点,使 TurboBench 上的 8 步运动迁移在 9 秒内达到 0.931 的运动保真度,而完整 VideoCrafter2 上的 MotionClone 为 114 秒、0.876。
- WorldCache: Content-Aware Caching for Accelerated Video World Models
-
WorldCache 在不重训练视频扩散模型的前提下,联合改进缓存命中判据与命中后的特征近似,在 Cosmos-2B 图像条件生成实验中把延迟从 55.04 秒降至 24.48 秒,同时将 PAI-Bench Overall 从 0.8030 保持到 0.7977;论文标注为 2.3× 加速,但其倍数与质量保留率存在需要区分的舍入口径。
- Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation
-
本文把视频偏好对齐串成“高一致性标注校准、多维奖励学习、Wasserstein 约束的 GRPO”三个环节,将动作维度无平局成对准确率从 80.30% 提升到 83.33%,并改善三个视频生成基座的报告综合分数,但收益并非覆盖所有子指标。
- Better Call CineCrew: Consistent Ultra-Long Narrative-to-Film Generation
-
CineCrew 不重训视频模型,而是用 FilmDSL 把叙事、镜头调度、资产和修复反馈组织成可执行的制作流程,在 20 个 MovieBench 叙事输入上改善人物、道具与故事衔接,但并非所有画质和物理指标都领先。
- Controlling Motion Transfer in Diffusion Transformers via Attention Heads
-
HALO 在视频 DiT 中分别识别运动头和结构头,用语义校正后的位移监督潜变量、用低熵头的参考值特征保留布局,在不更新模型参数的前提下将主基准运动保真度 MF 从 DiTFlow 的 59.6 提升至 66.2,同时保持目标文本一致性。
- CustomX: Unified Character, Action, and Scene Customization in Video World Models
-
CustomX将3DGS场景、多视角角色与文本指令统一建模为条件自回归视频生成问题,用户提供任意场景与角色后可通过自然语言驱动角色执行上百种动作,在生成质量、角色一致性和动作控制成功率上全面超越基础模型与专用世界模型。
- DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
-
DeforM 将“什么物体应当发生形变”的视觉语言推理转成时空掩码,通过免训练注意力调制或可训练双注意力注入引导 Wan2.2 视频生成,在形变测试集上将同底座的物理综合评分从 3.49 提高到 4.40,但这代表评估模型认可的物理合理性,而非物理定律的硬保证。
- Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval
-
针对确定性点匹配忽略多模态语义歧义与一对多对应关系的问题,本文提出分布对齐桥接框架(DAB),将文本与视频建模为高斯分布,并借助无随机采样的确定性截断扩散桥将文本分布平滑迭代对齐至视频分布,配合方向性 KL 散度对比学习实现了显著的召回率提升与不确定性感知检索。
- EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis
-
针对传统视频风格化中参考图像内容泄露、高质量配对数据匮乏以及长视频时序漂移三大瓶颈,EchoStyle 基于 Wan2.2-I2V 构建了多通道隐空间视觉对齐架构,首创“真实风格视频到合成真实视频”的逆向数据合成管线建立 20k 高清配对数据集 V-Style20k,并配合初始-跟随双模态机制与滑窗推理,实现了兼具精细内容保留与卓越动态时序一致性的任意长度文本驱动视频风格化。
- EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
-
针对文生视频扩散模型中概念纠缠与全局擦除损伤背景的问题,EraseSAE 提出分解-归因-擦除范式,利用双分支卷积稀疏自编码器(PConvSAE)提取单义特征并结合时步动态时空掩码进行空间调制分类器自由引导,实现高精度、低附带损伤的手术式概念擦除。
- Event-Driven Video Generation
-
EVD 给预训练视频 DiT 加了一个轻量 token-level event head,并在训练和采样时用事件门控约束 latent update 只发生在交互真正活跃的区域,从而减少物体提前动、接触缺失、支撑关系跳变和事件后漂移等视频生成动态错误。
- GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
-
针对视频生成中刚性表面形变与遮挡再现不一致两大几何失真难题,GeCo 提出结合光流刚性残差与深度重投影误差的无量纲稠密评估指标,既能精准定位并度量视频几何伪影,又可作为免训练引导目标显著压制生成视频中的虚假运动。
- GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors
-
针对传统扩散与流匹配模型从标准高斯噪声起步导致采样步数多、时空不一致的痛点,GeoFlow 利用多视图度量几何与空间自适应噪声注入构建几何对齐先验分布作为源分布,极大缩短并拉直传输路径,仅需 8 步采样即可超越 40 步基线生成质量。
- GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis
-
GeoNVS 提出即插即用的 GS-Adapter,把参考视角的扩散特征"抬升"到 3D 高斯里再渲染回目标视角,在特征空间而非图像输入端注入几何先验,从而在相机可控性和几何一致性上大幅超越 SEVA / CameraCtrl,平移误差最多降 2 倍、Chamfer 距离最多降 7 倍。
- GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models
-
GO-Renderer 提出一种将前向粗糙 3D 几何代理与视频扩散 Transformer(DiT)紧密结合的生成式物体渲染框架,利用以物体为中心的 3D 坐标图和负向旋转位置编码(Negative RoPE Shift),摆脱了对复杂 PBR 材质逆渲染的依赖,实现了任意视角轨迹与任意光照条件下的高保真、多视角一致物体视频渲染。
- GraphVid: Interactive Graph-Controllable Video Generation
-
GraphVid 提出通过有向交互场景图对单帧图像中的多实体动态进行交互式控制,利用边感知图同构网络将关系语义注入消息传递,并通过轻量级适配器与 LoRA 引导冻结的视频扩散变压器,仅需 0.6B 可训参数与 27K 训练数据即在感知质量与运动精度上超越依赖海量轨迹监督的 SOTA 方法。
- HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
-
HairOrbit 借助视频扩散模型内在的跨视角时空先验,将单张肖像的发丝级 3D 头发重建任务重塑为标定的多视角重建流程,配合全视角神经朝向提取器与结合占据和方向的混合隐式场,显著消除了遮挡区域与侧后视角的发型失真。
- ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning
-
ICDepth 提出一种基于上下文条件化(ICC)的视频深度估计框架,利用原生 3D 注意力的文生视频扩散模型,通过 SAND-Attention 解耦噪声污染与 RoPE 对齐,并结合 SRFM 注入语义与分辨率先验,仅用 0.8M 帧合成数据即可在多项基准上超越 SOTA。
- Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching
-
提出单阶段样本引导分布匹配框架 DM-Align,将少步蒸馏梯度与人类偏好对齐梯度在统一分数空间协同聚合,彻底绕过传统强化学习的多步采样瓶颈与后蒸馏模型崩溃难题。
- MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation
-
针对大规模视频扩散模型全量微调与现有 PEFT 显存开销巨大、高噪声阶段奖励优化不稳定的瓶颈,MagicPrompt 提出在冻结主干的自注意力与交叉注意力层中嵌入轻量级软提示并辅以分布偏移校准,结合像素与隐空间双域反馈,以不足 1% 的可训练参数量在 T2V、I2V 及 Control2V 任务上取得超越或媲美 LoRA 的生成质量。
- Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation
-
针对现有视频生成评测指标对几何畸变迟钝或对前景运动过度敏感的问题,本文提出基于静态背景多区域位姿发散度的评测指标 SGC,通过解耦动静区域并计算局部与全局相机运动一致性来精确量化动态生成视频的 3D 空间几何一致性。
- MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
-
针对长时序多视角动态场景视频生成中跨视角几何不一致与长序列误差累积问题,MV-Forcing 首次将时间与视角双轴自回归统一在少步扩散模型中,通过递归 4D 重建模型提供累积几何先验桥梁,并结合时空自强制蒸馏彻底消除了多轴曝光偏差。
- NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices
-
针对边缘端算力与带宽极度受限的瓶颈,NanoVSR 摒弃昂贵的光流估计与注意力机制,提出全卷积双向循环架构,结合加性时序传播与结构重参数化,在推理期融合成纯单路标准卷积,在 NVIDIA Jetson Orin NX (25W) 上达成 27.20 FPS 的实时 \(4\times\) 超分辨率输出(REDS4 达 28.64 dB)。
- Natural Language Camera Movement Understanding
-
针对主流视觉语言模型(VLM)混淆旋转与平移、左右反向以及把前景运动错判为运镜的本质缺陷,本文提出包含 17 类运镜的两级电影摄影分类学与 ACaM 双域基准,并通过多源数据整合与物理运动增强微调出大幅超越商用前沿模型的专用 VLM。
- NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation
-
NoisEasier 提出了一种基于视频一致性模型(VCM)的测试期噪声优化框架,通过联合优化初始隐变量与中间随机扰动,并结合多目标可微奖励与负样本校准,在不修改模型参数的前提下显著提升了文本到视频生成的细粒度组合语义对齐。
- OctWorld: Long-Range World-Consistent Video Generation with Octree-based 3D Mapping
-
基于分块自回归视频扩散模型与动态八叉树TSDF空间记忆(OctMap),OctWorld实现了长距离相机轨迹与大视场探索下重访区域严密一致的高保真RGB-D视频生成。
- OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
-
OmniCamera 将视频生成正交解耦为场景内容与相机位姿两大独立控制维度,统一支持文本、位姿轨迹与参考视频三类相机条件和 T2V/I2V/V2V 三类生成任务,通过 OmniCAM 混合数据集与双层课程协同训练实现高保真度与高精度任意相机运镜控制。
- OSVE: One Step Video Editing with One Step Diffusion Models
-
首个将单步文生图扩散模型扩展至视频编辑的“单步逆映射-单步生成”(One-to-One)框架,通过结构感知编辑损失训练前向噪声编码器保持几何布局,并利用统一帧拼接机制实现跨帧注意力交互,速度较多步方案提升 155–171 倍并实现亚秒级视频编辑。
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
-
PQSG 将视频物理合理性评估分解为三层层次化问题图(Object -> Action -> Physics),由 VLM 自动生成带依赖关系的问题并逐节点回答,在 FinePhyEval 数据集上实现了比现有指标更高的人类判断相关性,且能精确定位视频在哪一维度(对象/动作/物理)违反物理规律。
- QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers
-
针对视频 Diffusion Transformer (DiT) 难以显式受控运动的问题,QWERTY 提出一种无需训练的运动控制框架,通过语义-时序通道分解(STCD)与仅扭曲查询(Query Warping)机制精确重塑 3D 全注意力,并在早期去噪步利用扭曲噪声实现自引导潜空间优化,高质量完成物体与相机轨迹控制。
- ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories
-
针对自动驾驶新轨迹视频生成中现有修复模型易过拟合局部伪影、LiDAR几何线索稀疏失真等问题,ReCamDriving 提出纯视觉的两阶段渐进式扩散生成框架与跨轨迹数据构建策略(ParaDrive),利用稠密 3DGS 渲染作为结构引导,实现了精准的视角控制与高保真 3D 几何一致性。
- Reward Lightning: Fast Video Generation via Homologous Preference Distillation
-
针对传统视频生成加速与偏好对齐中跨空间优化导致的梯度冲突难题,本文提出同源偏好蒸馏框架 Reward Lightning,通过共享隐空间特征骨干与时间调制注意力头,在 1 至 4 步采样下实现了高保真且高度对齐人类偏好的极速视频生成。
- RhymeFlow: Training Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling
-
RhymeFlow 打破了视频扩散模型中所有帧必须在全部时间步同步去噪的传统范式,通过内容感知的序贯关键帧筛选、渐进式异步跨步调度以及轻量级潜空间轨迹线性投影,在无需任何训练微调的前提下实现了 1.53× 至 1.78× 的端到端推理加速且几乎无感知画质损耗。
- Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion
-
本文提出面向自回归视频扩散的 Ring Forcing 框架,通过将视频反向拼接构建环形闭环训练数据将目标片段隐式嵌入远期历史以强制模型学习显式远程检索,并结合时步依赖的时空压缩与稀疏 RoPE 机制,在固定上下文序列长度下实现了分钟级长视频生成中精准的物体恒存性与全局一致性。
- RotateAttention : RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation
-
针对基于 3D RoPE 的 DiT 视频生成模型中注意力机制二次计算瓶颈,RotateAttention 提出了与 RoPE 融合/低开销的正交旋转以均衡 Query-Key 离群值,结合注意力概率矩阵 \(P\) 的仿射全动态范围整流与混合精度回退,实现了高达 1.68× 的端到端生成加速和近乎无损的视频质量。
- SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation
-
针对人-物交互(HOI)视频生成中密集位姿控制标注成本高昂且破坏动作自然度的问题,本文提出基于 DiT 架构的稀疏时序控制框架 SparseCtrl-HOI,通过时间受控旋转位置编码(TiRoPE)实现指定时刻的交互状态锚定,结合 MLLM 运动先验注入与解耦两阶段训练,仅凭少量关键帧即可合成物理可信、高保真度的直播带货 HOI 视频。
- Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation
-
针对自回归视频扩散模型因联合条件分布漂移陷入无法合理续写“终止点”的问题,提出测试时噪声引导优化方法 TANGO,利用去噪器自身向前预测一步的残差偏离各向同性高斯先验的程度作为批评信号,在测试时约束优化轨迹以规避崩溃。
- TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration
-
针对人脸视频恢复中身份漂移、姿态视角缠绕与推理效率不可兼得的困境,TIGER 提出跨源 3D 参数融合解耦几何先验与 ArcFace 身份先验,并基于 Wan2.1 视频生成先验构建条件单步整流流(One-Step Rectified Flow),配合三阶段渐进式优化实现兼具高逼真度与极强时序身份一致性的超快修复。
- Unified Panoramic–Gaussian Representation for Monocular 4D Scene Synthesis
-
针对单目视频 4D 重建局限于已知视角插值且生成先验大视角外推易几何畸变的难题,PanoGaussian 提出全景-高斯统一表征,通过全景轨迹协同对齐、基于固定 4D 几何的渐进式视点外推与掩膜蒸馏优化,实现了大视角变化下几何自洽且物理真实的未观测区域 4D 场景合成。
- Video Generation Models Are Inherent Lighting Estimators
-
V-LITE 借鉴影视特效中的镀铬球光照探针机制,将单目自然视频的动态 HDR 光照估计重构为引导式视频补全任务,通过对数域 HDR 感知 VAE 与 LoRA 轻量微调,成功释放了大规模视频扩散模型内生的高保真时空物理光照先验。
- What Moves? Localized Motion Representations for Compositional Scene Control
-
针对现有视频运动表征无法解耦实体级动态与场景上下文的难题,本文提出一种基于空间提示的局部运动表征学习方法,在保留全景上下文的前提下通过内容引导提取区域时序动态,并借助掩码轨迹预测实现精准、可组合的实体级运动控制。
- Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation
-
本文提出 Shell-LCC,通过将高质量 SFT 数据的补丁级潜在流形建模为各向同性的壳状高密度区域,从中提取稠密、可微且免费的几何奖励信号,在不引入外部奖励模型或人类标注的前提下显著改善 T2V 生成的低层失真(模糊、过度平滑、运动拖影等)。
- ART-VSR: Adaptive Rectified Trajectories for One-Step Video Super-Resolution
-
ART-VSR 用自适应时间估计器决定每个 token 应走多长的生成路径,再用潜空间轨迹校正器调整对应起点,让 Wan2.1 视频先验只需一步生成就能恢复细节;在作者统一重测协议下,REDS 的 LPIPS 为 0.197,但并非所有保真度和感知指标都最优。
- Beyond Inpainting: Unleash 3D Understanding for Stable Camera-Controlled Video Re-rendering
-
DepthDirector 用重投影深度控制新视角、用源视频保留外观与动作,避免直接修补重投影 RGB 的错误纹理;其完整模型在绝对相机设置下取得 RE 1.010、TE 0.053、CamMC 1.434。
- Consistent Video-to-Video Translation via Explicit Correspondences
-
vid2vid-long 用当前输入块检索很久以前生成过的匹配输出,再通过逐 token 对应关系交叉注意力指导视频转换,使五步 Rolling Forcing 在 VACE-Bench 上的 LPIPS 从 0.427 降至 0.240,但吞吐量也从 10.99 降至 8.10 FPS。
- Control-DINO: Feature Space Conditioning for Controllable Video Diffusion
-
Control-DINO 用保留全部通道的稠密 DINOv3 特征控制冻结的 CogVideoX,通过“原视频特征对应多种增强外观”的训练减少源外观复制,在 T&T 的 stride=16 外观迁移中获得 0.9932 的 COLMAP 配准率,并将同一特征接口扩展到三维生成。
- Direct Autoregressive Diffusion Distillation via Error-aware Causal Pretraining
-
针对自回归视频扩散模型在蒸馏过程中因结构不对齐导致的训练崩溃与高昂轨迹拟合开销,本文提出了误差感知因果预训练(Error Forcing),通过向历史上下文注入模拟残差误差以消除暴露偏差并实现高效并行训练,使因果学生模型能够彻底绕过传统的 ODE 轨迹拟合阶段,直接进行高质量的少步分布匹配蒸馏。
- DIVER: Disentangling Camera–Object and Active–Passive Motion for Video Generation
-
提出基于流匹配与双流交互架构的视频生成模型,通过规范静态视点投影解耦相机与物体运动,并通过主动/被动运动掩码 Dropout 建立动作-后果物理因果推理,支持自由视角与双向因果视频合成。
- DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
-
DreamWorld 提出了几何先验锚定的解耦式世界模型架构,通过知识蒸馏将 3D 大模型的高维空间先验注入几何视频扩散模型生成补全的 3D 结构表征,进而指导外观视频扩散模型合成高保真、多视角严格一致的场景探索视频。
- EMOSH: Expressive Motion and Shape Disentanglement for Human Animation
-
EMOSH 利用具有丰富表达能力的三维参数化人体模型 EHM 作为控制信号,通过显式的形状-姿态参数解耦从根本上消除体型泄漏问题,结合粗到细的混合运动注入和空间对齐条件机制,在保持精细表情和手势控制的同时实现高保真的人体动画生成。
- Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
-
提出了首个面向野生动物红外相机陷阱的细粒度文本到视频检索基准 Prompting-MammAlps,并设计了结合时空动作定位模型 SALMA 与代码生成智能体的检索框架,通过将自然语言查询编译为结构化文本解析程序,在避免大模型幻觉的同时实现了高可解释的集合检索。
- GeoV2V: Geometry-Grounded Video Diffusion Model for Driving Scene Generation
-
基于 Wan 2.1 主干提出几何引导视频扩散模型 GeoV2V 与多车道同步仿真数据集 Para4D,通过分层解耦注入密集深度与稀疏 LiDAR 先验,在无需 3D 边界框标注的前提下实现了大横向变道轨迹下高保真、几何连贯且保持动态瞬态光影的新视角驾驶视频生成。
- Inference-time Motion Calibration for Video Generation
-
针对预训练视频生成模型中运动失真、语义漂移与高频抖动问题,本文提出一种无需重新训练的推理时运动校准框架,利用视觉基础模型构建可微校准梯度(DLC)与自适应时间RoPE核(DRC),并通过平摊轨迹整流(ATR)将推理额外开销控制在基线的1.3倍以内。
- Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Generation
-
Lumos-Nexus 提出一种训练高效的两阶段统一视频生成框架:训练时仅微调轻量生成器吸收 VLM 语义,推理时通过统一渐进频率桥接(UPFB)将生成责任从轻量生成器逐步移交给大容量预训练生成器,在共享同质潜空间中实现粗到细的视频合成,兼顾推理驱动的语义准确性与高保真视觉质量。
- MorphGS: Morphology-Adaptive Articulated Motion Transfer from Videos
-
MorphGS 抛弃了传统“先单目3D重建、再骨骼重定向”的级联范式,将其重塑为以目标角色为主导的逆向图形合成分析问题,利用绑骨锚定的形态参数化与可微 3D 高斯渲染,从单目视频中直接优化运动姿态轨迹。
- MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes
-
针对绑定三维物体动作生成中模板受限与单例优化缓慢的难题,MotionDreamer(文内称 SkelMo)构建了含 25,200 个带骨骼动画序列的大规模数据集,提出了基于蒙皮语义注入与双向跨模态对齐的拓扑无关扩散框架,直接在全局笛卡尔坐标系下实现单目驱动视频向任意骨骼结构的高保真动作迁移。
- MVI2V: Human Centric Image to Video Generation with Multiview Consistent Appearance
-
MVI2V 针对以人体为中心的图生视频在多视角运动中背部或隐蔽部位服装纹理失真的难题,提出了通过外挂轻量化独立参考流、跨流双向自注意力交互、随机人体修补训练子任务以及大旋转角解构数据管线,在仅增加约 2.1% 参数量的前提下实现多视角外观高度一致的人体动态视频生成。
- OmniFace: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
-
针对视频换脸中身份保真度、动态属性保留与时序一致性难以兼顾的难题,OmniFace 提出首个双向显式监督数据管线 SyncID-Pipe 将图像换脸的先验迁移至视频域,并依托 DiT 架构设计模态感知条件注入、合成至真实两阶段训练与身份一致性奖励加权策略,在保持严格时序连贯的同时显著刷新了视频换脸 SOTA。
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-based Video Editing
-
提出了包含 300 万对样本的高质量多类指令视频编辑数据集 OpenVE-3M、对应评测基准 OpenVE-Bench,以及基于 MLLM 和 MoE-Connector 的 5B 端到端模型 OpenVE-Edit,在参数量减半的情况下全面超越现有 14B 开源模型。
- PhysAlign: Learning Physical Priors for Dynamical Event-Driven Video Generation via Representation Alignment
-
针对复杂动态事件(碰撞、坍塌、破裂等)中视频扩散模型常违背物理因果律的问题,PhysAlign 通过光度扰动与离散码本解耦底层物理先验与表观分布,利用事件感知时序门控自适应调节物理注入强度,并结合基础模型关系蒸馏与单帧推理映射器,实现了强因果保真度与高视觉质量的动态事件驱动视频生成。
- PhysPO: Physics-Aware Local Preference Optimization for Physically Consistent Video Diffusion
-
针对视频生成模型违背物理规律且传统DPO面临高昂采样成本与全局语义噪声的问题,PhysPO构建了保持全局背景一致但注入局部物理违例的反事实偏好管线CounterPhyPipe,并通过时空高频分解提取物理掩码,实施聚焦物理变化区域的局部DPO与背景中立性正则化,大幅提升视频的物理真实感与文本对齐度。
- Predictive Structure Improves Video Diffusion Dynamics
-
针对视频扩散模型生成的动态违背重力、支撑与物体恒常性等物理规律的问题,本文提出潜在动力学优化(LDO),将冻结的 V-JEPA 2 预测性世界模型作为动力学先验,通过特征层 Gram 矩阵关系蒸馏与生成级 GRPO 强化学习,显著提升视频物理合理性。
- SA-V2V: Training-Free Subject-Aware Video-to-Video Personalization
-
针对 DiT 架构中时空注意力高度纠缠导致无法独立调控运动、主体与背景的难题,SA-V2V 提出基于注意力内在功能分解的免训练与免反演视频个性化框架,结合随机时序注入与交替目标感知特征引导,在零微调下实现高保真度的主体替换、运动复刻与背景保留。
- Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
-
Salt 提出 SC-DMD 框架,通过半群缺陷正则化(semigroup-defect regularizer)修复分布匹配蒸馏(DMD)在多步推理中的组合性缺陷,并结合缓存感知混合步数训练进一步提升自回归视频生成的稳定性,在 2-4 NFE 的极低推理预算下显著提升生成质量。
- SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
-
SAMA 针对指令引导视频编辑中语义修改与运动保持难以兼顾的痛点,将视频编辑显式解耦为基于稀疏锚帧特征的语义锚定与基于自监督视频恢复的运动对齐,仅凭无成对编辑数据的预训练即可涌现强零样本编辑能力,并在基准测试中达到开源 SOTA 及媲美商用闭源系统的水平。
- Schroedinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics
-
提出 GARFIELD 框架,通过在单帧与时空稀疏约束下学习结构化运动潜在分布,不仅支持快速无采样判别式运动密度估计,还能联合采样出高一致性的未来轨迹,采样速度比视频世界模型快 97 倍。
- Spotlight: Identifying and Localizing Video Generation Errors Using VLMs
-
针对高保真文生视频中瞬态、局部的细粒度生成缺陷,本文提出 Spotlight 基准,涵盖 600 个顶尖生成视频与 1,604 处带起止时间戳、分类与自然语言归因的人工标注错误,并设计二分图匹配评估协议,揭示出当前最强 VLM 在错误定位与推理上落后人类近 2 倍。
- SSBP: Stage-Specialized Block Pruning for Video Diffusion Models
-
针对视频扩散模型迭代去噪中各阶段特征需求差异大且全局平均重要性剪枝易伤关键结构的难题,本文提出阶段特异性块剪枝(SSBP),结合阶段间方差与阶段内质量选择器自适应剪除冗余,配合两阶段蒸馏恢复训练,在 Wan2.1-1.3B 上实现 30% 推理加速且 VBench 质量近乎无损。
- STANCE: Controllable Video Generation for Structured Dynamics via Sparse-To-dense ANChored Encoding
-
STANCE 针对视频生成中稀疏控制信号易被稀释和物理交互不连贯的问题,提出了将用户粗粒度提示转化为像素对齐的 2.5D 实例运动线索,结合 Dense RoPE 锚定与共享 DiT 权重的几何辅助生成流,实现了高保真且符合物理规律的刚体动力学视频可控生成。
- StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation
-
StreamEdit 把免训练视频编辑从主流的「数据到数据」范式重新表述成「源条件下的噪声到目标」生成问题,直接嫁接到预训练的流式视频生成器(Self Forcing / LongLive)上,用双分支少步采样 + 自注意力桥 + 交叉注意力接地/增强 + 源导向引导,在 5-15 步内实现比现有方法更快、结构保持更好、编辑更可靠的任意长度视频编辑。
- Stylized Video Generation via Decoupled Data Synthesis and Gated Style Token Injection
-
针对风格化视频生成中静态数据导致的动态退化与编码器压缩带来的表征瓶颈,本文构建了解耦内容与动态的 MoStyle-5K 数据集,并提出无编码器压缩的门控风格 Token 隐式注入架构与两阶段混合优化策略,实现了高风格保真度与强动态一致性。
- SwiftWA: An Efficient Action-Centered World-Action Model
-
针对传统世界-动作模型在机器人推理时联合生成未来视频导致延迟过高与误差累积的瓶颈,提出以动作为中心的世界-动作模型架构,通过块因果注意力将未来视频作为训练期辅助动力学监督,使推理期可直接跳过视频生成、纯动作解码,实现 9 倍推理加速与更高的实机成功率。
- UniTemp: Unlocking Video Generation in Any Temporal Order via Autoregressive Distillation
-
针对自回归视频扩散模型仅支持前向生成、反向易因因果 3D VAE 产生跨块频闪的问题,UniTemp 提出块级锚点隐变量机制并在单个共享学生与判别器架构下实施双向自回归蒸馏,首次用统一轻量模型实现了任意时序(前向外推、反向回溯、首尾内插)的高画质平滑视频生成。
- VC-VAE: Leveraging Video Codecs for Training-Efficient and High-Fidelity Video VAE
-
VC-VAE 将传统视频编解码器(Video Codecs)中“静态关键帧锚点 + 稀疏运动残差”的显式解耦范式引入视频 VAE,结合强图像先验初始化与时序动态差分卷积算子(TDC),在减少 50% 训练计算量的同时实现了视频重建与生成质量的 SOTA。
- VGEdit: Unlocking Video Generation Priors for Reasoning-Informed Image Editing
-
将推理式图像编辑重新表述为以中间帧为隐式推理链的视频生成过程,通过 MLLM 指令迁移消除目标不匹配,并借助基于拼贴图奖励的 DiffusionNFT 强化学习在无需真值视频的情况下充分释放视频模型的物理与常识先验。
- VoCa: Unified Autoregressive Modeling for Talking Audio-Video Generation
-
VoCa 提出了一种统一自回归框架,通过大语言模型直接将文本转化为兼具声学与语义的共享表征,并配合语音精炼器与因果扩散变换器的滚动窗口去噪蒸馏,实现了单张参考图与文本输入下高保真语音与说话人视频的严格时间对齐与流式联合生成。
- WildWorld: A Large-Scale Dataset for Action-Conditioned World Modeling with Explicit State Annotations
-
WildWorld 从《Monster Hunter: Wilds》采集超过 1.08 亿帧具有动作、骨架、世界状态、相机和深度标注的视频,并构建 WildBench,将“画面流畅”与“动作执行正确、状态轨迹对齐”分开检验;实验支持显式状态信息的价值,但尚未证明模型能可靠模拟长时程游戏动力学。