跳转至

🧑 人体理解

🧠 NeurIPS2026 · 7 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (120) · 📷 CVPR2026 (151) · 🔬 ICLR2026 (45) · 🧪 ICML2026 (5) · 🤖 AAAI2026 (20) · 🧠 NeurIPS2025 (21)

🔥 高频主题: 人体姿态 ×2 · 人脸/视线 ×2

BiMoGen: Bidirectional Motion-Text Generation via Unified Masked Discrete Diffusion

BiMoGen 用统一运动文本词表和双向掩码扩散模型同时完成运动生成与运动描述,通过先对齐后条件生成的训练及生成感知自纠错,在 HumanML3D 上取得 T2M R@1 0.555、M2T CIDEr 60.2,但并非所有指标都优于已有统一模型。

FactorizedHMR: A Hybrid Framework for Video Human Mesh Recovery

FactorizedHMR 先确定性估计躯干、体型与相机坐标轨迹,再固定这些结构,用掩码流匹配补全四肢、头部和世界运动;主要收益体现在严重遮挡与轨迹漂移,而不是所有常规指标均领先。

GazeFlow: From Human Gaze Behavior to Generative Egocentric Gaze Prediction

GazeFlow 用视频局部特征和全局任务 token 条件化整段视线轨迹的流匹配生成,在 EGTEA Gaze+ 上取得 F1 0.491、平均角度误差 9.01,同时改善轨迹位移统计,但其默认模型依赖未来帧,不能直接当作在线眼动追踪器。

PoseBridge: Bridging the Skeletonization Gap for Zero-Shot Skeleton-Based Action Recognition

PoseBridge 不另加 RGB 动作识别分支,而是把姿态估计过程中尚未被关节坐标压缩掉的视觉语义保留下来,再用骨架条件桥接与语义原型适配完成零样本识别,在 Kinetics-200/400 的八个测试划分上比最强被比较基线提高 13.3–17.4 个百分点。

Re:Cognize: Open-Set Comic Character Re-Identification

Re:Cognize 用同一阅读顺序下的四种图库协议分离漫画角色的身份出现与身份维护,发现直接按预测标签扩充图库会损害随机种子下的识别,而 Re:Cast 通过角色均值、页内证据和跨页绑定,在明确条件下恢复部分正确标签更新的收益。

STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts

STRIDE 将文本描述的人群情境预编译为行为问题、确定性测量函数和期望区间,再对生成轨迹逐项核验;其基准包含 936 个情境,Text-Crowd 的总体得分为 0.645,而人工对基准答案的同意率为 80%,但后者只来自有限的标注子集。

Towards Unified Dynamic Face Landmark Detection

本文用“人脸部位 + 归一化序列位置”描述关键点,再通过图像条件化查询与迭代解码,让同一模型联合学习不同标注格式并按需预测关键点;统一 ViT-B 在 WFLW、300W、AFLW-19 上的完整集 NME 分别为 4.05、2.80、1.02,优势是接口与训练统一,而非所有指标全面领先。