ELHINN: Unifying Dense Crowd Simulation Across Scales via Eulerian–Lagrangian Hydrodynamics¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/shanshan-zys/ELHINN
领域: 物理驱动/仿真模拟 (physics / simulation)
关键词: 密集人群仿真、欧拉-拉格朗日对偶、物理信息神经网络、KAN残差修正、出入口重采样
一句话总结¶
针对密集人群模拟中宏观集体流动与微观个体真实感割裂的根本矛盾,提出跨尺度欧拉-拉格朗日流体力学网络 ELHINN,以可学习控制方程结合 KAN 残差修正演化宏观速度场,并将其作为物理先验引导微观个体轨迹求解与碰撞规避。
研究背景与动机¶
在高密度公共聚集场所(如大型交通枢纽、体育场馆与紧急疏散通道)中,准确模拟复杂密集人群的动态演化对城市规划、风险防控和虚拟现实系统至关重要。然而,高密度环境下的个体交互极具非线性与异构性,使得物理真实的仿真极难构建。现有方法往往在不同空间尺度之间割裂探索:以 Navier–Stokes 方程为代表的宏观欧拉法将人群视为连续流体,能高效捕捉大范围集体连贯运动,却完全丧失了个体级别的轨迹、朝向与行为细节;而以社会力模型或深度循环网络为代表的微观拉格朗日法致力于追踪单一智能体交互,但在密集拥堵场景下由于真实标注轨迹稀缺且缺乏全局系统一致性约束,极易导致人群崩塌、震荡或集体漂移。
这两种建模尺度的根本矛盾在于:微观运动轨迹的长时间自洽演化依赖全局一致的速度势场指引,而宏观连续流动若脱离微观个体的离散碰撞约束与出入口流动,就无法应对真实的通道边界与动态人群更迭。然而,以往工作多将二者割裂对待,甚至试图在微观轨迹缺失的情况下单纯通过数据驱动拟合,导致仿真在长期自回归外推中迅速失真。
本文的切入角度是反向利用流体力学中的欧拉-拉格朗日对偶性:与其从离散粒子拟合宏观流场,不如将宏观连续速度场作为强物理先验,显式约束并引导微观粒子的离散轨迹更新。核心 idea:构建跨尺度流体力学神经网络 ELHINN,宏观侧开发结合 KAN 残差修正与无滑移边界条件的 HINN++ 演化流场,微观侧以速度场为物理先验通过 PINN 精化个体轨迹并引入出入口自适应重采样(EARS),实现宏观集体一致性与微观个体真实感的统一。
方法详解¶
整体框架¶
ELHINN 包含两个耦合递进的核心模块:宏观速度演化模块 HINN++ 与微观轨迹精化模块 PINN。给定初始欧拉速度场 \(\boldsymbol{u}_0\)、初始个体拉格朗日坐标 \(\boldsymbol{x}_0\) 以及环境可行走区域 \(\boldsymbol{A}\),整个系统按时间步自回归交替迭代。HINN++ 依据当前速度场与环境边界,结合可学习流体力学算子和 KAN 残差项演化出下一步全局速度场 \(\hat{\boldsymbol{u}}_{t+1}\);随后微观模块基于个体当前位置在演化出的连续速度场中插值查询局部速度先验,由轻量 MLP 预测位移增量,并在出入口边界处执行动态粒子淘汰与新生重采样,从而闭环输出保真轨迹序列。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["初始状态<br/>速度场 u0 + 坐标 x0 + 可行走区域 A"] --> HINN["HINN++ 宏观速度演化<br/>可学习算子 λ·F + KAN 残差 + 无滑移边界"]
HINN --> Conv["ConvResNet 时空预测<br/>输出下一步全局速度场 u_t+1"]
Conv --> VQ["局部速度插值查询<br/>从 u_t 双线性采样个体速度 u_t(x_t)"]
VQ --> PINN["PINN 微观位移预测<br/>MLP 映射特征 + 运动学位移更新"]
PINN --> EARS["EARS 出入口自适应重采样<br/>出界剔除 + 边界入流检测 + 新个体补充"]
EARS --> Out["跨尺度仿真输出<br/>宏观速度场序列 U + 微观轨迹序列 X"]
关键设计¶
1. HINN++ 与 KAN 残差修正:融合流体力学算子与符号化非线性表征 针对传统偏微分方程求解器难以自适应多样化人群模式以及纯数据驱动网络缺乏物理结构的问题,HINN++ 提出了参数化可学习的控制方程机制。模型引入了五项核心流体力学与社会学算子向量 \(\boldsymbol{F}(\hat{\boldsymbol{u}}_t) = [f_{\text{con}}, f_{\text{vis}}, f_{\text{ali}}, f_{\text{nav}}, f_{\text{coh}}]^\top\),分别建模非线性对流、黏性内摩擦、群组速度对齐、短程目标顺流导航以及人群边界凝聚力,并赋予可学习权重向量 \(\boldsymbol{\lambda} \in \mathbb{R}^5\)。为了捕捉五大基础算子无法涵盖的高阶非线性人群行为(如急停、局部扰动和异构避障),模块并联了一个轻量 Kolmogorov–Arnold Network (KAN) 进行残差修正,生成加速度修正特征: $\(\boldsymbol{f}_{\mathrm{gov}}(\hat{\boldsymbol{u}}_t) = \boldsymbol{\lambda}^\top \boldsymbol{F}(\hat{\boldsymbol{u}}_t) + \mathrm{KAN}(\hat{\boldsymbol{u}}_t)\)$ 将经典流体力学归纳偏置与 KAN 的连续样条激活函数相结合,不仅保证了流场演化的物理合理性,更赋予了网络强大的复杂局部动力学拟合能力。
2. 环境无滑移边界约束:显式环境先验杜绝流场穿墙 在复杂几何场景(如弯道、瓶颈口或带有障碍物的站厅)中,无约束神经网络易在墙体边界处产生穿墙或切向滑动失真。为此,HINN++ 将可行走区域掩码 \(\boldsymbol{A}\) 转化为显式边界条件 \(\boldsymbol{f}_{\mathrm{bou}}\)。基于流体力学经典无滑移边界假设(壁面处流速为零),构造沿可行走区域几何边界 \(\partial \boldsymbol{A}\) 的负向减速场: $\(\boldsymbol{f}_{\mathrm{bou}}(\hat{\boldsymbol{u}}_t, \boldsymbol{A}) = \mathbf{1}_{\partial \boldsymbol{A}} \odot \hat{\boldsymbol{u}}_t\)$ 其中 \(\mathbf{1}_{\partial \boldsymbol{A}}\) 为边界指示矩阵。该物理约束与当前速度场、环境掩码及控制方程特征拼接后送入 ConvResNet,强制模型在壁面附近施加反向阻尼,确保演化出的宏观速度场天然遵守物理边界几何。
3. PINN 轨迹精化与速度场引导:将宏观流场注入微观运动学 为了打破拉格朗日轨迹生成对大量稠密人工标注的依赖,PINN 模块利用宏观演化速度场 \(\hat{\boldsymbol{u}}_t\) 作为时空物理场先验。对于第 \(i\) 个个体,首先在网格化速度场中双线性插值查询其当前坐标处的流速矢量 \(\hat{\boldsymbol{u}}_t(\hat{\boldsymbol{x}}_t^i)\),将其与坐标拼接输入轻量 MLP,输出其意图运动向量 \(\hat{\boldsymbol{v}}_t^i = \mathrm{MLP}([\hat{\boldsymbol{u}}_t(\hat{\boldsymbol{x}}_t^i), \hat{\boldsymbol{x}}_t^i])\),并由运动学方程更新为预备位置 \(\tilde{\boldsymbol{x}}_{t+1}^i = \hat{\boldsymbol{x}}_t^i + \Delta t \cdot \hat{\boldsymbol{v}}_t^i\)。该机制让微观粒子天然沿着宏观连贯流线行进,有效规避了传统微观网络在长时推演中的无序漂移。
4. EARS 出入口自适应重采样:解决边界动态通量与人群平衡 真实场景中的人群存在持续的人流进出,如果不加干预,长时间推演会导致离开场地的粒子堆积在死角或场内总人数单调衰减。为此提出出入口自适应重采样策略(Entrance-Aware Resampling Strategy, EARS),分三步执行动态维护: 1. 移除非法粒子:实时剔除预备位置落在可行走区域外部的越界个体(\(\tilde{\boldsymbol{x}}_{t+1}^i \notin \boldsymbol{A}\)); 2. 入口边界动态判定:在边界 \(\partial \boldsymbol{A}\) 上检测局部法向速度满足内流条件 \(\hat{\boldsymbol{u}}_t(\boldsymbol{x}_b) \cdot \boldsymbol{n}(\boldsymbol{x}_b) > 0\) 的网格点(其中 \(\boldsymbol{n}(\boldsymbol{x}_b)\) 为向内法向量),以此识别实时动态入口; 3. 粒子新生与重新初始化:在检测到的入口区域随机采样新个体以补充被移除个体的空缺,维持系统总体粒子规模守恒。
损失函数 / 训练策略¶
针对长序列递归预测中的误差累积与暴露偏差(exposure bias),宏观模型训练采用预定采样(Scheduled Sampling)策略,让输入由真实流场逐步退火过渡为自身预测流场,并使用 Smooth L1 损失监督速度场演化:\(\mathcal{L}_{\text{data}} = \mathrm{SmoothL1}(\boldsymbol{U}, \hat{\boldsymbol{U}})\)。 微观 PINN 的训练由无需密集标注的复合物理损失驱动: $\(\mathcal{L}_{\mathrm{trajectory}} = \mathbb{E}_{i,t} \left[ \ell_{\mathrm{vel}}(i,t) + \alpha \cdot \ell_{\mathrm{col}}(i,t) \right]\)$ 其中速度一致性损失 \(\ell_{\mathrm{vel}}(i,t) = \| (\hat{\boldsymbol{x}}_{t+1}^i - \hat{\boldsymbol{x}}_t^i) - \hat{\boldsymbol{u}}_t(\hat{\boldsymbol{x}}_t^i) \|_2\) 约束步进位移与宏观查询速度对齐(在 EARS 重置步不计算),而碰撞规避损失 \(\ell_{\mathrm{col}}(i,t) = \sum_{j \neq i} \max(0, d_{\mathrm{min}} - \| \hat{\boldsymbol{x}}_t^i - \hat{\boldsymbol{x}}_t^j \|_2)\) 惩罚小于安全距离 \(d_{\mathrm{min}}\) 的个体对,赋予模型局部避碰交互能力。
实验关键数据¶
主实验¶
评估在密集人群流动数据集 DCFD(457段视频,六种典型运动模式)及多目标跟踪高密场景数据集 MOT20(4段高密序列,2,332条标注轨迹)上展开。宏观速度场评估指标包括生成多样性 IS、分布真实度 FID 与结构相似度 SSIM;微观轨迹评估涵盖动力平滑度指标(垂直偏移 \(D_i\)、速度变化 \(\Delta V_{i,t}\)、转向角变化 \(\Delta A_{i,t}\))、运动能量指标(位移 \(L_{i,t}\)、总能量 \(E_{i,t}\)、避碰能量 \(\mathrm{steer}E_{i,t}\))以及轨迹位移误差 JADE 与 JFDE。
表 1:宏观速度演化性能对比(DCFD 数据集,对应原论文 Table 2)
| 方法 | 类型 | IS ↑ | FID ↓ | SSIM ↑ | 核心观察 |
|---|---|---|---|---|---|
| PDE-Net | 数据驱动 PDE | 1.7016 | 0.2924 | 0.5237 | 缺乏物理先验,大范围运动覆盖不足 |
| NSFnet | 物理信息 PINN | 1.0369 | 0.7326 | 0.3526 | 全连接架构难以捕捉连续空间场依赖 |
| PPNN | 物理保持网络 | 1.7440 | 0.0275 | 0.4893 | 缺乏环境边界,后期结构退化严重 |
| HINN | 流体+社会力网络 | 1.6789 | 0.0638 | 0.4782 | 固定方程算子缺乏非线性自适应能力 |
| Ours (HINN++) | 流体力学+KAN+边界 | 1.7469 | 0.0278 | 0.6030 | SSIM 显著领先达 0.6030,长程结构高度稳定 |
表 2:微观轨迹精化性能对比(MOT20 数据集,对应原论文 Table 3;指标汇报相对真实标注 GT 的偏差,偏差绝对值越小越优)
| 方法 | \(D_i\) 偏差 | \(\Delta V_{i,t}\) 偏差 | \(\Delta A_{i,t}\) 偏差 | \(E_{i,t}\) 偏差 | \(\mathrm{steer}E_{i,t}\) 偏差 | JADE ↓ | JFDE ↓ |
|---|---|---|---|---|---|---|---|
| 真实标注 (GT) | 136.963 | 0.124 | 24.072 | 184.208 | 162.003 | - | - |
| Boids (物理规则) | +1285.546 | +0.295 | -13.807 | +1848.020 | +51.735 | 63.013 | 75.423 |
| SFM (社会力模型) | +415.432 | -0.080 | -20.552 | +75.114 | -4.517 | 13.247 | 19.607 |
| Social-LSTM | -119.141 | -0.123 | -22.024 | -27.842 | -5.828 | 11.571 | 17.189 |
| STGAT | -47.650 | -0.121 | -23.096 | -25.190 | -5.791 | 12.431 | 17.935 |
| PCS (物理驱动) | -125.164 | -0.119 | -23.545 | -1.852 | -5.475 | 9.231 | 14.897 |
| SPDiff (物理扩散) | -22.083 | +0.097 | -22.981 | +292.087 | +270.146 | 9.850 | 14.715 |
| Sora (生成大模型) | -43.776 | +0.994 | +24.311 | +5231.787 | +8066.645 | 19.186 | 21.535 |
| Kling | -39.108 | +0.408 | +5.731 | +254.418 | +417.607 | 28.672 | 33.744 |
| Runway | -53.206 | +0.473 | +6.608 | +268.137 | +426.389 | 22.199 | 23.856 |
| Ours (ELHINN) | -42.895 | +0.314 | +14.885 | +0.979 | +47.424 | 8.274 | 12.836 |
消融实验¶
表 3:宏观与微观模块核心组件消融(对应原论文 Table 4 与 Table 5)
| 模块阶段 | 评估变体 | 关键指标 1 | 关键指标 2 | 关键指标 3 | 结论说明 |
|---|---|---|---|---|---|
| HINN++ | w/o BC (无边界条件) | FID: 0.0395 | SSIM: 0.4837 | IS: 1.7883 | 缺失可行走边界,流场穿墙导致 SSIM 暴跌 |
| w/o KAN (无残差修正) | FID: 0.0350 | SSIM: 0.6019 | IS: 1.7497 | 缺少非线性样条拟合,复杂弯道流态失真 | |
| with MLP (替换为标准MLP) | FID: 0.0382 | SSIM: 0.6026 | IS: 1.7937 | MLP 拟合高维残差易发散,FID 逊于 KAN | |
| 完整 HINN++ (Ours) | FID: 0.0278 | SSIM: 0.6030 | IS: 1.7469 | 边界与 KAN 协同兼备全局结构与局部精度 | |
| PINN | w/o \(\ell_{\mathrm{col}}\) (无避碰损失) | JADE: 8.293 | JFDE: 12.962 | \(E_{i,t}\) dev: +1.421 | 缺乏近邻排斥约束,局部聚集与穿越增加 |
| w/o MLP (无运动学MLP) | JADE: 8.307 | JFDE: 12.969 | \(\Delta V_{i,t}\) dev: +0.317 | 纯流场积分难以反应主观动态微调 | |
| w/o EARS (无重采样策略) | JADE: 13.257 | JFDE: 17.438 | \(D_i\) dev: -92.478 | 破坏粒子通量平衡,轨迹严重塌缩至主流线 | |
| 完整 PINN (Ours) | JADE: 8.274 | JFDE: 12.836 | \(E_{i,t}\) dev: +0.979 | EARS 与避碰约束共同保障长时轨迹稳定性 |
关键发现¶
- 跨尺度先验有效遏制微观塌缩:纯数据驱动的微观网络(如 Social-LSTM、STGAT)由于缺乏宏观流场约束,其转向角和位移严重偏低,轨迹呈现近乎静止的退化;而视频大模型(Sora、Kling)则因缺乏物理约束而速度剧烈发散、能量指标暴增成千上万。ELHINN 的 JADE 达到 8.274,比次优的 PCS (9.231) 降低 10.3%,JFDE 达 12.836,优于 PCS 的 14.897。
- EARS 是长程密集人群仿真的生命线:在消融实验中,去掉 EARS 导致 JADE 从 8.274 急剧恶化到 13.257(误差剧增 60.2%),JFDE 从 12.836 恶化至 17.438。这证实了人群仿真不是封闭孤立系统,必须在开放边界上进行动态通量再平衡。
亮点与洞察¶
- 欧拉-拉格朗日逆向耦合思想:传统计算物理中常从粒子群拟合流场,而本文巧妙反转了信息流向,将连续欧拉流场作为低自由度的全局宏观向导,直接赋能高自由度的微观粒子网络,以极轻量参数实现跨尺度物理自洽。
- KAN 与物理算子的显隐协同:物理控制方程 \(\boldsymbol{\lambda}^\top \boldsymbol{F}\) 负责兜底守恒律(对流、黏性等底层物理),而 KAN 残差分支专攻未建模的高阶社交心理效应,相比传统黑盒 MLP 更稳定且更契合非线性连续动力学。
- 动态法向流感知出入口判定:EARS 无需人工预定义繁琐的出入口坐标点,而是直接基于演化流场在几何边界处的点积内积 \(\hat{\boldsymbol{u}}_t(\boldsymbol{x}_b) \cdot \boldsymbol{n}(\boldsymbol{x}_b) > 0\) 自动识别动态入流,具备极强的场景自适应泛化能力。
局限与展望¶
- 假设局限:模型目前假设人群处于极高密度状态下的均质流体状态,对于疏散稀疏人群、个体停留观光或具有明确多目标分支博弈的复杂行为,宏观速度场的先验引导力可能下降。
- 计算瓶颈:微观轨迹更新虽然轻量,但在超十万人群极端规模下,欧氏距离近邻避碰损失的计算复杂度呈二次方增长,需结合空间八叉树或网格哈希进一步加速。
- 未来展望:将框架扩展至可变密度人群混合场景与火灾烟雾等恶劣突发逃生环境,并接入多视角实景监控视频实现端到端物理仿真回传。
相关工作与启发¶
- vs HINN [ACM MM 2024]: HINN 首次在密集人群建模中引入物理与社会算子,但其局限于纯宏观流场生成,完全缺乏微观个体轨迹输出能力;ELHINN 构建了跨尺度双轨框架,并进一步以 KAN 残差修正与显式边界条件升级为 HINN++。
- vs PCS & SPDiff [SIGKDD 2022 / AAAI 2024]: 现有物理强化轨迹方法仅从微观视角建模个体间局部排斥,缺乏宏观全局流场的连贯牵引,长时预测易陷入局部极值;ELHINN 通过宏观速度场提供全局先验,在 JADE 和 JFDE 上均大幅领先。
- vs Sora / Kling / Runway 等通用视频生成模型: 视频大模型缺乏底层物理守恒律,生成的个体运动能量指标膨胀上千倍并伴随严重的画面抖动与穿模;ELHINN 证实了显式物理信息流在严谨物理仿真领域的不可替代性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (将流体力学双重性巧妙逆向耦合于跨尺度人群模拟,KAN 结合流体算子新颖实用)
- 实验充分度: ⭐⭐⭐⭐⭐ (覆盖宏微观共 11 个量化指标,对比 13 种代表性方法,涵盖传统物理、深度模型及顶尖视频大模型)
- 写作质量: ⭐⭐⭐⭐⭐ (结构层次清晰,数学推导严密,图表表达信息丰富)
- 价值: ⭐⭐⭐⭐☆ (为超高密度公共安全评估与真实大尺度人群推演提供了极具参考价值的计算流体力学与深度学习结合范式)