跳转至

STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts

会议: NeurIPS 2026
arXiv: 2609.34799
代码: https://github.com/sweetspot00/STRIDE-Bench
领域: 人体理解 / 行人轨迹评测
关键词: 文本到轨迹、行为分解、确定性测量、情境对齐、人群行为

一句话总结

STRIDE 将文本描述的人群情境预编译为行为问题、确定性测量函数和期望区间,再对生成轨迹逐项核验;其基准包含 936 个情境,Text-Crowd 的总体得分为 0.645,而人工对基准答案的同意率为 80%,但后者只来自有限的标注子集。

研究背景与动机

文本条件行人轨迹生成不只要求路径平滑,还要求人的移动方式符合所描述的情境。普通通行、结伴参观和观看活动即使发生在同一地图上,也可能具有不同的速度、方向一致性、停留比例和空间分布。Text-Crowd、CrowdMoGen 等方法开始用语言控制集体运动,但传统 ADE、FDE 主要衡量轨迹与一个已记录未来的几何距离;碰撞率、密度和分布距离也不会自动回答“这段运动是否符合这段文本”。同一描述可以对应多种合理轨迹,因此不应把某条参考路径当作唯一正确行为。

问题不只是指标选择,还包括参考数据的覆盖。ETH/UCY、SDD 等数据主要记录日常行走,不可能为每一种地图与活动组合采集真实人群。直接让大语言模型(LLM)阅读坐标序列或汇总统计再打分,又会把“哪些量与当前情境有关”和“这些量是否达到要求”混在一起:一组显眼的统计可能掩盖文本真正要求的行为。人工评测可以补充判断,却难以持续覆盖大量情境和生成模型。

本文利用社会学提供的行为维度组织评测,再由 LLM 将情境转换成可执行的检查规格。这里的语言推断发生在规格制定阶段,而不是每次评分时;“测量值计算得准确”与“期望行为设定得正确”仍是两种不同的可靠性。核心 idea:把文本到轨迹对齐评测拆成可审查的语义规格编制和可复现的数值核验,以情境相关的行为问题代替固定指标列表或整体 LLM 裁判。

方法详解

整体框架

输入包含情境文本、地图及事件中心、目标位置、初始人群等元数据,以及待测的行人轨迹。STRIDE 先用五轴协议组织行为问题,结合 DMT 函数说明与 TrajFacts 参考知识选择函数、参数和期望区间;这些规格缓存后,评分阶段直接运行函数,对照区间并逐层平均,输出总体得分和可追溯的检查结果。

框架图中的虚线表示离线规格编制,不是轨迹模型的训练监督。基准模式读取已缓存规格,不需要 LLM 参与评分;开放模式则需要 LLM 为新文本编制问题与期望答案,因而只有规格冻结后的数值核验是确定性的。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["情境文本与元数据"] -.-> A["五轴行为协议"]
    A -.-> B["情境自适应问题"]
    B -.-> C["参考校准与规格缓存"]
    F["DMT说明与TrajFacts"] -.-> C
    C -->|缓存规格| D["确定性核验与分层评分"]
    T["待测轨迹"] --> D
    D --> O["总分与逐项诊断"]

关键设计

1. 五轴行为协议:先限定坐标能够支持的行为判断

协议包含 Velocity、Realism、Direction、Spatial、Temporal,即速度、真实性、方向、空间结构和时间结构。社会学基础来自 McPhail 与 Wohlstein 对集体行为的分析,并结合个人空间、行人动力学和群体结构研究:速度描述活动强度,方向描述运动指向,空间结构描述分布与聚集,真实性关注基本运动合理性,时间结构则追踪这些性质如何变化。它不是对同一速度统计的五种命名,而是提醒规格制定者分别检查个体、群体和环境层面的行为。

附录明确舍弃无法仅从坐标恢复的讲话、标语等“实质内容”。这个取舍很重要:轨迹可以支持“是否向某一区域聚集”的判断,却不能支持“是否理解活动含义”的判断。作者将五轴称为完整评测空间,但实际可检测范围仍取决于工具库;例如当前 Realism 只有 collision_fraction 与 lingering_fraction,不能因此宣称已完整验证所有物理约束。

2. 情境自适应问题:相关性由问题集合表达,而不是所有指标一律等权

LLM 接收情境文本与五轴协议,至少生成五个行为问题,并给出分解理由。普通通行可以重点检查正常速度与可理解的方向结构;结伴参观则需要检查聚集或凝聚行为。问题不是先观察待测轨迹后再临时改标准:附录提示词明确说明生成基准规格时没有轨迹数据,只能根据描述制定期待。

每个问题可绑定一个或多个测量函数。这样既能将一个语义要求拆成互补证据,也能避免为了增加问题数量而重复计权。例如速度变异系数与随机运动可能重叠,仅靠这个量不足以判断正常通行,需要结合平均速度或路径线性度。场景适应性主要体现在选择哪些问题、每题选择哪些测量;最终公式仍对问题平均,并非学习了一组社会学维度权重。

3. 参考校准与规格缓存:把语言期待转成符合函数语义的数值范围

每个测量规格记录函数名、参数、期望区间、区间设定理由和小幅容差 delta_value。LLM 参考函数的实际计算方式、输出类型及 TrajFacts,给出双侧或单侧阈值;例如区间下界为 0.4、容差为 0.03 时,附录示例允许 0.37 支持该描述。阈值是预先编制的语言推断结果,不是通过待测轨迹拟合得到的答案。

DMT 共 20 个函数:速度轴 2 个、真实性轴 2 个、方向轴 3 个、空间轴 5 个、时间轴 8 个。它们包括平均速度、速度变异系数、方向一致性、路径线性度、局部密度、聚集/扩散分数及各类趋势。必须按实现含义理解输出:mean_local_density 在 1.5 倍中位最近邻距离内数邻居,不是每平方米人数;collision_fraction 的分母是活动行人对数,不是发生接触的行人数;趋势函数按分箱结果计算归一化斜率。统一术语不能替代这些单位和分母的核对。

TrajFacts 是用于校准期望值的参考知识库,不是 936 个情境各自的实测 ground truth。正文提及事件参考,附录说明现有事实主要覆盖普通聚集及 Lyon 灯光节;附录展示的部分内容还包含 Random 与 Stop 的反参考值。因此它兼有经验范围和排除平凡基线的设计指导,不能把每个 LLM 区间都说成真实人群直接测得。

提示词要求问题具有区分力:随机运动也能给出接近正常范围的自适应密度、接近零的趋势,完全静止也可能满足某些上界检查。它据此要求组合具有辨别力的函数,并限制仅用接近零的趋势判断“稳定”。这提高了评测对平凡输出的敏感性,但也把基线相关的选择偏好写进了答案编制,不能替代独立验证。

4. 确定性核验与分层评分:相同规格和轨迹得到相同结果

冻结规格后,DMT 从轨迹坐标及相应状态计算数值,再判断数值是否进入期望答案空间。设情境有若干问题,每题有若干测量,附录 A.7 给出的情境分数为:

\[ \mathrm{STRIDE}_{i}=\frac{1}{m_i}\sum_{j=1}^{m_i}\frac{1}{n_{ij}}\sum_{p=1}^{n_{ij}}\mathbf{1}[C_{ijp}\in A_{ijp}]. \]

其中 \(m_i\) 是情境的问题数,\(n_{ij}\) 是第 \(j\) 个问题的测量数,\(C_{ijp}\) 是函数输出,\(A_{ijp}\) 是期望答案规格。先在题内平均二元通过结果,再在情境内平均问题,最后对情境做宏平均:

\[ \overline{\mathrm{STRIDE}}=\frac{1}{k}\sum_{i=1}^{k}\mathrm{STRIDE}_{i}. \]

这个层级避免问题因绑定更多函数而自动获得更大总权重。它也意味着“组合测量”不是逻辑 AND:一题两个检查中只通过一个,该题得到 0.5,而不是整题直接失败。得分表示规格满足程度,不是生成轨迹与真实人群分布相同的概率。

可复现性的条件是轨迹、规格和函数实现均固定。基准评分不调用 LLM,但重新生成开放情境的规格、修改 TrajFacts 或替换阈值生成模型,都可能改变答案空间。函数用平均、比例及归一化趋势适配不同人数和时长;这种计算尺度适配也不保证不同时间窗口在语义上具有相同难度。

一个完整示例

考虑普通情境“行人在校园步道上平稳行走”。协议引导问题检查速度是否正常、路径是否大体连贯,以及行人是否大多保持移动;编制者可选 mean_speed、path_linearity、lingering_fraction,而不必为没有时间变化的文本添加趋势要求。

为说明题内平均,假设一个问题缓存了两个测量:平均速度范围 0.8–1.3 m/s、路径线性度范围 0.85–0.97。两范围来自附录列出的普通通行参考,但这里的组合与待测数值只是教学示例,并非发布基准的具体条目。若函数得到 1.1 m/s 和 0.90,两项均通过,题分为 1;若仅线性度超出范围,题分为 0.5。其他问题随后独立评分,再合成情境分数。

测量阶段只需要轨迹和已存规格,不再询问 LLM“看起来是否合理”。单项失败能够追溯到输出值与区间;但如果最初的问题或范围并不适合该校园情境,确定性计算本身不会修正这种语义错误。

损失函数 / 训练策略

本文提供评测框架与基准,不提出新的轨迹生成训练损失。基准构建用 GPT-5.1 生成场景描述和初始化元数据,用 GPT-5.2 编制问题、测量与期望答案;地图经过颜色语义分割、障碍多边形近似和掩码栅格化,场景经障碍冲突、密度、近重复及人工检查过滤。

最终正文给出 936 个情境、6,633 个问题、11,696 个测量,覆盖 11 类人群情境。摘要称基准使用 30 张地图,构建段称先收集 113 张地图;缓存没有清楚交代两者的筛选对应关系,不能自行补写“113 张全部用于最终基准”。

实验关键数据

主实验

下表将正式基准与真实活动子集分开。基准列来自表 1,报告均值与标准差;Lyon 列来自附录表 6,保留其更精细的均值。两列的情境与规格不同,不应把差值解释为统一分布上的泛化退化。

模型 STRIDE-Bench,总体均值 ± 标准差 Lyon,12 段记录均值
Text-Crowd 0.645 ± 0.233 0.4115
LLM-SFM 0.434 ± 0.231 0.5843
SingularTrajectory 0.421 ± 0.177 此表未报告
Random Walk 0.311 ± 0.117 0.3175
Stop 0.221 ± 0.105 此表未报告
Human 不适用 0.9427

Lyon 验证来自三个摄像视角的 12 段轨迹记录,重新构建 86 个问题和 154 个测量,正文将真实人群平均得分概括为 0.94。它支持“这些真实活动轨迹能得到高分”,但不是对所有 936 个情境逐一采集真实数据后的验证。

验证项目 样本范围 结果 结论边界
真实轨迹 Lyon,12 段记录、86 个问题、154 个测量 均值 0.9427;附录最小值 0.812 仅该活动及其生成规格
人工与基准答案一致性 50 名标注者;56 个情境、350 个问题;15,750 条标注 80%;Cohen's \(\kappa=0.730\) 标注子集,不是全部基准
标注者之间一致性 同一人工研究 66%;Krippendorff's \(\alpha=0.698\) 仍存在细粒度行为判断分歧
跨 LLM 验证 4 个模型;588 个条目;对人工共识比较 正文称处于留一人工参考范围内 缓存未给精确模型数值,不补表

跨 LLM 研究采用 deepseek-v3、claude-sonnet-4.6、qwen3.6-plus 和 gpt-5.5。正文描述其与人工共识比较,图 4 图注却写成与基准比较;本笔记保留实验正文的样本与比较口径,并明确这一表述分歧,不能把它改写成所有后端在新情境下都等价。

消融实验

论文主要提供分组分析而非逐模块移除消融。表 2、3 的五轴列名在缓存中丢失,因此这里只引用仍清楚标注的末列 Mean,不猜测各中间列的轴名。原文将 Mean 定义为协议轴得分的平均,不应默认等于表 1 的情境层级总体分数。

分组 LLM-SFM,Mean ± 标准差 SingularTrajectory,Mean ± 标准差 Text-Crowd,Mean ± 标准差
0–30 s 0.574 ± 0.190 0.454 ± 0.228 0.547 ± 0.156
30–120 s 0.632 ± 0.228 0.464 ± 0.244 0.619 ± 0.153
120 s 以上 0.453 ± 0.202 0.424 ± 0.251 0.463 ± 0.217
1–25 人 0.445 ± 0.138 0.372 ± 0.228 0.638 ± 0.185
26–100 人 0.440 ± 0.189 0.428 ± 0.252 0.640 ± 0.191
101–300 人 0.453 ± 0.243 0.417 ± 0.260 0.638 ± 0.172
301 人及以上 0.635 ± 0.324 0.507 ± 0.292 0.645 ± 0.161

LLM-SFM 在两个较短时段领先,Text-Crowd 在长时段领先,但长时段末列差距只有 0.010,不能据此宣称统计显著优势。Text-Crowd 在人数分组的末列均领先;这些是当前适配方案与分组上的结果,不是模型任意部署规模的保证。

关键发现

  • 正式基准与 Lyon 子集的生成模型排名不同。Text-Crowd 的障碍输入只支持简单多边形,作者为 Lyon 简化地图,因此排名变化同时涉及地图接口和模型适配。
  • SingularTrajectory 不直接输入文本,但观察历史来自 LLM-SFM,并按 8-in/12-out 协议自回归至 8 分钟上限。它不是完全无情境信息的对照组,不能把接近 LLM-SFM 的分数解释为语言条件没有作用。
  • 附录表 7 显示 Lyon 的 speed_variation_coeff 对 Human、Text-Crowd、Random 的通过率均为 1.00,而 spread_trend 对所有列均为 0.00。单项判别力和阈值适用性不均衡,总体高分仍需要逐项审查。
  • 人工研究使用文本与可视化结合的界面。空间、方向维度更容易达成一致,精细数值问题分歧较多;80% 同意率不能泛化为每个维度、每类人群都同样可靠。

亮点与洞察

  • 把裁判冻结成规格:LLM 负责把描述转成可审查的检查条件,数值评分无需再次调用它。这使基准重复运行的稳定性不再依赖每次语言判断是否一致。
  • 测量语义优先于直觉命名:自适应密度不是物理面密度,趋势接近零也不等于行为合理。公开伪代码、参考范围和反参考值,让答案编制的隐藏假设更容易被发现。
  • 问题层级决定权重:同一行为绑定多个测量不会自动增加整题权重。这种结构适用于其他可程序核验的时序生成评测,但要防止重复问题变相重复计权。

局限与展望

  • TrajFacts 覆盖有限,LLM 预编区间仍可能表达不完整的行为先验。后续应扩大独立真实数据校准,并评估阈值、容差和规格生成后端变化带来的排名稳定性。
  • 当前 20 个工具不能涵盖所有社会关系、群体互动或个体差异;真实性轴尤其窄。理论维度覆盖与实际工具覆盖必须分开说明。
  • 人工验证只覆盖 56 个情境与 350 个问题,跨模型验证又使用 588 个条目。两种子集不能直接当作全量基准或开放模式的普遍可靠性证明。
  • 反参考指导明确利用 Random 与 Stop 的统计设计范围,可能增强对这些特定基线的辨别而非对所有合理行为的辨别。需要更多独立模型与专家复核检查是否存在规格选择偏好。
  • 数值与引用存在待核实问题:正文给 Lyon 记录分数范围 0.87–1.00,附录表 6 最小值却为 0.812;正文验证段引用图 7(a/b),对应汇总图注为图 4,而图 7 是逐维度结果。这里保留冲突,不猜测哪个版本正确。

相关工作与启发

  • vs ADE/FDE:传统预测误差比较参考未来的几何位置;STRIDE 比较文本要求对应的行为统计。前者适合已观测轨迹预测,后者补充情境对齐,两者不是相互替代。
  • vs TIFA / GenEval:这些文本到图像评测将提示词拆成可验证命题;STRIDE 延续分解与验证思想,但把视觉模型判断改成轨迹上的确定性函数。语义分解仍有不确定性,只是核验器更容易复查。
  • vs Text-Crowd / LLM-SFM:它们负责生成轨迹,STRIDE 负责检查生成是否满足描述。模型适配、地图表达和初始化也是比较条件,不应把评测排名视为脱离输入接口的模型本质排序。
  • 研究启发:可将每个失败检查连同阈值理由暴露给专家,先区分“生成确有问题”与“规格并不合适”,再用于模型改进。开放模式尤其需要这一复核,而非只输出一个总分。

评分

  • 新颖性: 4/5 — 将社会学行为协议、情境问题和确定性工具结合,针对文本到行人轨迹补足评测缺口。
  • 实验充分度: 3/5 — 包含真实轨迹、人工研究和模型分组,但校准覆盖及关键规格消融仍有限。
  • 写作质量: 3/5 — 方法主线清楚,图号、验证口径和部分数值冲突影响可核查性。
  • 价值: 4/5 — 适合作为可追溯行为评测基础,不宜当作真实人群行为的最终正确性证明。