InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://influx.cs.princeton.edu/
领域: 3D 视觉
关键词: 动态相机内参, 真实与合成数据集, 镜头畸变, 焦距估计, 过程化生成
一句话总结¶
构建包含 1,841 个过程化生成合成视频(44.1 万帧,带薄透镜呼吸效应与真实光学畸变)与 334 个高分辨率真实视频(51.4 万帧,覆盖日常复杂平移运动与大视场反向标定)的动态相机内参综合套件 InFlux++,通过合成数据微调使 SOTA 动态内参估计模型的焦距预测召回率显著提升。
研究背景与动机¶
相机内参定义了三维空间几何坐标到二维图像平面的透视投影映射,是机器人视觉导航、三维重建(SfM/SLAM)、高斯泼溅(3DGS)及神经辐射场(NeRF)等空间计算任务的几何基石。然而,绝大多数现代三维视觉算法均建立在“视频拍摄期间相机内参保持恒定”的基础假设之上。在真实世界的开放场景视频拍摄中,变焦镜头的机械变焦(Zoom)和对焦(Focus)调整极其普遍,内参参数随着光学系统的镜片移动呈现高度动态变化。一旦相机内参在视频序列中动态漂移,传统的固定内参假设会导致全局几何校准失效,引发严重的尺度漂移、三维重投影发散和点云失真。因此,从单目连续 RGB 视频帧中直接、准确地估计逐帧动态相机内参,成为解除三维视觉算法静态假设桎梏的核心瓶颈。
此前,前作 InFlux 建立了首个提供逐帧真值内参的真实动态内参基准,实现了对自标定算法的系统化评测。然而,当前最先进的预测方法(如 AnyCalib)在该任务上依然表现欠佳,其端点误差(EPE)在 50 像素阈值下的召回率仅有 34.1%。深入剖析可知,领域受限于两大结构性阻碍:一是训练数据极度匮乏且缺乏内参动态多样性。主流真实数据集(如 KITTI、EuRoC)的内参均为静态固定配置;全景切片数据集缺乏时序连续性,且饱受接缝伪影和鱼眼镜头瑕疵困扰;现有合成数据集大多采用针孔模型渲染,忽略了真实光学系统的离焦模糊、像差以及镜头呼吸效应。二是现有评测基准的场景与相机运动分布狭窄。InFlux 的室外场景高度局限于大学校园与自然地标,室内多为静态实验室或摆拍工位,缺乏日常生活行为;更关键的是,其相机运动以纯旋转为主,严重缺乏平移运动带来的视差信息,无法充分检验算法在复杂动态视差下的泛化能力。
面对训练监督缺乏与评测场景单一的双重挑战,亟需一套兼顾物理光学真实感的大规模时序合成训练集,以及具备丰富日常活动与大平移视差的扩展真实评测基准。核心 idea:构建动静互补的 InFlux++ 数据套件,在合成侧(InFlux++ Synth)基于薄透镜光学成像模型注入时序平滑的有界随机游走内参变化、镜头呼吸效应与在线径向畸变,在真实侧(InFlux++ Real)采用反向大视场标定范式与车载/手持穿戴多视角采集高平移运动日常视频,以合成监督驱动动态相机内参估计精度的全面跃升。
方法详解¶
整体框架¶
InFlux++ 针对动态相机内参估计任务构建了“物理可信合成训练集 + 泛化拓扑真实评测集”的双轨体系。整个流水线涵盖过程化场景构建、薄透镜光学参数化模拟、基于深度约束的时序连续游走、在线镜头畸变增强,以及面向真实世界大视场脚手架(FSF)的反向几何标定流程。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["InFlux++ 动态内参数据套件"] --> B["InFlux++ Synth 过程化生成合成集<br/>441K+ 帧 / 1841 视频"]
A --> C["InFlux++ Real 扩展真实基准<br/>514K+ 帧 / 334 视频"]
B --> D["薄透镜光学参数化与呼吸效应<br/>LFL 与 LTO 耦合物理求解 CFL"]
D --> E["时序平滑有界随机游走<br/>Bézier 插值与深度自适应对焦采样"]
E --> F["在线畸变注入与视角规划<br/>Brown-Conrady 模型与法向深度剪枝"]
C --> G["反向大视场静态标定范式<br/>移动相机覆盖固定巨幅 AprilTags 幕布"]
G --> H["大视差多模态真实数据采集<br/>手持/车载/可穿戴日常活动视频与隐私模糊"]
F --> I["合成监督预训练 / 微调"]
H --> I
I --> J["鲁棒动态相机内参估计输出"]
关键设计¶
1. 薄透镜光学参数化与呼吸效应模拟:以物理透镜方程驱动真实的有效焦距漂移
在现有的合成渲染管线(如标准 Blender)中,相机的传感器焦距与对焦平面通常被当作相互独立的变量分别设置,导致渲染出来的图像丢失了真实光学镜头固有的一致性物理规律。在真实摄影系统中,相机有效焦距(Camera Focal Length, CFL)不仅取决于变焦环调节的镜头基础焦距(Lens Focal Length, LFL,即对焦在无穷远处时的焦距),还受到对焦环所改变的镜头到物体对焦距离(Lens to Object Distance, LTO)的直接物理制约。为忠实复现真实变焦镜头的物理成像特性,InFlux++ Synth 抛弃了直接指定 CFL 的简化做法,而是依据高斯薄透镜公式(Thin Lens Equation)将 CFL 显式参数化为 LFL 和 LTO 的耦合函数:
该公式与 Blender Cycles 渲染引擎的光线追踪光学模型完美统一。更重要的是,这种物理参数化自然诱发了真实镜头在对焦调整时必然出现的“镜头呼吸效应”(Lens Breathing)——即在变焦环保持不动(LFL 恒定)的情况下,仅仅改变对焦距离(LTO)就会导致视场角(FOV)产生轻微的缩放漂移。将呼吸效应显式融入视频渲染,为神经网络从时序画面中解算微弱内参变化提供了极具价值的物理先验监督信号。
2. 时序平滑有界随机游走与深度自适应对焦采样:构建连续自然且主体清晰的内参时序流
真实拍摄中变焦与跟焦是平滑连续的过程,机械阻尼避免了参数的离散跳变;同时,对焦距离若脱离场景深度几何,极易导致整个画面弥散模糊。为了生成既符合连续物理运动又保持画面清晰度的内参轨迹,InFlux++ Synth 提出了深度感知的有界随机游走机制。对于镜头焦距 LFL,系统在 \([8\,\text{mm}, 100\,\text{mm}]\) 的合理物理区间内执行带有最大单步增量 \(\delta_{\max}\) 的随机游走采样,并在关键帧之间采用三次 Bézier 曲线进行连续插值,生成自然平滑的时序变焦轨迹。对于对焦距离 LTO,若直接盲目进行数值随机游走,随着相机穿行,视场内的几何主体极易全部脱焦成废片。因此,系统在每个时序关键帧通过光线追踪即时探测当前视场内的最近可见深度 \(d_{\text{near}}\) 与最远可见深度 \(d_{\text{far}}\),并将对焦距离参数化为该深度区间的归一化分位数 \(\alpha \in [0, 1]\):
通过对分数因子 \(\alpha\) 执行有界随机游走,系统不仅确保了对焦深度的连续平滑变换,更严格保证了在相机剧烈运动、视场深度动态扩展时,画面中始终存在处于焦平面上的清晰几何表面,杜绝了全屏虚焦缺陷。
3. 反向大视场静态标定范式:化静为动解决大视场脚手架真值标定困境
构建真实世界动态内参基准的核心在于建立高精度的镜头查找表(Look-Up Table, LUT),以离散标定栅格插值映射任意连续的 (LFL, FD) 组合。前作 InFlux 将标定细分为小中视场与大视场脚手架(Large FOV Spatial Footprint, Large FSF)。在广角大景深场景下,标定板必须放置在数米乃至十几米外才能处于对焦清晰范围内,若要充分激发相机的各个旋转自由度并铺满整个视野,标定板尺寸必须极为庞大,导致人工搬移翻转不可行,InFlux 曾不得不借助无人机悬挂标定板进行高难度采集。InFlux++ Real 彻底颠覆了“相机固定、移动标定板”的传统思维,提出“标定板固定、相机主动运动”的反向标定范式。团队在一座带有二层看台的挑高中空阶梯演讲厅内,将由密集 AprilTags 阵列构成的巨幅刚性标定幕布(尺寸达 \(5.45\,\text{m} \times 3.06\,\text{m}\))垂直固定。标定人员手持或架设相机,分别在一层地面左右两侧及二层看台左右两侧的四个离散空间基底上,主动变换机位平移并全方位旋转相机视角。由于透视投影关系具有严格的相对运动等价性,移动相机以多视角观测静态巨幅幕布,不仅轻而易举地覆盖了整个大视场脚手架的边缘区域,还高度激发了俯仰、偏航与滚转等多维旋转轴,完全摒弃了不可控的无人机悬吊方案,标定效率与真值精度大幅提升。
4. 在线几何畸变注入与法向深度视点规划:兼顾光学像差鲁棒性与丰富几何视差
为了增强合成数据对真实成像系统非理想像差的泛化能力,InFlux++ 搭建了在线数据加载与增强管线。基于 Brown-Conrady 多项式畸变模型,算法在图像边缘的控制点处自适应采样合理的径向畸变位移,反解出径向畸变系数 \(k_1, k_2\) 以及切向畸变系数 \(p_1, p_2\),在数据加载阶段动态注入畸变。在轨迹规划层面,InFlux++ Synth 扩展了 Infinigen 的 RRT 快速搜索随机树算法,引入法向量与深度联合约束准则:实时剔除法向单一、纹理匮乏的白墙或平坦无特征表面,同时引入局部路径重规划(Segment Replanning)机制,使相机运动轨迹兼具大平移距离与丰富几何视差;InFlux++ Real 则进一步扩展了车载挂载、手持日常家务(如洗衣、做饭)、户外体育对抗(如篮球)等动态场景,彻底补齐了真实测试集中的平移视差短板。
损失函数 / 训练策略¶
在模型微调与训练阶段,采用端到端基于流形学习的架构 AnyCalib。模型输入连续视频帧,在骨干网络特征提取后通过对极几何或单视线索预测视场场(Field of View Field)及畸变场。微调实验在 InFlux++ Synth 的代表性子集上展开,采用 AdamW 优化器,固定学习率调度并在 InFlux++ Real 的验证集上监控 CFL 百分比误差,选取验证集焦距误差最低的权重作为最终模型评估节点。
评测协议针对原版 EPE 指标进行了两项重要修正:一是单调分支截断,针对高阶 Brown-Conrady 畸变多项式在图像极边缘可能出现的非单调映射(错误地将视场外的远轴 3D 点折射回画面内),显式计算单调极值半径 \(r^*\),仅对 \(r < r^*\) 的物理有效射线计算三维重投影点;二是LUT-Reliable 可靠性掩模,对真实基准的 LUT 进行留一法(Leave-One-Out, LOO)交叉验证,仅保留围绕顶点的 LOO EPE 召回率均不低于 0.95 的可信插值区域帧参与指标计算,确保评测数字绝对自洽。
实验关键数据¶
主实验¶
在 InFlux 和 InFlux++ Real 的官方测试划分上,评测当前主流相机标定与自标定基准模型。评价指标包括焦距百分比误差召回率(\(f_x, f_y\) 在 1%、10%、20% 阈值下)、主点误差召回率(\(c_x, c_y\) 在 0.5%、1%、2% 阈值下)以及 LUT-Reliable 端点误差(EPE 在 10px、50px、300px 阈值下)。
| 方法 | \(f_x\) @10% (%) | \(f_y\) @10% (%) | \(c_x\) @1% (%) | \(c_y\) @1% (%) | EPE @10px (%) | EPE @50px (%) | EPE @300px (%) |
|---|---|---|---|---|---|---|---|
| AnyCalib (微调前) | 25.2 | 25.2 | 76.5 | 37.4 | 2.70 | 25.1 | 87.3 |
| AnyCalib (InFlux++ Synth 微调) | 31.2 | 31.3 | 67.2 | 33.4 | 1.93 | 18.7 | 78.6 |
| GeoCalib | 19.7 | 19.6 | 82.3 | 40.9 | 0.85 | 16.7 | 75.4 |
| UniDepthV2 | 14.0 | 13.1 | 45.4 | 9.14 | 0.57 | 6.14 | 63.0 |
| WildCamera | 12.9 | 13.0 | 8.91 | 10.8 | 0.17 | 4.26 | 59.1 |
| Perspective Fields | 7.65 | 7.53 | 2.97 | 3.09 | 0.13 | 0.81 | 23.7 |
| DroidCalib | 5.99 | 5.95 | 6.07 | 4.45 | 0.33 | 1.86 | 16.3 |
| COLMAP | 6.34 | 6.36 | 7.16 | 1.96 | 0.23 | 4.78 | 11.9 |
消融实验¶
针对基线模型 AnyCalib 在合成数据 InFlux++ Synth 上进行 15 个 epoch 的微调,在 InFlux、InFlux++ Real 以及二者合并集合(Combined)上的细分表现对比:
| 评测集 | 配置 / 模型 | \(f_x\) @1% (%) | \(f_x\) @10% (%) | \(f_x\) @20% (%) | \(c_x\) @1% (%) | \(c_y\) @1% (%) | EPE @50px (%) |
|---|---|---|---|---|---|---|---|
| InFlux | AnyCalib 原版 | 1.30 | 11.5 | 20.8 | 90.0 | 76.1 | 27.9 |
| InFlux | AnyCalib (微调后) | 2.21 | 17.5 | 34.1 | 94.4 | 51.3 | 34.1 |
| InFlux++ Real | AnyCalib 原版 | 3.36 | 28.2 | 45.7 | 62.3 | 24.2 | 17.9 |
| InFlux++ Real | AnyCalib (微调后) | 4.00 | 34.2 | 54.0 | 72.6 | 18.2 | 24.3 |
| Combined | AnyCalib 原版 | 3.00 | 25.2 | 41.3 | 76.5 | 37.4 | 25.1 |
| Combined | AnyCalib (微调后) | 3.68 | 31.2 | 50.4 | 67.2 | 33.4 | 18.7 |
关键发现¶
- 合成数据微调显著强化焦距感知:在 InFlux++ Synth 上进行微调后,AnyCalib 在所有测试划分上的 \(f_x\) 与 \(f_y\) 误差召回率均获得全方位提升。在 Combined 评测集上,\(f_x\) @10% 召回率从 25.2% 大幅提高到 31.2%,@20% 召回率从 41.3% 跃升至 50.4%,表明薄透镜物理参数化与呼吸效应模拟成功向网络注入了鲁棒的变焦线索。
- 主点与边缘畸变预测的内在张力:微调后模型的 \(c_x\) 和 \(c_y\) 精度在部分设置下出现下滑,导致依赖全图投影精度的全局 EPE @50px 出现下降。分析表明,AnyCalib 的视场场(FOV-field)监督目标与图像边缘畸变参数高度敏感的 EPE 存在目标不对齐,合成注入的 Brown-Conrady 强畸变未能被现有单帧网络结构完美解耦,指出未来架构需要将焦距与中心畸变进行显式解耦优化。
- 动态内参估计整体依然极具挑战:传统基于几何优化的 SfM 工具(如 COLMAP)在剧烈变焦和动态移动场景下由于对极几何关系失稳,召回率极低(\(f_x\) @10% 仅 6.34%);即使最强的学习型方法 AnyCalib,微调后在 10px 严苛阈值下的 EPE 召回率依然不足 2%,证明该领域亟待更专业的时序动态自标定架构。
亮点与洞察¶
- 从物理方程反向求解图形渲染参数:传统方法常通过对全景图随机裁剪模拟变焦,完全脱离了光学透镜组变焦、对焦与感光元件的物理协同。本文将薄透镜公式嵌入 Blender 流程,令对焦必然诱发镜头呼吸,这种“用物理仿真替代启发式增广”的思想对底层三维感知数据构建极具启发性。
- 反向移动相机的标定工程创新:在大视场标定中敏锐意识到“相对运动的等价性”,利用固定挑空建筑与巨幅幕布配合手持移动相机,不仅优雅规避了大型标定板难以操控和无人机飞行的安全与气流扰动隐患,更为未来超大场景的三维传感器多维自标定提供了标准化范例。
- 指标可靠性审计的严谨闭环:指出了高阶畸变多项式非单调区域导致虚假投影的评测漏洞,提出严格的单调分支截断与 LUT 留一法置信度过滤,为领域制定了更加自洽求真的评估基准。
局限与展望¶
- 作者承认的局限:目前 InFlux++ Synth 尚未将复杂的离轴非对称像差完全物理建模,合成微调后的模型在主点偏移(Principal Point Offset)较大的镜头序列上表现略显脆弱;同时当前基线方法多为单帧模型,尚未充分挖掘视频帧间连续光流与动态内参之间的强时序耦合约束。
- 拓展思考与改进方向:现有微调方法直接套用 AnyCalib 静态单图结构,面临损失函数与 EPE 不对齐的问题。未来应结合循环神经网络、时序 Transformer 或可微几何光流优化器,将逐帧焦距时序连续性先验作为隐式正则,探索端到端联合估计动态内外参和致密深度的下一代动态视频 SLAM 框架。
相关工作与启发¶
- vs InFlux (NeurIPS 2025): InFlux 首次提出真实动态内参评测基准,但缺乏合成训练监督,真实视频以纯旋转为主且场景局限在校园。InFlux++ Real 扩充了 51.4 万帧真实数据,引入大量平移运动与日常活动,并首创反向静态幕布标定;同时开创性推出 InFlux++ Synth 填补了大规模高质量动态合成监督的空白。
- vs AnyCalib (ICCV 2025): AnyCalib 提出了基于流形学习的单图模型无关相机标定方法,但其依赖全景裁剪训练,缺乏时序真实动态内参。本文证明利用 InFlux++ Synth 对其进行物理真实感微调,能大幅跨越域差异,全面激活其在真实动态视频中的焦距估计潜能。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出针对动态相机内参的薄透镜呼吸效应物理模拟与反向大视场标定范式,动静互补体系立意高远。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 7 种主流基线模型、上百万级图帧评测,对误差指标与 LUT 置信度进行了深度数学修正。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,物理推导与工程实现交代详实,图表规范完备。
- 价值: ⭐⭐⭐⭐⭐ 彻底补齐了动态变焦/对焦视频三维重建与自标定领域的训练与测试基石,极大拓展了视频 3DGS 与 SLAM 的应用边界。