Tactile Modality Fusion for Vision-Language-Action Models¶
会议: ECCV 2026
论文: ECCV 2026 | 项目主页
领域: 机器人/具身智能
关键词: 视觉-语言-动作模型, 触觉模态融合, FiLM 特征调制, 接触密集操作, 参数高效微调
一句话总结¶
TacFiLM 把预训练触觉编码器的嵌入经 MLP 转成 FiLM 的逐通道 scale/shift,直接调制 OpenVLA-OFT 视觉骨干的中间特征——不往语言模型里加任何 token,在真机插销、USB/HDMI 插拔与拉抽屉任务上把分布内平均成功率从 58.10% 提到 86.67%,峰值接触力降到约三分之一。
研究背景与动机¶
视觉-语言-动作模型(VLA)这条线上已经有了 OpenVLA、RT-2-X、π0.5、OpenVLA-OFT 等一批工作,它们把视觉-语言模型学到的语义表征接到低层动作生成上,让机器人策略既有语义泛化又能直接输出控制量。但这些模型的感知输入几乎只有视觉。接触密集的操作任务恰恰是视觉最不管用的地方:目标被手指和工件自身遮挡,装配误差常在毫米量级,而真正决定成败的物理量——接触力、表面摩擦、材料柔顺性、切向剪切——根本不在图像里。人类靠指尖触觉完成这类微调,机器人却只能靠图像猜。基于视觉的触觉传感器(DIGIT、GelSight)把凝胶形变拍成图像,形式上与视觉架构同源,因此过去两年出现了一批把触觉塞进 VLA 的尝试。
这些尝试分两条路,各有各的代价。第一条是在后训练微调阶段引入触觉:把触觉编码成额外 token 拼到 VLM 的输入序列里,或在视觉骨干之后加专门的交叉注意力层让视觉与触觉互相 attend。拼接会拉长序列、增加计算量,并且已有工作表明上下文变长时性能反而可能退化;交叉注意力则引入一批新的可训练注意力参数,需要更多数据才能学到有效的跨模态对应关系。第二条路是靠大规模多模态预训练或对比学习先把触觉与视觉对齐,再训策略——效果不错,但数据与算力门槛高。而真实部署的处境是:行为模型本身已经很大,一个新任务、一个新传感器往往只有几十到上百条演示,所以真正需要的是能在后训练微调范式内完成、不用重训大部件、又确实能吃到触觉信息的轻量融合方案。
本文的角度是:与其往序列里塞新 token,不如用触觉去调制已经存在的视觉特征。触觉图像先过一个预训练的触觉编码器得到池化嵌入,再用一个轻量 MLP 生成 FiLM(feature-wise linear modulation)的逐通道缩放与平移参数,作用在视觉 ViT 块归一化之后、多头自注意力之前——语言模型看到的 token 数量和内容一个都没变,也不需要为每类传感器单独训编码器。核心 idea:把触觉融合从「拼接 / 交叉注意力」改写成「对视觉中间特征做逐通道仿射调制(FiLM)」,并把调制参数零初始化,使条件化从近似恒等映射出发,从而在不破坏 VLA 预训练视觉-语言先验、不增加 token 长度的前提下注入接触信息。
方法详解¶
整体框架¶
TacFiLM 建在 OpenVLA-OFT 上:融合的 SigLIP + DINOv2 视觉骨干产出 patch 级视觉嵌入,一个轻量 MLP projector 把它投到语言模型输入空间,解码器是 Llama2 7B,最后一层隐状态交给 MLP 动作头,用 L1 回归直接回归连续动作块。TacFiLM 在视觉骨干内部插了一层条件化:每个时间步,DIGIT 触觉图像经预训练触觉编码器编码后池化成一个全局触觉向量 \(z_t\),再由 MLP 映射成每个被选中的 ViT 块的 \(\gamma_n,\beta_n\),在该块的归一化之后、多头自注意力之前对中间视觉特征做一次逐通道仿射变换。调制后的视觉特征照常送进语言模型,与语言 token 拼接,输出动作块。
整条链路里,触觉既不新增 token、也不新增注意力层,唯一的"接口"就是 ViT 块里的那一对 \(\gamma,\beta\);训练侧则用 LoRA 微调 VLA 与触觉骨干的线性层、同时从零训练 FiLM 层,其余权重冻结。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
A["DIGIT 触觉帧 + RealSense RGB<br/>+ 语言指令(10 Hz)"] --> B["预训练触觉表征复用<br/>Sparsh-DINO 编码 → 池化 z_t"]
A --> C["SigLIP + DINOv2 视觉骨干<br/>patch 级视觉嵌入"]
B --> D["FiLM 触觉条件化<br/>MLP 出 γ/β,调制视觉特征"]
C --> D
D --> E["Llama2 7B 解码器<br/>视觉 token + 语言 token"]
E --> F["MLP 动作头 · L1 回归"]
F --> G["7-DoF 连续动作块"]
subgraph S["参数高效后训练(训练侧)"]
direction TB
H["LoRA:VLA 与触觉骨干线性层"] --> I["FiLM 层从零训练<br/>γ/β 零初始化"]
end
I -.->|训练时更新 γ/β| D
关键设计¶
1. 预训练触觉表征复用:不训任务专用编码器,直接把预训练触觉表征接到策略上
前两条触觉融合路线里,编码器要么与策略联合训练,要么靠额外的多模态预训练对齐,两者都意味着更多数据与算力。TacFiLM 的做法是把触觉编码器当成一个现成的、冻结的表征来源:触觉图像只做最基本的预处理(缩放到 224×224、去背景;Sparsh 系列还会把相隔 5 个时间步的两帧在通道维拼接,以显式带上动态信息),然后直接取编码器的输出特征。论文考察了两种架构:T3 是"每类传感器一个独立 ViT 编码器 + 共享 ViT transformer 主干"的框架,TacFiLM 只保留传感器编码器与主干、丢掉任务专用解码器;Sparsh 则是一个用自监督目标训练的 ViT,论文比较了它的三个变体——Sparsh-MAE(掩码自编码)、Sparsh-IJEPA(联合嵌入预测)、Sparsh-DINO(自蒸馏)。两者输出的都是固定维度嵌入,因此融合模块对编码器选择完全不敏感。
选型不是拍脑袋:论文在三个二分类探针任务上评了这些预训练表征——Rotation-High / Rotation-Low 判断夹爪里的销子相对初始位姿是否被转动(考察对接触几何变化的敏感度),Contact 判断是否发生接触(考察力与形变特征的编码能力),另外在 Sparsh TacBench 的连续力回归任务上看 RMSE。Sparsh-DINO 在三项分类上平均 97.72%、力回归 RMSE 36.09 均为最好,因此成为后续所有实验的触觉骨干。这个设计的价值在于:换传感器时只需要换一个现成的预训练编码器,不必重新采集传感器专用数据再训练编码器,这也是论文强调"面向通用 VLA 的设计哲学"的落点。
2. FiLM 触觉条件化:用触觉去调制视觉中间特征,而不是往输入序列里塞 token
拼接式方法把触觉嵌入投影后追加到视觉/语言 token 上,序列变长、计算变贵;交叉注意力式方法在视觉骨干后再叠若干注意力块,新增的可训练参数需要更多数据才能收敛。TacFiLM 选择第三条路:让触觉成为一个作用于视觉特征的全局低维偏置。每个时间步 \(t\),触觉图像被编码成 patch 特征后做平均池化得到 \(z_t\),再由一个 MLP 为视觉编码器(DINOv2 与 SigLIP 两路)中每个选中的 ViT 块 \(n\) 生成一对通道级参数 \(\gamma_n,\beta_n\),并在归一化之后、多头自注意力之前对中间视觉特征 \(F_n\) 施加
(⚠️ 缓存全文里该公式被 PDF 抽取破坏成 FiLM(F_n|γ_n,β_n)F_n⊙γ_n)β_n,此处按 FiLM 原文与上下文还原为上式,以原文为准。)\(\gamma,\beta\) 被施加在整个特征图上(沿用 OpenVLA-OFT 的设计),且零初始化——初始时调制退化为恒等映射,条件化是在微调过程中逐步"长出来"的,这解释了为什么它不会一上来就扰乱 VLA 的视觉-语言先验。默认对所有 ViT 块施加条件化,第 4.3 节把这一选择做了消融。
这条设计之所以轻,是因为触觉信息被压缩成了一个与序列长度无关的全局调制信号:语言模型看到的 token 数量与视觉-语言基线完全一致,没有上下文膨胀的风险;而调制位置选在 ViT 块内部,意味着触觉可以在视觉特征还没被语言模型"读走"之前就改变它们的表示,而不是等 token 送进 LLM 之后再靠注意力去融合。消融结果也支持"不必铺满"的判断:只在一部分块上加 FiLM 性能几乎不掉。
3. 参数高效后训练:只学 FiLM 与少量 LoRA 权重,把触觉"注入"而不重造模型
通用 VLA 即使经过大规模预训练,直接用在专门的装配任务上精度依然不够,但全量微调既贵又容易把通用先验洗掉。TacFiLM 沿用 LoRA 式的高效微调配方,并把它扩到触觉维度上:对 TacFiLM 增强后的 VLA(即 OpenVLA-OFT 与触觉骨干)的线性层加 LoRA 适配器,同时把 FiLM 层作为新模块从零训练,模型其余部分全部冻结。也就是说,新增的可学参数只有两部分——低秩适配器与那两个 MLP 输出的 \(\gamma,\beta\)——却足以把一种全新的模态接到原有策略上。
这样安排还有一层与设计 2 呼应的好处:零初始化的 FiLM 让"触觉通路"从一个不改变行为的恒等映射开始,LoRA 又只允许基底模型做小幅度调整,两者叠加使微调后的策略仍然站在原 VLA 的语义理解之上,只是多了对接触状态的敏感性。论文报告所有部署方法都训练到 80k 步。
一个完整示例¶
以分布内最简单的 Circle-Peg 3mm 任务为例走一个控制步(流程与量级均来自原文的任务设置,内部张量维度原文未给出):机器人被设定为起手就已握住销子(论文明确不评测抓取),当前语言指令是模板化的 "Insert the [colour] [shape] peg into the [colour] base"。10 Hz 的一步里,RealSense 的 RGB 帧进入 SigLIP + DINOv2 得到 patch 级视觉嵌入,DIGIT 拍到指尖凝胶的接触形变,Sparsh-DINO 把它编码、池化成一个触觉向量 \(z_t\),MLP 随即给出该步的 \(\gamma_t,\beta_t\) 并调制视觉特征。若销子边缘只是单侧轻轻蹭到基座孔口(视觉上几乎看不出差别,因为孔口被销子和夹爪挡掉大半),触觉形变图会明显偏向一侧,调制量随之改变,策略输出的动作块就是一个小的横向修正;如果按视觉给出的动作硬推,接触力会迅速冲到 14.94 N 量级——这正是纯视觉基线在这一档间隙上的表现,而 TacFiLM 把这一任务的峰值力压到 7.64 N、平均 52.03 秒完成、36.67% 的回合一次插入成功。同一套流程在 2mm 间隙、以及分布外的方形/五边形销与 HDMI 插头上重复,唯一变化的是语言指令里的形状词与现场的接触模式。
损失函数 / 训练策略¶
动作头用 L1 回归直接回归连续动作块:解码器末层隐状态经 MLP 动作头输出动作(论文未给出动作块长度与维度的具体超参)。训练策略是"冻结为主 + 局部可学":LoRA 只加在 TacFiLM 增强 VLA 的线性层(OpenVLA-OFT 与触觉骨干都包含在内),FiLM 层从零训练,\(\gamma,\beta\) 零初始化;所有对比方法的部署模型都训练到 80k 步,以保证公平比较。
数据侧,作者用 Polymetis 做高层控制与遥操作、libfranka 经 Franka Control Interface 以 1 kHz 下发底层指令,操作者用 3Dconnexion SpaceMouse 的 6-DoF 输入映射成笛卡尔位姿指令。每个任务采集 80 条专家演示、每条约 70 步,以 10 Hz 记录时间对齐的关节位置与速度、末端位姿、夹爪开合与状态、RealSense 的 RGB 图像、DIGIT 的触觉图像以及执行的动作,并为每条演示附上固定的自然语言描述。硬件是 7 自由度的 Franka Emika Panda 配平行二指夹爪 Franka hand,其上装有 DIGIT 视触觉传感器。
实验关键数据¶
主实验¶
评测在真机上完成,共超过 1000 次 rollout:分布内 480 次(每方法每任务 30 次)、分布外 300 次(每方法 15 次)、消融 240 次。分布内任务为 Circle-Peg(3mm / 2mm 间隙)、USB 线缆插入、拉开抽屉;分布外任务为 Square-Peg 与 Pentagon-Peg(各 3mm / 2mm 间隙)以及 HDMI 线缆插入。四个基线共用同一 OpenVLA-OFT 骨干,差异只来自融合方式:OpenVLA-OFT 为纯视觉基线;TactileConcat 把预训练触觉嵌入经两层 MLP 投到 VLM 输入空间后与视觉/语言 token 拼接;Cross-Attn 按 PolyTouch 的架构,在视觉骨干之后叠六个带残差的交叉注意力块,视觉 patch 嵌入作 query、触觉嵌入作 key/value。
| 任务 | 方法 | 成功率 (%) | 直接完成 (%) | 平均最大力 (N) | 平均耗时 (s) |
|---|---|---|---|---|---|
| 分布内(ID,每方法每任务 30 次) | |||||
| Circle-Peg 3mm | OpenVLA-OFT | 86.67 | 3.33 | 14.94 ± 4.66 | 92.24 ± 48.10 |
| TactileConcat | 96.67 | 16.67 | 9.19 ± 3.45 | 75.11 ± 37.28 | |
| Cross-Attn | 63.33 | 10.00 | 8.16 ± 7.18 | 155.13 ± 31.59 | |
| TacFiLM | 100.00 | 36.67 | 7.64 ± 2.63 | 52.03 ± 5.02 | |
| USB-Cable-Plug | OpenVLA-OFT | 33.33 | 0.00 | 15.01 ± 9.09 | 164.52 ± 27.06 |
| TactileConcat | 43.33 | 6.67 | 12.96 ± 5.04 | 135.11 ± 56.82 | |
| Cross-Attn | 33.33 | 0.00 | 26.23 ± 14.98 | 134.58 ± 52.96 | |
| TacFiLM | 73.33 | 33.33 | 10.15 ± 5.47 | 99.71 ± 46.43 | |
| Open-Drawer | OpenVLA-OFT | 33.33 | 33.33 | 13.64 ± 0.54 | 152.65 ± 39.37 |
| TactileConcat | 26.67 | 26.67 | 9.74 ± 0.89 | 141.66 ± 35.93 | |
| Cross-Attn | 20.00 | 20.00 | 17.40 ± 6.58 | 165.64 ± 28.61 | |
| TacFiLM | 86.67 | 73.33 | 10.84 ± 1.87 | 94.33 ± 46.43 | |
| ID 平均(原文报告) | OpenVLA-OFT | 58.10 | 12.38 | 14.94 ± 9.16 | 126.72 ± 51.34 |
| TactileConcat | 64.76 | 10.48 | 10.27 ± 4.12 | 113.04 ± 52.31 | |
| Cross-Attn | 48.00 | 12.00 | 13.43 ± 12.62 | 149.92 ± 39.01 | |
| TacFiLM | 86.67 | 37.14 | 8.65 ± 3.80 | 81.72 ± 38.00 | |
| 分布外(OOD,每方法每任务 15 次) | |||||
| Square-Peg 3mm | OpenVLA-OFT | 93.33 | 0.00 | 18.31 ± 8.84 | 51.60 ± 5.62 |
| TactileConcat | 93.33 | 13.33 | 9.34 ± 5.56 | 69.77 ± 23.40 | |
| Cross-Attn | 60.00 | 6.67 | 6.49 ± 1.14 | 165.27 ± 18.74 | |
| TacFiLM | 100.00 | 46.67 | 5.37 ± 0.41 | 52.95 ± 4.68 | |
| Square-Peg 2mm | OpenVLA-OFT | 66.67 | 0.00 | 34.30 ± 11.18 | 64.54 ± 10.64 |
| TactileConcat | 86.67 | 6.67 | 27.72 ± 8.36 | 91.83 ± 10.64 | |
| Cross-Attn | 53.33 | 6.67 | 26.24 ± 12.36 | 156.33 ± 28.07 | |
| TacFiLM | 80.00 | 40.00 | 7.06 ± 1.36 | 111.61 ± 38.31 | |
| HDMI-Cable-Plug | OpenVLA-OFT | 6.67 | 0.00 | 10.71 ± 8.93 | 166.88 ± 38.29 |
| TactileConcat | 13.33 | 0.00 | 11.18 ± 5.08 | 174.59 ± 13.84 | |
| Cross-Attn | 33.33 | 0.00 | 33.82 ± 12.79 | 133.97 ± 39.33 | |
| TacFiLM | 66.67 | 6.67 | 11.54 ± 3.88 | 116.87 ± 45.46 | |
| OOD 平均(原文报告) | OpenVLA-OFT | 54.67 | 0.00 | 22.46 ± 15.75 | 89.48 ± 46.05 |
| TactileConcat | 73.33 | 8.00 | 16.47 ± 10.54 | 105.79 ± 43.16 | |
| Cross-Attn | 49.33 | 5.33 | 19.27 ± 14.62 | 149.77 ± 33.72 | |
| TacFiLM | 86.67 | 29.33 | 8.40 ± 4.71 | 87.84 ± 42.69 |
⚠️ 表格中的"平均"行按原文数值照录。分布外的平均行与逐任务列吻合;但分布内的平均行对不上逐任务列的算术平均(例如 TacFiLM 的四个分布内任务直接完成率为 36.67 / 23.33 / 33.33 / 73.33,均值 41.67%,原文写 37.14%;纯视觉基线的成功率列均值 55.00%,原文写 58.10%),推测是按 rollout 数加权或存在排版/抽取误差。正文叙述以上表的逐任务数值为准。
消融实验¶
第一组消融回答"FiLM 加在哪里":默认在所有 ViT 块施加(AllFiLM),另外构造只在三分之一块上施加的三个变体——EarlyFiLM / MiddleFiLM / LateFiLM 分别对应视觉骨干的浅层、中层与深层。第二组则考察相机退化时触觉能否补位:把光照压暗 80%,以及只更新 50% 的相机帧(部分帧冻结)。
| 设置 | 方法 | 成功率 (%) | 直接完成 (%) | 平均最大力 (N) | 平均耗时 (s) |
|---|---|---|---|---|---|
| Circle-Peg 3mm(ID) | AllFiLM | 100.00 | 36.67 | 7.64 ± 2.63 | 52.03 ± 5.02 |
| EarlyFiLM | 93.33 | 60.00 | 6.69 ± 0.92 | 60.85 ± 8.26 | |
| MiddleFiLM | 100.00 | 26.67 | 7.14 ± 1.71 | 53.88 ± 5.08 | |
| LateFiLM | 100.00 | 23.33 | 8.47 ± 2.71 | 54.74 ± 7.34 | |
| Pentagon-Peg 3mm(OOD) | AllFiLM | 100.00 | 33.33 | 7.51 ± 2.88 | 53.15 ± 5.89 |
| EarlyFiLM | 100.00 | 33.33 | 9.96 ± 4.49 | 77.40 ± 21.68 | |
| MiddleFiLM | 100.00 | 53.33 | 8.99 ± 4.49 | 53.57 ± 6.89 | |
| LateFiLM | 100.00 | 40.00 | 9.42 ± 3.31 | 68.57 ± 27.47 | |
| Circle-Peg 3mm(光照压暗 80%) | OpenVLA-OFT | 93.33 | 0.00 | 16.29 ± 9.85 | 73.50 ± 8.41 |
| TactileConcat | 86.67 | 26.67 | 11.15 ± 9.21 | 78.03 ± 30.16 | |
| Cross-Attn | 53.33 | 0.00 | 9.29 ± 5.96 | 159.96 ± 29.15 | |
| TacFiLM | 100.00 | 26.67 | 8.62 ± 2.13 | 67.79 ± 6.25 | |
| Circle-Peg 3mm(仅 50% 帧更新) | OpenVLA-OFT | 73.33 | 0.00 | 15.70 ± 12.39 | 113.19 ± 40.39 |
| TactileConcat | 80.00 | 40.00 | 14.64 ± 13.91 | 71.52 ± 34.51 | |
| Cross-Attn | 46.67 | 0.00 | 7.53 ± 1.25 | 161.10 ± 30.70 | |
| TacFiLM | 100.00 | 26.67 | 8.12 ± 1.90 | 51.68 ± 5.33 |
第三组是触觉编码器的选型,用三个二分类探针加 TacBench 的力回归 RMSE 选出 Sparsh-DINO。
| 任务 | T3 | Sparsh-IJEPA | Sparsh-MAE | Sparsh-DINO |
|---|---|---|---|---|
| Rotation-High (%) | 92.73 | 99.15 | 99.36 | 99.36 |
| Rotation-Low (%) | 83.09 | 96.44 | 96.64 | 98.42 |
| Contact (%) | 73.31 | 85.08 | 93.92 | 95.39 |
| 分类平均 (%) | 83.04 | 93.56 | 96.64 | 97.72 |
| 力估计 RMSE (TacBench) | 58.64 | 40.27 | 36.61 | 36.09 |
关键发现¶
- 触觉的收益集中在最难"看"的地方。 增益最大的三个任务恰好都在视觉物理上最吃亏:拉抽屉 33.33% → 86.67%(+53.3 个百分点)、分布内 USB 插入 33.33% → 73.33%、分布外 HDMI 插入 6.67% / 13.33% → 66.67%(+33.3 个百分点,原文摘要表述为"提升 30%")。2mm 间隙档位同理:视觉无法分辨毫米级偏差,成功率与一次完成率都靠触觉撑住。
- 提升更大程度体现在"一次成功"而不是"救回来"。 分布内平均成功率 58.10% → 86.67%,而直接完成率 12.38% → 37.14%(原文报告值),说明触觉让策略在首次对准时就更准,而不是靠反复试探。拉抽屉任务上这一点最极端:TacFiLM 直接完成率 73.33%,其余方法没有一个超过 33.33%。
- 触觉还顺手解决了力安全问题。 TacFiLM 在所有任务上都拿到最低或接近最低的峰值接触力:分布内 8.65 N 对纯视觉 14.94 N,分布外 8.40 N 对纯视觉 22.46 N,约为基础方法的三分之一。对比之下 TactileConcat 在困难档位会"硬顶"——分布外 Square-Peg 2mm 上它拿到 86.67% 成功率却把峰值力推到 27.72 N,而 TacFiLM 在同一任务上只用 7.06 N。
- 交叉注意力在数据有限时最吃亏。 Cross-Attn 在所有任务上都垫底,分布内平均成功率 48.00%、平均耗时 149.92 s,即便在相对最好的 HDMI 任务上也弱于 TacFiLM。作者的解释是:它引入了额外的视觉-触觉可训练交互,而每个任务只有 80 条演示、共 80k 步训练,学不出可靠的多模态对应关系;相比之下 FiLM 只是把触觉压成一个全局调制偏置,参数需求低得多。
- FiLM 不必铺满所有 ViT 块。 四个集成位置在成功率上几乎打平(Circle-Peg 3mm 上 93.33%–100%,Pentagon-Peg 3mm 上全部 100%),但 EarlyFiLM 在 Circle-Peg 3mm 上把直接完成率从 AllFiLM 的 36.67% 提到 60.00%,说明浅层条件化可能已经够用,实际部署可以只改少量块来进一步压低开销。
- 相机退化时触觉是可靠的备份通道。 光照压暗 80% 和只更新 50% 帧两种条件下,TacFiLM 都保持 100% 成功率;纯视觉基线在帧冻结时掉到 73.33%,Cross-Attn 从 63.33% 掉到 46.67%–53.33%。有趣的是 TactileConcat 在帧冻结时直接完成率(40.00%)反而更高,但代价是更大的接触力和更慢的执行——它的触觉 token 确实在起作用,只是不像 FiLM 那样同时把力与时间控制住。
- 编码器选型:自监督目标越强,触觉特征越适合插入。 T3 在 Contact 探针上只有 73.31%、力回归 RMSE 58.64,明显弱于三个 Sparsh 变体;Sparsh-DINO 全面最好(分类平均 97.72%、RMSE 36.09)。这也印证了设计 1 的前提——预训练触觉表征的质量直接决定了轻量融合能走多远。
亮点与洞察¶
- 把"融合"从序列空间搬到特征空间。 拼接与交叉注意力都在改语言模型的输入或加新的注意力层,FiLM 却只改视觉特征的逐通道尺度与偏移。这一步换来三个直接好处:token 数不变(没有长上下文退化风险)、参数极少(一个 MLP 输出两个向量)、与传感器解耦(换触觉编码器不影响融合模块)。思路可以迁移到任何"要给大模型加一路低带宽传感器"的场景,例如力/力矩、音频、温度。
- 零初始化的条件化是"不破坏预训练先验"的关键。 \(\gamma,\beta\) 初始化为 0 意味着训练起点等价于原模型,触觉通路是从恒等映射开始被"长出来"的;这解释了为什么在一个只有 80 条演示的任务上微调,视觉-语言先验也没被冲掉。这个技巧(conditioning starts near identity)几乎可以无成本地搬到任何基于 FiLM/AdaLN 的适配里。
- 用"探针 + 回归"挑编码器,而不是端到端试。 作者没有把 T3 与三个 Sparsh 变体分别塞进 VLA 跑完整实验,而是先在旋转/接触两个二分类探针和 TacBench 力回归上筛选,选完再做策略实验。这套低成本选型流程同样适用于其他"外挂预训练表征"的工作。
- 早层条件化可能比铺满更好。 EarlyFiLM 直接完成率 60.00% vs AllFiLM 36.67%(Circle-Peg 3mm,成功率略低 6.67 个百分点)——触觉更像是一种应该尽早注入的"先验偏置"而非后期修正信号,这对后续设计触觉-视觉融合位置很有启发。
局限与展望¶
- 作者承认的首要局限是任务谱系不够宽。由于缺乏精确的视触觉仿真器,实验只能在真机上做,数据采集与 rollout 都极其耗时,因此只覆盖了插入与拉抽屉两类接触密集任务,没有涉及更广泛的操作技能(如灵巧手内操作、柔性物体)。
- 方法绑定在 OpenVLA-OFT 架构上:FiLM 是插在它的视觉骨干块里的,迁移到 π0.5 等其它 VLA 骨干被列为未来工作。考虑到不同 VLA 的视觉编码器与特征维度差异很大,这种迁移并非改一行代码。
- 从笔记视角看还有几点:第一,论文不评测抓取,所有插入任务都是"起手已握持",这回避了触觉最有价值的场景之一(抓取时的滑移检测与力控抓握);第二,每个任务只有 80 条演示、单一物体几何,OOD 也只是换了销子形状与间隙,真正的跨物体/跨传感器泛化没有验证;第三,虽然论文强调"复用预训练触觉表征可以免去传感器专用数据采集",但实验只用了 DIGIT 一种传感器,跨传感器迁移的说法尚未被实验支撑;第四,分布内的平均行与逐任务列对不上,虽然不影响趋势结论,但会让读者对精确数值打折扣。
- 可改进的方向:把 FiLM 的调制位置与"触觉是否需要时间历史"一起做消融(目前 Sparsh 的两帧拼接是隐式地给了动态信息,但 FiLM 本身是逐帧的);在 2mm 这类困难档位上把交叉注意力与 FiLM 组合,用后者提供低维先验、前者做细粒度对齐;以及在仿真中构造视触觉对,把评测从"两个任务族"扩到成规模的任务集。
相关工作与启发¶
- vs TactileConcat(拼接式融合):他们用预训练触觉编码器加两层 MLP 把触觉投成 token 拼进 VLM 输入,本文则把触觉压成视觉特征的逐通道调制。在简单任务(Circle-Peg 3mm)上两者成功率接近(96.67% vs 100%),但随着任务变难,拼接式的优势迅速衰减:分布内平均 64.76% vs 86.67%,且在 2mm 档位出现峰值力飙升(27.72 N vs 7.06 N)。差异的根源是拼接把触觉当作"平等的另一路 token",而本文把它当作"作用于视觉的偏置"。
- vs Cross-Attn(PolyTouch 式交叉注意力):他们在视觉骨干后用六个带残差的交叉注意力块做视觉-触觉对齐,本文认为这类新增可训练交互在每任务 80 条演示的数据量下学不出来——实验结果支持这一点(分布内平均 48.00%,低于纯视觉基线的 58.10%)。启发是:当数据受限时,融合模块的可学参数量本身就是一个需要权衡的变量。
- vs VLA-Touch / VTLA / ForceVLA 等触觉增强 VLA:这些工作同样在后训练阶段引入触觉,但多采用 token 拼接或额外预训练对齐,本文的差异在于强调"不增加序列长度、不训练任务专用编码器、在参数高效微调范式内完成"。
- vs T3 / Sparsh(触觉表征预训练):本文不改进编码器本身,而是把它们的表征作为即插即用输入,并给出了一套低成本的编码器选型协议(探针分类 + 力回归)。对做多模态策略的人来说,这相当于提示:先把"表征从哪来"选对,再考虑"怎么融合"。
- vs 纯视觉 VLA(OpenVLA、OpenVLA-OFT、π0.5):本文没有改动这些模型的训练范式,只是证明在接触密集任务上补一路触觉的性价比很高——尤其是当视觉被遮挡、光照退化或帧率下降时,触觉能独立撑住成功率。
评分¶
- 新颖性: ⭐⭐⭐⭐ [FiLM 本身不是新东西,但把它作为 VLA 的触觉融合接口、并配上一套"预训练触觉表征 + 零初始化调制 + LoRA"的轻量配方,是清晰且此前少见的组合]
- 实验充分度: ⭐⭐⭐⭐⭐ [超过 1000 次真机 rollout,覆盖分布内外四个与五个任务、两档间隙、四种融合方式、四种 FiLM 位置与两种相机退化条件,还额外做了触觉编码器选型对比]
- 写作质量: ⭐⭐⭐ [动机与设计叙述清楚,但表格的分布内平均行与逐任务列对不上,部分公式在排版/抽取中损坏,读者需要自行核对数值]
- 价值: ⭐⭐⭐⭐ [给出了一条在有限演示下把触觉接进 VLA 的低成本路线,且给出了"何时该用哪种融合"的经验证据(数据少时别用交叉注意力)]