What Images Cannot Say: Language-Guided Olfactory Representation Learning¶
会议: ECCV 2026
论文: ECCV 原文
项目: Project Page
领域: 信息检索/RAG
关键词: 嗅觉表示学习, 跨模态检索, 视觉语言模型, 电子鼻, 气味解耦
一句话总结¶
针对图像无法直接观测全场景气味弥散源与环境背景的问题,SCENT 提出利用视觉语言模型(VLM)生成涵盖物体、环境与推测气味的文本先验作为语义桥梁,结合双投影对齐与气味隐空间解耦机制,在电子鼻气味-图像/文本检索任务上取得 SOTA 表现。
研究背景与动机¶
多模态感知系统长期以来主要聚焦于视觉、听觉与文本的融合建模,但人类在真实物理世界中的具身体验往往超越了单纯的可见像素。嗅觉作为感知环境化学组成的核心感官,在食品安全鉴别、空气质量与有害气体监测、以及具身环境理解中扮演着不可替代的角色。近年来,便携式电子鼻(e-nose)传感器阵列的发展使得采集高维气味时序信号成为可能,催生了诸如 New York Smells(NYS)等真实城市场景下视觉-嗅觉配对的数据集,推动了机器嗅觉向开放场景感知的跨越。
然而,将高维电子鼻传感器阻值响应对齐到语义空间面临着两个根本性物理与感知层面的挑战。首先,气味分子具有强烈的空间弥散性,传感器记录的气味信号往往来自镜头视野之外的广阔环境背景(例如地铁站排风口的金属风味或街道远处的汽车尾气),导致单张视场受限的抓拍图像存在严重的“部分可观测性”(Partial Observability),仅依赖视觉像素特征监督根本无法解释实际测得的气味成分。其次,真实环境中的气味记录几乎全部是复杂混合物,来自目标物体的特有气味与周围环境的背景气味深度交融,在无监督或弱监督条件下极难将独立的语义物理源分离开来。
视觉语言模型(VLM)在大规模多模态数据上预训练后,不仅内化了丰富的外观表征,还积累了广泛的常识物理世界先验,能够根据视觉线索合理推断场景内潜在的环境状态与气味属性。本文的切入角度是,借助大模型的跨模态推理能力,将视觉场景中“看不见但闻得到”的上下文信息通过自然语言结构化显式展开,使语言充当视觉观察与化学传感器信号之间的语义桥梁。核心 idea:提出 SCENT 框架,利用 VLM 从图像中提取物体、场景与环境气味推测三级文本描述作为语义先验,构建三模态共享对齐空间,并通过语言引导的隐空间解耦分离目标气味与环境气味,实现鲁棒的跨模态嗅觉表征学习与气味混合物分解。
方法详解¶
整体框架¶
SCENT(Semantic Context-aware e-Nose Transformer)的整体架构围绕“先验生成-三模态表征对齐-隐空间解耦”三个串行且互补的阶段构建。系统输入为成对的场景图像 \(I\) 与 32 通道电子鼻传感器时间序列 \(X \in \mathbb{R}^{C \times 2T}\)(包含环境基线段与物体近距离采样段拼接而成),目标是获得与视觉、文本高度对齐且具备解耦能力的紧凑嗅觉嵌入向量。
整个流程首先通过预训练的视觉语言模型生成三层级的结构化文本描述 \(T(I)\),并送入冻结的文本编码器提取先验特征;随后,基于 Transformer 的嗅觉编码器将多通道传感器响应编码为全局特征,并通过视觉与文本双投影头分别与微调后的图像特征和文本特征执行双路对比对齐;最后,在预训练嗅觉特征之上挂载解耦投影头与重构解码器,在细粒度文本监督下把气味信号分解为物体固有分量与环境背景分量。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["场景图像 I + 电子鼻信号 X"] --> B["阶段1:VLM 语义场景增强<br/>推测物体/环境/隐性气味文本"]
B --> C["阶段2:多模态嗅觉表征对齐<br/>双投影头对齐视觉与文本特征空间"]
C --> D["阶段3:语言引导的隐式气味解耦<br/>解耦物体与环境气味并施加重构约束"]
D --> E["跨模态检索与零样本组合推理"]
关键设计¶
1. VLM 语义场景增强:利用世界知识补齐视觉盲区中的气味线索
针对单视角画面无法观测视场外弥散气味源的痛点,本文设计了结构化提示词策略,引导预训练 VLM(如 Qwen3-VL-30B)对输入图像 \(I\) 进行由表及里的常识外推,生成三级语义描述集合: $\(T(I) = \{ t_{\text{obj}}, t_{\text{ctx}}, \{ t_{\text{smell}}^{(k)} \}_{k=1}^K \}\)$ 其中 \(t_{\text{obj}}\) 精确描述图像中的主体目标,\(t_{\text{ctx}}\) 刻画宏观环境上下文(如室内办公室、雨后公园),而 \(\{ t_{\text{smell}}^{(k)} \}_{k=1}^K\) 则显式要求模型基于常识推测环境中合理存在但未入镜的气味先验(如打印机纸尘、空调冷气、潮湿泥土)。随后将三者拼接输入至冻结的 CLIP 文本编码器 \(f_T\),得到高维语义锚点 \(z^T = f_T(\text{prompt}(T))\)。这种设计将不可见的扩散化学环境转化为显式、高密度的高阶语言监督信号,彻底打破了以往仅靠有限视野像素拟合复杂气味信号的物理瓶颈。
2. 多模态嗅觉表征对齐:双投影头统一气味-视觉-文本共享空间
针对传感器电阻响应物理信号(32 个敏感单元的时变阻值曲线)与高层语义特征分布差异巨大的问题,模型采用包含 6 层 Transformer、8 个注意力头的嗅觉编码器 \(f_S\)。将输入阻值矩阵 \(X = [B; S] \in \mathbb{R}^{32 \times 2T}\) 线性投影至 448 维并注入正弦位置编码,提取全局时空表征 \(z^S = f_S(X)\)。为化解视觉与文本模态间内在的表征偏移,SCENT 没有强行将三者压入单一刚性空间,而是引入模态专用的双轻量 MLP 投影头: $\(z^S_I = \phi_I(z^S) \in \mathbb{R}^{512}, \qquad z^S_T = \phi_T(z^S) \in \mathbb{R}^{512}\)$ 在训练过程中,保持文本编码器参数冻结以锚定广阔的世界知识语义流形,同时对 CLIP 图像编码器 \(f_I\) 进行可学习微调以自适应嗅觉相关特征。模型采用双路对称 InfoNCE 损失进行端到端优化: $\(\mathcal{L}_{\text{total}} = \lambda_{IS}\mathcal{L}_{IS} + \lambda_{ST}\mathcal{L}_{ST}\)$ 该损失强制拉近成对气味与图像、成对气味与合成文本的余弦距离,同时排斥批次内的负样本,促使嗅觉隐空间同时受到具象视觉细节与宏观抽象语言的双向拉拽与正规化。
3. 语言引导的隐式气味解耦:分离物体固有气味与环境背景
实际采集的物理气味信号必定是目标挥发物与环境背景气味的叠加混合态。为实现可解释的细粒度表征,SCENT 利用文本描述天然的可组合性,在预训练的文本向气味表征 \(z^S_T\) 之后构建两个解耦投影子网络: $\(z^S_{\text{obj}} = \phi_{\text{obj}}(z^S_T), \qquad z^S_{\text{ctx}} = \phi_{\text{ctx}}(z^S_T)\)$ 借助阶段 1 中解离出的独立目标文本 \(t_{\text{obj}}\) 和环境文本 \(t_{\text{ctx}}\),分别计算 CLIP 文本嵌入 \(z^T_{\text{obj}}\) 与 \(z^T_{\text{ctx}}\),并构建解耦对比损失 \(\mathcal{L}_{\text{obj}}\) 与 \(\mathcal{L}_{\text{ctx}}\)。为了防止解耦子空间退化或产生表征坍塌,架构中增加了一个轻量级解码器 \(d(\cdot)\),强制将拼接后的解耦向量重构回原始物理信号,引入重构正则化损失: $\(\mathcal{L}_{\text{rec}} = \| d([z^S_{\text{obj}}; z^S_{\text{ctx}}]) - X \|^2\)$ 整体解耦目标函数为 \(\mathcal{L}_{\text{dis}} = \mathcal{L}_{\text{obj}} + \mathcal{L}_{\text{ctx}} + \lambda_{\text{rec}} \mathcal{L}_{\text{rec}}\)。这确保了分解出的表征既严格对齐对应语言概念,又完整保留传感器底层物理时序动态,支持下游任意目标气味与环境气味的自由重新合成。
损失函数 / 训练策略¶
整个系统的优化划分为两个训练阶段: - 阶段一(多模态表示学习):训练嗅觉主干编码器 \(f_S\)、双投影头 \(\phi_I, \phi_T\) 以及微调图像编码器 \(f_I\)。采用对称对比损失,针对温度系数 \(\tau\),图像-气味损失 \(\mathcal{L}_{IS}\) 与文本-气味损失 \(\mathcal{L}_{ST}\) 等权加权(\(\lambda_{IS} = \lambda_{ST} = 1.0\))。 - 阶段二(隐式解耦微调):冻结阶段一收敛的主干,优化解耦头 \(\phi_{\text{obj}}, \phi_{\text{ctx}}\) 与解码器 \(d(\cdot)\),联合最小化细粒度对比损失与重构损失,重构权重 \(\lambda_{\text{rec}}\) 作为防坍塌正则项。
实验关键数据¶
主实验¶
在真实城市场景规模最大的 New York Smells(NYS)基准上进行系统评估,涵盖 7,000 个图像-气味对(5,996 训练集 / 936 验证集),测试任务包括单模态检索(气味检索图像 S2I、气味检索文本 S2T)以及全双模态联合检索(S2IT)。baseline 为 NYS 官方论文视觉单模态对齐模型及其通过两阶段 Image Bridge(IB,即先查相似图片再由图片取文本)改造的跨模态版本。
| 模型 / 监督级别 | 文本先验组成 | S2I R@5 | S2I R@10 | S2I R@20 | S2T R@5 | S2T R@10 | S2T R@20 | S2IT R@5 | S2IT R@10 | S2IT R@20 |
|---|---|---|---|---|---|---|---|---|---|---|
| NYS 原始报告 [44] | 无文本 | 16.5 | 29.6 | 43.1 | — | — | — | — | — | — |
| NYS 复现基线 | 无文本 | 20.0 | 29.9 | 42.0 | — | — | — | — | — | — |
| NYS 适配版 (IB) | O | — | — | — | 6.2 | 10.4 | 14.4 | 15.6 | 25.8 | 39.1 |
| NYS 适配版 (IB) | O + Ctx | — | — | — | 8.7 | 12.7 | 18.3 | 15.9 | 25.2 | 38.7 |
| NYS 适配版 (IB) | O + Ctx + S | — | — | — | 8.1 | 12.9 | 19.2 | 18.5 | 27.5 | 40.7 |
| SCENT (本文) | O | 22.1 | 32.7 | 42.4 | 8.0 | 13.8 | 21.5 | 22.0 | 32.4 | 42.6 |
| SCENT (本文) | O + Ctx | 21.8 | 32.4 | 45.2 | 10.7 | 17.3 | 28.1 | 21.3 | 32.5 | 45.7 |
| SCENT (本文) | O + Ctx + S | 23.0 | 33.5 | 43.6 | 11.9 | 19.8 | 29.2 | 23.3 | 32.7 | 42.5 |
消融实验¶
为验证三流原生对齐架构的必要性、VLM 推理质量对表征的影响以及解耦表征在零样本重组下的泛化能力,论文进行了细致的消融对比。
表 1:三流架构与 Image Bridge 代理机制消融对比
| 模型配置 | 桥接协议 (IB) | S2T R@5 | S2T R@20 | S2IT R@5 | S2IT R@20 | 说明 |
|---|---|---|---|---|---|---|
| NYS 适配基线 | 是 (IB) | 8.1 | 19.2 | 18.5 | 40.7 | 通过检索最近邻图像代理获取文本 |
| SCENT 限制版 | 是 (IB) | 9.1 | 18.8 | 21.4 | 43.8 | 仅保留 IS 头,通过图像中继匹配文本 |
| SCENT 完整版 | 否 (原生三流) | 11.9 | 29.2 | 23.3 | 42.5 | 具有独立的文本投影头与原生三模态对齐 |
表 2:零样本(物体,环境)解耦重组检索实验(Recombination Retrieval)
| 查询生成方式 | R@1 | R@5 | R@10 | R@20 | 说明 |
|---|---|---|---|---|---|
| 原始信号物理拼接 (Raw Recombination) | 3.9 | 5.9 | 7.8 | 9.8 | 物理传感器 Baseline 与 Sample 简单拼接 |
| 解码重组表征 (Decoded Synthesis, 本文) | 2.0 | 9.8 | 11.8 | 13.7 | 跨样本重组 \(z^S_{\text{obj}}\) 与 \(z^S_{\text{ctx}}\) 并由解码器合成信号 |
表 3:不同标注 VLM 模型的常识推理敏感性分析
| 使用的 VLM 标注模型 | MMLU 得分 | S2I R@5 | S2I R@20 | S2T R@5 | S2T R@20 | S2IT R@5 | S2IT R@20 |
|---|---|---|---|---|---|---|---|
| Gemma 4 E4B | 69.4 | 19.6 | 43.3 | 7.7 | 19.8 | 20.2 | 44.4 |
| Qwen2.5-VL-72B | 71.2 | 20.0 | 42.1 | 8.1 | 20.5 | 19.7 | 41.9 |
| Qwen3-VL-8B | 71.6 | 19.1 | 39.9 | 6.5 | 22.0 | 20.3 | 40.0 |
| Qwen3-VL-30B (本文选用) | 77.8 | 23.0 | 43.6 | 11.9 | 29.2 | 23.3 | 42.5 |
关键发现¶
- 语言先验粒度的决定性作用:从基础物体标签(O)递进到环境上下文(Ctx)以及推测隐性气味(S),跨模态检索性能稳步爬升。尤其在 S2T 任务上,加入环境与推测气味使 R@5 从 8.0 飙升至 11.9(相对提升 48.7%),证明常识推测并非模型幻觉,而是真正填补了视觉外扩散气味的物理信息空缺。
- 第二视角裁决验证真伪:论文利用 NYS 数据集中训练阶段被严格隔离的第二相机视角(View 2)作为真实物理检验标准,由独立的 VLM 裁决模型打分。结果显示推测气味描述的上下文合理性达 98.6%,且有高达 32.2% 的推断内容精确命中了第一视角被遮挡或在视场外、但在第二视角真实存在的物理实体(如视场外的空调外机、打印纸堆),证实了语言外推具备极高物理保真度。
- 解耦空间支持零样本组合泛化:在解耦重组检索中,将不同样本的物体隐向量与环境隐向量交叉融合后生成的合成气味,在检索未见组合真实样本时 R@20 达到 13.7%,大幅超越物理原始阻值硬拼接的 9.8%,证明该表征能够有效实现气味混合物成分的语义解缠。
亮点与洞察¶
- 语言作为弱可观测物理信号的语义跳板:将 VLM 视为物理常识引擎而非单纯的图像打标器,通过让模型推理“虽然看不到但根据常识理应闻到什么”,巧妙克服了化学传感扩散与相机有限视场角之间的内在空间错配。
- 三流解耦与可逆重构双重约束:在表征学习中同步引入独立文本分支与物理重构解码器,既防止多模态对齐时出现维度塌缩,又赋予了隐向量对复杂物理混合气味进行“反混叠”(De-mixing)与受控虚拟合成的能力。
- 跨模态判别力差异的量化洞见:通过对余弦相似度曲线的分析发现,在气味检索图像任务中,图像自相似度曲线平坦(区分度弱),而嗅觉空间相似度随着排名急剧下降,揭示了机器嗅觉表征相比于纯视觉外观在精细化学指纹识别上的独特性与不可替代性。
局限与展望¶
- 硬件漂移与环境干扰瓶颈:金属氧化物半导体(MOX)等电子鼻阵列本身具有显著的时间温漂特性,且对空气湿度、环境温度极为敏感,在长期连续部署或剧烈天气变化下表征鲁棒性面临衰减。
- 嗅觉数据集与视觉数据规模的鸿沟:当前开源的真实世界全模态嗅觉数据集仅数千量级(NYS 仅约 7,000 样本),相比于预训练多模态大模型数十亿级别的图文对仍极为匮乏,制约了更大参数量端到端嗅觉基础模型的预训练。
- 改进方向:未来可探索结合连续扩散动力学方程建模气体扩散场,并将电子鼻阵列与主动具身移动机器人导航相结合,实现主动寻味溯源与全息具身环境感知。
相关工作与启发¶
- vs NYS 基准模型 [44]:NYS 采用传统的视-嗅双模态直接对齐,忽略了视场外弥散气味对传感器的污染;本文通过引入 VLM 文本常识外推与原生三流架构,在保持全模态对齐的同时显著增强了语义可解释性与检索精度。
- vs ImageBind [23] 与 LanguageBind [73]:传统多模态通用表征模型多以图像或文本为单一切割核心做硬性星状拓扑对齐;SCENT 针对高噪声非传统物理传感器信号,设计了专用双投影头与隐空间解耦重构流,更适配化学混合物信号的物理分离特性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出将 VLM 高阶物理推理作为嗅觉-视觉跨模态对齐桥梁并实现气味解耦,构思独特。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 S2I、S2T、S2IT 全面检索、双视角物理消融、VLM 敏感性与零样本重组实验,设计极其严谨。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照自洽,深入探讨了物理扩散本质与多模态表征机制。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能感知拓宽了除视听触之外的真实世界嗅觉感知新范式,具有很强的跨学科启发意义。