Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4463
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/6044.pdf
代码: https://github.com/IC-Yuan/Circuit-MLLM
领域: 视觉语言推理(电路图理解)
关键词: 电路拓扑、潜空间视觉推理、多专家蒸馏、拓扑排序、细粒度连线识别
一句话总结¶
Circuit-MLLM 在训练时把多种视觉专家的电路知识组织成沿连接关系推进的潜向量监督,让 Qwen2.5-VL-7B 在推理时不调用这些外部专家也能追踪电路连接,在自建基准上将平均分从 48.28 提升至 76.20,但困难连接识别的完全匹配率仍只有 28.52%。
研究背景与动机¶
电路图不是普通的物体集合:认出电阻、电容和晶体管,只回答了“图上有什么”,没有回答“它们怎样连接”。连接语义往往藏在细长导线、交汇点与器件端口中,一处微小识别错误就可能改变整张网络。通用 MLLM 即使能正确分类符号,也未必能沿导线列全相连器件。论文主表中的 Qwen2.5-VL-7B 元件分类准确率达到 83.55%,连接识别完全匹配率却只有 15.20%,体现了识别与拓扑理解之间的差距。
一种路线是先用检测器或解析器生成结构化描述,再让语言模型推理;另一种是直接对图像和答案做监督微调。前者把上游漏检固化成下游输入,后者则缺少足够细的监督来告诉模型“为什么这些器件相连”。显式视觉思维链的区域裁剪也并不天然合适:矩形框适合局部目标,却可能切断跨区域导线,或者把大量无关背景一并带入。潜空间推理保留了不必解码成文字或裁剪框的中间表示,但若监督只是通用图像 patch 特征,仍可能看不清细线;若按从左上到右下的顺序组织这些特征,阅读顺序又与电气连接无关。
作者据此把问题拆成“潜向量里应当有什么”和“潜向量应当按什么顺序出现”。注意力观察提供了一个启发:模型有时会从查询器件出发,沿导线移向连接目标,而不是全图扫描。核心 idea:用多专家融合特征提供细粒度电路知识,再按查询相关的拓扑顺序排列监督目标,把看清连线与沿线推进同时压入模型的潜空间。
方法详解¶
整体框架¶
输入是一张电路图和一个问题,输出是计数、器件类别、连接判断或连接器件集合等文本答案。训练时先离线提取器件、文字、节点和导线,构造查询相关的像素级拓扑标注;再通过潜空间电路知识挖掘、拓扑引导排序和文本潜空间联合监督,学习位于前后文本之间的潜向量序列。推理时模型从图像和问题生成潜向量与答案,不再调用用于提供训练目标的 HAWP、DeepLSD 和 DINOv2。
这里的“无外部工具”指推理阶段,不代表训练数据没有使用工具。YOLO11、OCR、像素追踪和人工校验都参与了监督的生产;像素掩码和专家融合特征是教师侧信息,不应画成每次回答问题都必须执行的在线流程。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Data["训练图像与问题"] --> Expert["潜空间电路知识挖掘<br/>HAWP / DeepLSD / DINOv2"]
Data --> Annotation["离线标注与人工校验<br/>查询相关像素掩码"]
Expert --> Sequence["拓扑引导排序<br/>过滤、排序、压缩"]
Annotation --> Sequence
Sequence --> Joint["文本潜空间联合监督<br/>潜向量对齐与文本预测"]
Joint --> Model["训练后的 Circuit-MLLM"]
Query["推理图像与问题"] --> Model
Model --> Answer["潜向量推理与文本答案<br/>不调用教师专家"]
关键设计¶
1. 潜空间电路知识挖掘:让中间表示包含导线与节点,而不只是器件外观
通用视觉编码器提供了语义基础,却不一定能突出电路中的细线与交汇结构。作者引入三个互补教师:HAWP 提取整体线框和连接节点,DeepLSD 提供更细的线段结构,DINOv2 提供 patch 级语义表示。三个特征图的分辨率和通道数不同,因此先双线性插值到原模型视觉编码器决定的共同网格,再沿通道拼接、展平,通过可学习投影得到与模型潜空间维度一致的专家向量。接着把它们与原始视觉 token 拼接,经融合层得到知识增强特征池。
这一步不是把“导线检测结果”作为文字提示塞给模型,也不是让检测器在线决定最终答案。融合池中的每个位置仍是连续特征,既保留原编码器的视觉语义,又受到线框与线段先验的补充;后续潜向量学习去接近这些位置的组合。因此,专家能力通过训练损失进入模型,而不是靠推理时反复调工具实现。与直接替换视觉编码器相比,保留原始视觉 token 也保留了原模型的语义来源。不过,缓存没有给出专家是否冻结、投影层初始化及完整梯度流向,不能据此补写具体优化实现。
2. 拓扑引导排序:把二维位置变成与问题相关的连接遍历目标
有了精细特征,还必须决定哪些位置值得看,以及先看哪里。作者从多个公开数据集收集 12,000 张模拟、数字和混合信号电路图,先人工标注部分器件、文字和节点,再训练 YOLO11 扩展检测;OCR 负责文字识别及器件属性匹配,像素追踪恢复拓扑,人工专家进一步校验。最终产物包括类网表描述、视觉定位和像素区域掩码。针对一个连接问题,监督会区分查询起点器件、相关导线、相连目标器件及背景,而非给每个问题使用同一张全局关注图。
拓扑逻辑掩码把这些像素区域编码为排序信号。原文说明导线部分依据从起点计算的广度优先搜索(BFS)拓扑距离体现由近到远的原则,并用连续随机值区分相连器件。这里必须保留一个复现边界:缓存中的式 (4) 严重损坏;仍可辨认的根器件赋值、导线归一化距离和目标器件随机值,与后文升序排序如何严格实现“根器件→导线→目标器件”,不能从现有文本完全核实。因此本笔记描述作者的意图和可读步骤,不重造分段公式,也不把预期遍历顺序当成已证明的算法性质。
将像素标注映射到视觉 patch 时,作者选择自适应最大池化。若一条细导线仅占 patch 中很少像素,平均池化会稀释其信号,最大池化则尽量保留局部结构。然后去除掩码值为零的背景 patch,按照剩余 patch 的掩码值递增排列融合特征,使对齐目标脱离固定的行优先扫描。最后对这条一维序列做自适应平均池化,压缩到固定的 \(k\) 个目标潜向量。两次池化承担不同职责:空间最大池化负责保住细线,一维平均池化负责适应潜向量预算,而不是再做背景判定。
压缩之后,一个潜向量可以汇集多个相邻排序位置,不能把 \(k=4\) 理解成“只能识别 4 个器件”,也不能把每个 token 固定等同于一个独立器件。论文还观察到单个节点的多条分支可能被同时关注,因此“顺序”主要约束潜向量阶段间的演进,并不意味着每一步只能串行访问一条分支。这个设计真正额外加入的是监督序列的结构,而不只是更强的视觉特征。
3. 文本潜空间联合监督:既约束中间关注对象,也训练最终答案表达
模型的输出包含潜向量前的文本、潜向量序列和其后的文本。仅训练答案文本时,模型可能凭类别共现或语言偏好猜对训练样本,却没有学会跟踪导线;仅匹配视觉特征又不能保证它正确表达连接集合。作者因此同时优化两部分:在每个潜向量位置,把最后一层隐藏状态与对应的有序教师向量进行余弦距离对齐;在前后文本位置,执行自回归交叉熵训练,后段文本以已生成的潜向量为条件。
下面根据第 3.2 和 3.3 节的可读文字,规范化重述核心损失;缓存中的式 (7) 至 (9) 有排版损坏,这不是对损坏字符的逐字转录:
这里 \(h_m\) 是第 \(m\) 个潜向量位置的最后一层隐藏状态,\(E_m^*\) 是排序并压缩后的对应教师向量,\(\mathcal{L}_{\mathrm{text}}\) 覆盖潜向量之前和之后的文本。逐位置匹配很关键:如果只让整组潜向量与整组特征相似,交换潜向量顺序仍可能得到相近损失;按位置对齐则把教师侧的排序信息传入训练目标。但这是一种软约束,不是推理时执行 BFS 或强制满足电路规则的符号检查器。
一个完整示例¶
以“列出与指定电阻相连的器件”为例,下面是机制说明,不是论文额外报告的测试样本或测量结果。离线标注先确定电阻、从其端口延伸的导线和相连器件;三个专家分别补充线框、细线和语义特征,形成同一网格上的融合表示。查询相关掩码过滤无关背景,依照拓扑排序信号重排保留位置,再压缩成默认 \(k=4\) 个监督目标。
训练时,这些目标分别约束四个潜向量位置,使中间表示朝作者预期的起点、连接路径和目标区域演进,同时答案文本学习列出正确器件集合。推理时没有真实掩码或教师输出,模型只能依靠已学到的对应关系完成这条隐式过程。若它找对大部分连接但漏掉一个器件,F1 仍可能较高,完全匹配率 EMR 却把这个回答记为失败;这也是为什么论文中高 F1 与低 Hard EMR 可以同时出现。
损失函数 / 训练策略¶
主干为 Qwen2.5-VL-7B,采用 PyTorch,在 8 张 NVIDIA A100 上训练 15 个 epoch,batch size 为 8,初始学习率为 \(10^{-5}\),使用余弦学习率调度。默认潜向量数量为 \(k=4\),损失平衡系数取 0.6。方法节记为 \(\lambda\),实现段和消融表记为 \(\gamma\);本笔记保留这一记号不一致,不据此解释成两个独立超参数。实现段还提到“两个阶段”,但缓存没有完整展开分阶段配置。
指令微调数据为 5,000 条:连接识别占 30%,连接判断占 25%,元件分类、总数计数、分类计数各占 15%。训练图像与评测图像严格互斥,这是图像层面的隔离声明,不能直接等同于跨来源、跨模板或跨拓扑去重。Mirage 和 ILVR 使用相同潜向量数据微调,潜向量数量同为 4;SFT 与 SFT+GRPO 用于衡量不采用潜空间机制的直接训练路线。
实验关键数据¶
主实验¶
评测使用自建 Circuit-MLLM-Bench。总数计数、分类计数、元件分类和连接判断采用准确率;连接识别属于多答案任务,报告 F1 和 EMR,后者要求预测集合与真值完全一致。以下分数按原表展示在 0–100 尺度上;Avg 是所列指标列的平均分,而不是额外独立测量。缓存没有说明连接识别 F1 的具体聚合方式。
表 1 摘录论文 Table 1,保留覆盖关键路线的模型。
| 模型 | 总数 Acc. | 分类计数 Acc. | 元件分类 Acc. | 连接判断 Acc. | 连接识别 F1 | 连接识别 EMR | Avg |
|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B | 21.06 | 48.40 | 83.55 | 55.92 | 65.53 | 15.20 | 48.28 |
| Masala-CHAI-7B | 27.72 | 48.10 | 93.10 | 51.00 | 66.35 | 19.10 | 50.88 |
| GPT-5.1 | 43.60 | 60.62 | 96.49 | 61.11 | 76.08 | 30.20 | 61.35 |
| GPT-4o | 42.01 | 60.08 | 97.40 | 58.50 | 78.68 | 36.30 | 62.16 |
| GLM-4.5V-106B | 58.62 | 59.50 | 90.08 | 58.59 | 79.37 | 40.00 | 64.36 |
| Circuit-MLLM-7B | 75.87 | 65.10 | 97.40 | 72.60 | 88.90 | 57.30 | 76.20 |
相对 GPT-5.1,平均分增加 14.85 分,按表内数值计算的相对提升约为 24.21%,摘要的“25%”是近似宣传口径。相对主干增加 27.92 分,约为 57.83%。这些是本领域训练后在自建基准上的结果,不能推广成全面超越通用模型,也不能把相对百分比写成准确率百分点。
表 2 摘录论文 Table 2 的关键列。原表按相连器件数量和整图器件数量划分 Easy、Medium、Hard;这里保留的 Avg 仍来自原表全部 9 个指标列,不能用下面仅展示的 4 个任务指标重新平均。
| 方法(7B) | 判断 Medium Acc. | 判断 Hard Acc. | 识别 Hard F1 | 识别 Hard EMR | 原表 Avg |
|---|---|---|---|---|---|
| 主干,无 SFT | 51.56 | 41.52 | 61.54 | 3.78 | 45.09 |
| SFT | 63.28 | 56.68 | 80.40 | 26.12 | 67.74 |
| SFT+GRPO | 62.76 | 57.40 | 80.53 | 26.80 | 67.75 |
| Mirage | 66.15 | 64.98 | 81.88 | 26.80 | 69.82 |
| ILVR | 63.28 | 63.90 | 79.47 | 22.68 | 68.37 |
| Circuit-MLLM | 70.31 | 64.98 | 83.54 | 28.52 | 72.26 |
Circuit-MLLM 对 Mirage 的平均优势为 2.44 分,对 ILVR 为 3.89 分;困难连接判断与 Mirage 同为 64.98,并非每一项都严格更高。Hard EMR 相对 ILVR 增加 5.84 个百分点,约为 25.75%,但绝对值 28.52 仍说明多数困难样本没有被完整解析。
消融实验¶
表 3 摘录论文 Table 3。Seq 表示拓扑引导排序,Expert 表示潜空间电路知识挖掘;Avg 同样来自原表全部 9 列拓扑指标。此表基础潜空间模型的 69.85 与 Table 2 中 Mirage 的 69.82 不同,不应把它们强行视作同一行结果。
| Seq | Expert | 判断 Medium Acc. | 判断 Hard Acc. | 识别 Medium EMR | 识别 Hard EMR | 原表 Avg |
|---|---|---|---|---|---|---|
| 否 | 否 | 65.10 | 62.45 | 61.87 | 25.46 | 69.85 |
| 是 | 否 | 66.15 | 64.26 | 62.40 | 25.77 | 70.61 |
| 否 | 是 | 65.62 | 62.50 | 63.47 | 27.15 | 70.64 |
| 是 | 是 | 70.31 | 64.98 | 62.67 | 28.52 | 72.26 |
关键发现¶
- 单独排序增加 0.76 分,单独专家知识增加 0.79 分,两者合用增加 2.41 分,支持二者互补。不过完整模型的 Medium EMR 为 62.67,低于只用专家的 63.47,不能说所有子指标都单调改善。
- 论文 Table 4 中 \(k=2,4,6,8\) 的平均分依次为 74.42、76.20、74.19、75.43。更多潜向量没有稳定增益;当前数据下 4 个最优,不意味着所有复杂电路只需 4 个。
- Table 5 中 DINOv2、HAWP、DINOv2+HAWP、三专家的平均分分别为 75.16、74.95、75.23、76.20。它没有 DeepLSD 单独使用的行,不能从中独立量化 DeepLSD 的全部贡献。
- 原文 Table 5 声称使用 \(k=6\),但全专家行复用了 Table 4 中 \(k=4\) 的结果,而 Table 4 的 \(k=6\) 平均分是 74.19。此外主表连接识别 F1 为 88.90,后续表为 88.92。本笔记不擅自统一这些冲突,涉及跨表配置比较时应回核正式版本或代码。
亮点与洞察¶
- 专家的角色从在线裁判变为训练教师。 线框与细线知识不必以离散网表的形式硬传给语言模型,也能通过连续目标指导中间表示;这减少了推理流程对工具链的依赖,但没有消除教师标注误差。
- 排序也是监督的一部分。 不同模型即使对齐同一批 patch,只要顺序不同,就可能学习不同的中间推理轨迹;本文把拓扑逻辑加入目标构造,而不只增加输入信息。
- 两种池化对应两种约束。 最大池化处理稀疏细线容易丢失的问题,一维平均池化处理有限潜向量预算的问题;可迁移的是这种针对结构选择压缩方式的原则,而不是无条件照搬超参数。
局限与展望¶
- 困难拓扑距离可靠自动化仍远。 Hard 连接识别 F1 为 83.54,EMR 却只有 28.52;部分连接正确不等于整张连接集合可信。面向 EDA 使用时还需要网表一致性校验、错误定位或拒答机制。
- 数据隔离与评测覆盖仍需更多披露。 缓存声明图像级训练测试互斥,但未给出完整评测规模、来源分组和近重复拓扑排查,额外的 Amsbench 结果只有未解析的交叉引用,没有可核验表格。这限制了对跨分布泛化的判断。
- 顺序构造尚不能凭当前缓存完整复现。 式 (4) 损坏、目标器件随机值如何确保严格顺序不清晰、损失系数记号及专家消融配置不一致,均应在正式算法或代码中澄清;不能用顺畅的叙述掩盖这些缺口。
- 解释图不是因果验证。 注意力热图显示起点、导线和目标之间的关注迁移,但并不能证明模型真正执行了图遍历算法;移除关键导线、替换连接节点等干预实验会更有说服力。
- 效率与稳定性证据不足。 不调用外部教师不等于相对普通直接回答零额外开销,生成潜向量仍有成本;缓存未提供延迟、吞吐量、显存对比或多随机种子误差条。上述是笔记基于现有证据提出的审视,原文没有单列系统性的局限章节。
相关工作与启发¶
- 与 Masala-CHAI / MAPs 比较: 它们分别代表外部视觉工具辅助和先转网表再交给文本模型的路线。Circuit-MLLM 把结构知识转为训练目标,避免每次推理都依赖该中间转换;代价是潜空间输出比显式网表更难直接检查。
- 与 Mirage / ILVR 比较: 同属潜空间视觉推理,但本文增加电路专用专家和拓扑有序目标。相同数据与潜向量预算下的对比,比与未经该领域微调的通用模型对比,更能帮助判断新增机制的价值。
- 与显式视觉 CoT 比较: 区域裁剪适合检查局部证据,电路连通性却需要跨区域保持细线连续。对流程图或管线图,可考虑先获得可靠结构标注再构造有序目标;这是迁移设想,论文未验证这些领域。
- 资源边界: 代码地址来自论文摘要,本次仅依据本地全文缓存,没有联网验证仓库内容,也没有把未提供的补充实验写成已知结果。
评分¶
- 新颖性: 4/5。将电路专家蒸馏与拓扑顺序监督结合,针对性强;潜空间对齐本身承接已有方法。
- 实验充分度: 3/5。涵盖通用模型、直接微调、潜空间基线及组件消融,但外部泛化、效率和统计稳定性证据不足。
- 写作质量: 3/5。主线清晰,当前缓存却存在关键公式损坏、未解析引用和跨表配置冲突,妨碍复现。
- 价值: 4/5。为结构化视觉任务提供了可借鉴的监督构造方式,但困难连接的完全正确率尚不足以支撑无监督核验的工程使用。