跳转至

ICLAgent: Integrated Circuit Footprint Geometry Labeling via LMM-empowered Multi-Agent Framework

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/IC-LMM/ICLAgent
领域: Multi-Agent / 多模态VLM
关键词: 集成电路封装, 多智能体协同, 几何参数提取, 动态规划推理, 大多模态模型

一句话总结

ICLAgent 模拟 PCB 工程师从器件手册中识别引脚封装的真实认知链条,构建了涵盖图表检测、类型规划与参数推演的四阶段多智能体协作框架,在 Qwen2-VL-7B 骨干下将 IC 封装几何标注准确率提升至 79.0% IoU。

研究背景与动机

印刷电路板(PCB)设计与电子制造流程中,工程师需要从各大半导体厂商提供的数据手册(datasheet)中解析芯片引脚的封装图表(Land Patterns / Suggested Pads),精确提取引脚总数、每个引脚的空间坐标及几何尺寸。这一过程对元器件精确定位和电气互连至关重要。然而,全球电子元器件数据库庞大(如 Digi-Key 库中收录超 1300 万种器件),工程界长期依赖工程师人工审阅 PDF 图纸并手动输入 EDA 工具,耗时费力且极易出现人为误差与几何歧义。

传统的电路设计自动化(EDA)工具缺乏对手册图纸的高级视觉理解能力;现有的通用 OCR 与目标检测技术虽然能识别文字框或统计离散引脚图元,却无法解析工程图纸中隐式隐含的几何逻辑约束(例如两排引脚的中心间距往往未直接标出,需结合外侧与内侧边界尺寸进行算术推导)。最近出现的端到端大多模态模型方案(如 LLM4-IC8K)尝试直接输入整页 PDF 并一次性预测所有引脚坐标与尺寸,但这种“黑盒”映射极易诱发模型产生幻觉与捷径学习(shortcut learning),不仅缺乏工程可解释性,在遇到高密度、多引脚的对称封装时更容易发生坐标累积偏移和引脚漏检。

本文切入的角度是:人类 PCB 工程师在解析复杂芯片图纸时绝非一步到位,而是经历“定位封装图表 → 辨识对称拓扑类型并制定提取清单 → 解析与推演隐式参数 → 脚本化批量生成精确引脚几何”的阶梯式推理链路。核心 idea:显式解耦并模拟人类 PCB 工程师的认知工作流,构建由图表检测智能体、拓扑规划智能体与动态参数推理智能体协同的多智能体系统,将黑盒端到端坐标回归转化为透明受控的参数规划与代数推导流水线。

方法详解

整体框架

ICLAgent 将数据手册中芯片封装几何标注任务划分为四个紧密耦合的阶段,前三阶段分别由微调定制的任务专属 LMM 智能体负责,第四阶段由参数驱动的 EDA 几何生成脚本执行: 1. 图表区域检测(Stage 1: Diagram Region Detection):从整页 PDF 文档图像中准确定位目标芯片引脚封装图的归一化边界框 \((x, y, dx, dy)\),滤除正文说明、尺寸表格及无关电气特性曲线的干扰; 2. 封装分类与参数规划(Stage 2: Footprint Classification & Parameter Planning):根据图元对称性将芯片封装拓扑判定为 2-sides(如 SOP/SOIC)、4-sides(如 QFP/QFN)、grid(如 BGA/LGA)或 other(如 SOT/TO)四类;随后根据该类别预置的参数清单检查图中标注情况,动态规划出包含隐式参数换算规则的提取指令; 3. 动态参数推理(Stage 3: Dynamic Parameter Reasoning):参数推理智能体解析图纸中的数字标签与几何线段对应关系,提取显式几何量,并严格依照规划指令推导原本缺失的隐式参数(如中心距、对称阵列步距); 4. 引脚描述生成(Stage 4: Description Generation):调用标准化几何生成工具函数,将结构化关键参数直接转换为每个引脚的唯一编号、几何中心坐标与长宽尺寸。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["数据手册 PDF 页面输入"] --> B["阶段 1:图表区域检测<br/>YOLOv12 初筛与 Diagram Agent 跨模态校验融合"]
    B --> C["阶段 2:封装分类与参数规划<br/>拓扑四分类 + 缺失参数推演指令生成"]
    C --> D["阶段 3:动态参数推理<br/>显式标注提取与隐式几何参数代数换算"]
    D --> E["阶段 4:引脚描述生成<br/>参数驱动的 EDA 规则脚本批量解算坐标与尺寸"]
    E --> F["输出标准化引脚标注<br/>引脚计数、坐标列表、几何尺寸"]

关键设计

1. 图表区域双路检测与跨模态融合:消除密集排版手册图文干扰

芯片技术手册单页中往往交织着电气参数表格、功能方框图、波形图及机械封装俯视图等复杂元素,直接端到端输入全页图像会使视觉骨干模型注意力涣散。图表区域检测阶段采用目标检测工具与大语言视觉模型双路交叉验证的机制:先通过基于 IC 专用标注微调的轻量目标检测器(YOLOv12)快速扫描全图,生成一系列带有置信度的候选感兴趣区域(ROI);随后 Diagram Agent 结合器件上下文字义与图像空间布局对候选框进行跨模态判断与置信度重加权,融合输出最终边界框 \((x, y, dx, dy)\)。该设计将后续推理聚焦于高分辨率裁剪视口内,从源头根除文档密集文本与多图混杂带来的视觉混淆。

2. 启发式拓扑分类与动态提取规划:以领域先验构建结构化思维链

实际工业界超过 80% 的封装均遵循高度规则的几何拓扑结构。Planning Agent 依据引脚分布规律将芯片抽象为双边对称(2-sides,占 41.3%)、四边环状(4-sides,占 31.7%)、网格阵列(grid,占 7.3%)以及非规则少量引脚(other,占 19.6%)。针对前三类规则封装,智能体调用专家知识预置的“参数清单”(Checklist),对比图中标注后动态生成形式化推演指令。例如,若图纸省略了引脚列间距,而仅标明了内边缘间距 \(D_{in}\) 和外边缘间距 \(D_{out}\),规划智能体在推理链(CoT)中显式制定派生规则:

\[D_{center} = \frac{D_{in} + D_{out}}{2}\]

这一结构化规划将繁琐的像素级目标识别转变成受限参数搜索,使下游抽取流程完全透明受控。

3. 符号-数值双向对齐与代数推导:攻克隐式几何关系补全

Parameter Agent 在接收到高分辨率图表及规划指令后,专注于将图形引出线、箭头标注与对应的浮点数值准确对齐。模型按规划指令识别显式量(如每侧引脚数、焊盘宽度 \(dx\) 与高度 \(dy\)),并在出现标注省略时执行算术换算补齐隐式参数。该机制打破了传统视觉模型面对“图中有信息但未直接写明数值”时的推理死穴。对于少量非对称且引脚数较少(< 20 针)的 "other" 类别,智能体则切换至逐引脚直接语义回归模式;而对于网格阵列封装中可能缺失的“角引脚”或中空结构,则通过行列逻辑掩码完成参数补正。

4. 规则驱动的确定性描述生成工具库:阻断大模型多 token 累积幻觉

直接让多模态大语言模型逐行输出几十甚至数百个引脚的浮点坐标列表,极易在冗长 token 序列生成中产生数值漂移、符号丢失和格式错乱。ICLAgent 遵循“大模型做高级抽象推理,确定性代码做数值展开”的工程哲学。Stage 4 根据封装类别直接调用轻量 Python 脚本生成器(Tool1/Tool2/Tool3),将 Stage 3 产出的紧凑参数元组(如行数、列数、中心距、步距、焊盘长宽)通过标准解析几何公式展开为完整的引脚阵列。该设计不仅实现了极高的计算效率,更从原理上保证了引脚几何相对位置的绝对数学自洽。

一个完整示例

以一块典型的双边 48 引脚(2-sides)SOIC 封装图纸为例: 1. Stage 1:Diagram Agent 过滤掉手册页顶部的电气特性表,精准锁定位于右下角、面积占比为 \((x=0.55, y=0.62, dx=0.40, dy=0.32)\) 的焊盘推荐图; 2. Stage 2:Planning Agent 观测到引脚对称排列于芯片左右两侧,判定类型为 2-sides。比对 2-sides 清单后发现:图中直接标出引脚数 row=2, column=24,列间步距 0.5mm,焊盘尺寸 dx=0.3mm, dy=2.3mm,但未直接标注两排焊盘的中心对称距离,而是标出了内边缘间距 4.6mm 和外边缘间距 9.2mm。Planning Agent 生成规划指示:“未标明中心行间距,需通过 \((4.6+9.2)/2\) 计算行间距参数”; 3. Stage 3:Parameter Agent 严格执行计算,输出标准化参数元组:{row: 2, column: 24, row_spacing: 6.9, column_spacing: 0.5, dx: 0.3, dy: 2.3}; 4. Stage 4:调用 Tool1,程序根据中心对称坐标系瞬间计算生成 48 个引脚的中心绝对坐标列表(如第 1 针 \([-5.7, -3.4]\),第 2 针 \([-5.2, -3.4]\),...,直至第 48 针)与长宽尺寸,格式完全对齐工业 EDA 库规范。

损失函数 / 训练策略

为支撑各智能体协同工作,作者构建了首个芯片封装推理微调数据集 ICAgent-Instruct(清洗自 ICGeo8K 的 3,737 组真实数据,划分 3,337 条训练样本和 400 条严苛测试样本)。三个智能体均以开源 Qwen2-VL-7B 为底座模型,基于监督微调(SFT)融入思维链(CoT)范式开展序列化独立微调。 - 训练损失采用标准自回归因果语言建模交叉熵损失: $\(\mathcal{L}_{SFT} = -\sum_{t=1}^{T} \log P(y_t \mid y_{<t}, X_{img}, X_{prompt})\)$ - 训练算力消耗极低:整套系统在 2 张 NVIDIA A100-40GB GPU 上仅耗时 5 小时即可完成全部智能体的微调;推理阶段单张数据手册页面端到端平均处理延迟仅为 13.5 秒。

实验关键数据

主实验

在由 400 张真实半导体手册测试集构成的 ICGeoQA 基准上,评估三项核心任务:Task 1(引脚计数误差,MAE/RMSE)、Task 2(引脚坐标偏差 \(d_{pin}\),单位 mm)与 Task 3(引脚尺寸重合度 \(IoU_{pin}\)),以及综合表征封装准确度的整体指标 \(IoU_{IC}\)。

方法 模型类型 / 规模 Overall (\(IoU_{IC}\) %) ↑ Task 1 (MAE / RMSE) ↓ Task 2 (\(d_{pin}\)) ↓ Task 3 (\(IoU_{pin}\) %) ↑
Manual EDA(工业人工基线) 人工经验设计 44.0 - / - 2.98 58.0
Claude Sonnet 4 通用闭源 LMM 10.9 ± 0.7 2.03 / 12.55 3.62 ± 0.23 12.4 ± 0.4
GPT-4o 通用闭源 LMM 11.1 ± 0.4 8.21 / 23.04 4.01 ± 0.02 45.6 ± 0.3
GPT-5 通用闭源 LMM 40.6 ± 1.1 0.59 / 4.13 4.18 ± 0.22 65.4 ± 0.1
Gemini 2.5 Pro 通用闭源 LMM 55.7 ± 0.7 0.57 / 4.78 5.58 ± 0.48 70.1 ± 0.3
Gemini 3 Pro 通用闭源 LMM 68.6 ± 0.6 0.44 / 3.46 3.56 ± 0.20 82.5 ± 0.3
Qwen3-VL-235B 开源超大规模 LMM 9.8 ± 0.2 0.46 / 3.79 5.58 ± 0.17 44.3 ± 0.2
LLM4-IC8K (前 SOTA) 任务微调专用 LMM 71.6 ± 0.5 0.35 ± 0.07 / 2.81 ± 0.08 1.11 ± 0.02 88.0 ± 0.3
ICLAgent (本文) 微调专用多智能体 (7B) 79.0 ± 0.2 0.37 ± 0.05 / 3.25 ± 0.14 1.07 ± 0.03 95.6 ± 0.2

消融实验

作者在 ICGeoQA 上对推理工作流的各个阶段进行了严谨的消融对比(表 3),探究阶段解耦的有效性:

模块配置 \(IoU_{IC}\) (%) ↑ 相比完整方案变化 说明与分析
完整阶段 (ICLAgent) 79.0 ± 0.2 基准 完整四阶段多智能体协作管线
w/o Stage 1(无图表检测定位) 72.3 ± 0.3 -6.7% (-8.5% 相对) 缺少局部裁剪,手册全局背景噪声导致下游特征混淆
w/o Stage 2(无分类与规划) 70.2 ± 0.2 -8.8% (-11.1% 相对) 缺少明确的几何先验清单与隐式公式指导,抽取容易丢失参数
w/o Stage 1 & Stage 2(仅保留 Stage 3) 68.2 ± 0.4 -10.8% (-13.7% 相对) 依赖单一智能体直接在全图上抽取所有参数,参数遗漏显著
完全端到端回归(End-to-End) 65.7 ± 0.1 -13.3% (-16.8% 相对) 模仿黑盒模式直接预测引脚坐标与尺寸,泛化性极差

针对不同芯片封装类别的细粒度表现分析(表 4)进一步揭示了不同几何形态下的能力边界:

封装类型 样本占比 (%) Stage 1 (\(IoU_{diag}\) %) Stage 2 (KPA %) Stage 3 (PC %) Overall (\(IoU_{IC}\) %) 坐标偏差 \(d_{pin}\) ↓ 尺寸重合 \(IoU_{pin}\) % ↑
2-sides (双边) 41.3 86.0 95.6 81.4 88.2 0.55 95.9
4-sides (四边) 31.7 58.8 98.3 80.4 73.2 0.38 95.6
grid (网格阵列) 7.3 97.2 97.8 89.3 84.4 0.18 98.0
other (异形/非对称) 19.6 45.7 - - 68.3 3.50 94.5

关键发现

  • 领域先验结构化分解优于单纯的模型规模扩展:参数量仅 7B 的 Qwen2-VL 在 ICLAgent 多智能体框架协同下,几何理解整体指标(79.0%)大幅碾压参数量数千亿的通用前沿大模型 GPT-5(40.6%)和 Qwen3-VL-235B(9.8%),证明对复杂工程图纸而言,契合专家认知链的任务拆解比盲目堆砌参数更为关键;
  • Stage 2 规划机制是抑制幻觉的核心:消融数据显示,剥离 Stage 2 规划后模型性能暴跌 8.8 个百分点。规划智能体给出的参数清单和推导公式,实质上为后续参数抓取提供了强制性的结构化注意力焦点;
  • 规则图形与异形封装存在性能分水岭:在 2-sides、4-sides 和 grid 三类具备强几何先验的封装中,由于生成工具保证了数学确定性,引脚尺寸重合率均稳定在 95% 以上,且 grid 封装引脚坐标误差仅为 0.18mm;而在缺乏参数分解、被迫采用直接预测的 other 类别中,坐标误差跃升至 3.50mm,\(IoU_{IC}\) 仅为 68.3%,从反面印证了解耦多智能体机制的决定性作用。

亮点与洞察

  • 将连续视觉回归重塑为离散参数推理与符号脚本执行:不再让神经网络去死记硬背数百个浮点坐标,而是让大模型负责理解手册图元与高阶代数关系,将数值外推交给确定性脚本,设计极其优雅且易于工程落地;
  • 真实工业工程视角的流程映射:不是生硬为了使用多智能体而拆分智能体,而是每一个智能体严密对应硬件工程师的现实操作步骤(查图、定型、算数、输工具),推理日志天然具备完全的工程可回溯性;
  • 轻量微调极具工业实用价值:整套管线仅需两张常规 A100 训练 5 小时,推理单页 13.5 秒,极大降低了半导体设计企业或 EDA 厂商自动化构建元器件库的技术落地门槛。

局限与展望

  • 跨阶段误差单向级联风险:当前系统采用前向串行流水线,一旦 Stage 1 图表定位发生较大偏移(如 4-sides 封装图表检测 IoU 仅 58.8%)或 Stage 2 误判了 \(dx\) 与 \(dy\) 的几何含义,下游脚本执行将发生灾难性整体错位;未来引入带环境反馈回环的 ReAct 验证机制或强化学习(RL)自省机制至关重要;
  • 异形与非对称封装覆盖依然薄弱:针对 SOT、TO 及其他不规则引脚封装,系统目前退化为直接预测,未能构建专门的拓扑基元图描述语法,导致这部分元器件准确率偏低;
  • 强依赖人工预定义的四大类先验:现存参数清单与生成脚本仍需人工专家硬编码,面对未来出现的新型三维封装或异构集成芯片,需要进一步探索自动发现几何对称性与动态合成生成工具的能力。

相关工作与启发

  • vs LLM4-IC8K: 前期工作开创了 ICGeo8K 真实芯片图纸数据集,但采用全图到坐标的端到端黑盒微调训练,遇到密集引脚和隐式标注极易出现幻觉;本文通过四阶段解耦与多智能体分工,在同等测试集上实现 10.3% 的精度跃升并提供了中间推理证据链;
  • vs 通用 EDA 辅助 Agent (如 PCBAgent, ChipGPT): 现有硬件设计智能体多数聚焦于宏观系统级布局布线、高阶 HDL 代码生成或自然语言交互,忽视了元器件微观封装几何这一基础基石;ICLAgent 补全了 EDA 自动化全生命周期中最前端、最繁琐的底层元器件数字化短板。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [首次将多智能体任务规划系统引入底层硬件芯片封装几何标注,设计极度契合硬件工程认知链]
  • 实验充分度: ⭐⭐⭐⭐⭐ [评测涵盖开源/闭源通用前沿 LMM、专用基线与工业人工实操数据,分阶段消融与分封装细粒度分析完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰,流程图与示例直观,问题背景与各阶段工程设计阐述透彻]
  • 价值: ⭐⭐⭐⭐⭐ [对自动化 PCB 元器件库构建具有重大实用落地意义,开源代码与数据集赋能电子制造上下游]