跳转至

EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/X-EASys/EmbedCopilot-Bench
领域: 多模态VLM
关键词: 视觉语言模型, 嵌入式开发, 多模态基准, 硬件感知, 执行成功率

一句话总结

提出了首个面向硬件感知嵌入式系统开发的多模态基准 EmbedCopilot-Bench,结合基于自反思的 LLM-as-a-Judge 与仿真/实机执行成功率(ESR),系统揭示了前沿 LVLM 在微控制器引脚定位与硬件物理对齐上的关键瓶颈。

研究背景与动机

大语言模型和视觉语言模型(LVLM)在通用代码辅助生成、算法答题与图表转代码等软件工程任务中取得了显著突破,催生了诸如 GitHub Copilot、Cursor 和 Claude Code 等成熟的编程助手。然而,在以嵌入式系统和物联网(IoT)为代表的物理计算开发场景中,软件编程与物理硬件高度交织。开发者不仅需要编写满足逻辑规范的代码,还必须频繁进行面包板连线、微控制器引脚(GPIO)映射、传感器元器件拓扑辨识,以及在复杂的集成开发环境(IDE)与操作系统驱动层面完成软硬件环境配置。单纯依靠文本提示词的传统代码模型无法感知开发板与外围电路的真实物理状态,在遇到连线错位或引脚定义偏差时完全无能为力。

现有视觉语言基准主要聚焦于通用图文问答、图表分析、OCR 文字定位或抽象的电子电气电路图判读,并未覆盖真实嵌入式开发中「物理硬件图像 + IDE 环境视窗 + 目标需求指令」端到端闭环的复杂工作流。开发人员在现实中往往需要向模型提供当前的开发板接线照片和软件界面截图,期望助手能够直接推断外设所连接的具体引脚,并在代码中生成完全匹配底层硬件连线的固件程序或界面操作指导。此前缺乏能够对多模态模型在硬件操作、软件配置和固件代码生成三个维度进行全面定量评估的真实基准套件。

本文的核心切入点是构建一个贴合真实开发实践的多平台多模态嵌入式基准,不仅评估模型生成建议的语义完整性,更通过软硬件在环的执行检验其物理功能有效性。核心 idea:构建源于真实视频教学并涵盖 5+ 种主流硬件平台与 27 类外设模块的多模态基准 EmbedCopilot-Bench,提出融合三次迭代自反思评分(Scoring-Refine)的 LLM 裁判与 Wokwi 仿真/实机在环执行成功率(ESR)双轨评测体系,全面诊断 LVLM 作为嵌入式智能助手的物理对齐能力与引脚定位瓶颈。

方法详解

整体框架

EmbedCopilot-Bench 的核心目标是构建从物理世界开发场景提炼真实多模态三元组、并提供兼具语义质量与物理执行确定性的端到端评测流水线。整个系统流程包含三个主要阶段:基于真实教学视频的任务切分与多模态数据标注、覆盖软硬件生命周期的基准构建,以及由迭代式裁判(CoT LLM-as-a-Judge)与执行器(Execution-based Judge)构成的混合评测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:多平台开发视频与环境捕获<br/>主流嵌入式平台 + 27 类外设传感器"] --> B["视频采集与字幕引导任务切分<br/>Whisper 转录 + GPT-5 步骤解耦"]
    B --> C["多模态问答三元组生成与多维标注<br/>硬件操作 / 软件配置 / 代码生成"]
    C --> D["迭代自反思裁判 Scoring-Refine<br/>初始评分 → 2 轮反思 → 最终协调判定"]
    D --> E["双准则执行成功率评测 ESR<br/>Wokwi 仿真器 + 实机硬件在环执行"]
    E --> F["输出:语义得分与物理执行诊断<br/>严格标准 Estr vs 宽容引脚标准 Eper"]

关键设计

1. 视频采集与字幕引导任务切分:从连续教学流中解耦阶段化子任务 真实嵌入式教学视频包含讲师边讲解、边连线、边在计算机上演示配置与调试的连续过程。直接粗暴切片无法保留动作的上下文因果关联。该设计首先在 YouTube 平台系统性检索并筛选覆盖 Arduino Uno、Arduino Nano、ESP32 系列、Raspberry Pi 系列和 STM32F401RE 等 5 种主流微处理器开发板,以及包含温湿度计(DHT11)、超声波测距(HC-SR04)、舵机(SG90/HS-311)、液晶屏与各类摇杆电位器在内的 27 种典型外设模块。使用 Whisper 对语音进行高质量转录后,调用大语言模型解析字幕流的时间依赖性,精准将连续的开发记录拆解为自包含、步骤明确的细粒度操作单元,并将历史操作汇总为前置上下文,避免孤立提问造成的上下文缺失。

2. 多模态问答三元组生成与多维标注:覆盖软硬全栈工作流 在分解出的单步子任务上,抽取对应硬件接线特写和 IDE 视窗的关键帧图像作为视觉上下文,由 GPT-5 基于转录文本生成面向目标的自然语言任务查询,并保留视频中的真实操作记录作为黄金参考答案。人工专家介入校正 Whisper 的识别错漏,补全模糊意图,并主动对图像中可能造成文本泄露的显著文字信息进行遮罩,确保模型必须真正理解视觉拓扑而非依赖 OCR 投机。所有生成的 216 个三元组被显式赋予三项正交能力标签:硬件操作(如面包板连线、引脚跳线、外设跳线与电气极性辨识)、软件配置(如驱动安装、串口端口指定、操作系统烧录与 IDE 界面下拉菜单设置)和代码生成(如驱动底层外设的 C/C++/Python 固件生成)。

3. 迭代自反思裁判 Scoring-Refine:提高开放式问答评估鲁棒性 嵌入式系统的指导输出形式高度异构,既包含低层固件代码片段,又包含复杂的 UI 路径导航指南,传统精确匹配或 n-gram 词表指标完全失效。为抑制单次判定时模型幻觉或评分漂移带来的噪声,本文提出了包含 1 次初始判定与 2 次自反思的 Scoring-Refine 迭代裁判机制(共 \(R=3\) 轮)。裁判模型 \(M\) 依据预先设立的正确性(Correctness)、视觉对齐(Grounding)与可操作性(Actionability)细则,在给定问题 \(q\)、参考基准 \(g\) 和模型生成 \(\hat{y}\) 条件下生成初始得分及理由 \((s_1, e_1)\);在后续轮次中,模型通过反思提示词 \(p_{\text{ref}}\) 结合前轮打分历史持续审视自身判断偏误,最后由聚合提示词 \(p_{\text{fin}}\) 消除矛盾,输出最终 Likert 5 分制判定: $\(s_i = \frac{r_i - 1}{4}, \quad S = \frac{1}{N} \sum_{i=1}^N s_i \times 100\%\)$ 该机制使裁判与人类专家在黄金子集上的平均绝对误差低至 0.062,且跨不同基础模型评判时保持高达 0.832~0.916 的 Spearman 排序相关性。

4. 双准则执行成功率评测 ESR:解耦物理引脚定位与代码逻辑错误 仅看代码生成的表面语义往往掩盖了实际部署时的致命软硬件不兼容。针对代码类任务,基准将相关联的步骤整合为宏任务,基于 Wokwi 网页仿真器搭建镜像硬件原理图进行固件注入,并在仿真器无法覆盖的 STM32CubeIDE 与树莓派项目中搭建真实的物理测试台,由两名嵌入式专家实施盲审硬件在环编译与运行测试。评测提出了双准则机制:严格准则(\(E_{\text{str}}\))要求代码必须完全准确命中硬件图像中实际接线的引脚编号且功能完美运行;宽容准则(\(E_{\text{per}}\))则允许引脚编号在视觉推断上出现索引偏差,只要在纠正引脚常数后整体时序、外设控制逻辑能成功运作即算通过。通过量化两者的差值: $\(\Delta_{\text{pin}} = E_{\text{per}} - E_{\text{str}}\)$ 可以直接剥离出纯代码语法逻辑与物理引脚定位之间的瓶颈落差。

实验关键数据

主实验

评测涵盖了 4 款顶尖闭源多模态模型以及 6 个开源模型系列(包含不同参数量规模),在纯文本输入(T)与携带图像多模态输入(+I)两种场景下进行了系统对比,同时报告了 5 次独立裁判的平均得分与执行测试指标。

模型 输入模态 硬件操作 (LLMhw) 软件配置 (LLMsw) 代码生成 (LLMcode) 综合得分 (LLMall) 严格执行率 (Estr) 宽容执行率 (Eper)
Claude-Sonnet-4.5 T 79.7±3.1 96.1±1.8 84.5±2.8 87.4±2.4 48.3% 82.8%
Claude-Sonnet-4.5 +I 86.5±3.2 95.3±2.2 83.6±2.5 89.6±2.3 44.8% 86.2%
GPT-5 T 74.5±3.3 95.5±2.1 77.8±3.0 83.6±2.5 17.2% 27.6%
GPT-5 +I 88.2±3.4 96.9±1.4 81.6±3.0 89.2±2.3 31.0% 58.6%
GPT-4o T 65.6±3.9 93.8±2.2 76.9±2.1 80.3±2.4 37.9% 62.1%
GPT-4o +I 84.7±3.9 93.3±2.4 81.7±2.7 87.0±2.6 48.3% 79.3%
Gemini-2.5-Pro T 71.7±2.9 92.7±2.2 79.1±2.8 82.4±2.4 31.0% 44.8%
Gemini-2.5-Pro +I 82.7±2.9 93.3±1.6 82.2±2.7 86.6±2.3 41.4% 55.2%
Mistral-Small-3-24B +I 72.2±3.4 88.2±2.4 78.5±1.3 80.8±2.2 37.9% 82.8%
InternVL3-8B +I 65.0±4.0 83.5±3.3 70.5±2.8 74.4±3.0 13.8% 31.0%
Qwen3-VL-8B +I 71.9±3.6 77.9±3.5 69.1±3.3 74.0±3.3 6.9% 24.1%
Qwen2.5-VL-7B +I 59.0±3.3 73.8±4.3 66.1±4.2 67.3±3.6 20.7% 34.5%
Qwen3-VL-4B +I 60.8±2.7 70.1±2.2 62.8±2.5 65.6±2.3 13.8% 24.1%
Gemma-3-4B +I 52.0±3.4 71.6±3.6 58.9±2.0 62.2±2.6 6.9% 17.2%
LLaVA-OneVision-7B +I 52.6±3.0 71.0±4.2 55.3±2.6 60.6±3.3 3.4% 10.3%
Qwen3-VL-2B +I 47.1±1.6 61.9±1.3 53.9±1.0 54.9±0.9 0.0% 0.0%

消融与裁判一致性分析

裁判鲁棒性实验通过对比不同商业与开源大模型裁判与主评测模型(GPT-5)在 12 个待评测模型(5,184 份生成样本)上的相关性,验证了评测指标的通用性与可复现性。

替代裁判模型 权重开源 模型级排序相关系数 (Spearman ρ) 样本级平均绝对误差 (MAE 0-1)
Qwen3-235B 是 0.909 0.145
GLM-4.7 是 0.916 0.152
DeepSeek-V3.2 是 0.832 0.206
Claude-Sonnet-4.5 否 0.909 0.195
Gemini-2.5-Pro 否 0.888 0.163
GPT-4o 否 0.916 0.108

在 172 个黄金样本的人机比对中,GPT-5 与 3 位专家打分的平均绝对误差分别为 0.058、0.048 和 0.080(总均值 0.062);12 名博士专家的盲审一致性评分均值为 4.7/5(96.1% 评分 \(\ge 4\) 分)。

关键发现

  • 视觉上下文带来显著的硬件推理收益:多模态输入能显著拉升模型的硬件操作评分,例如 GPT-4o 的 \(LLM_{\text{hw}}\) 从 65.6 跃升至 84.7,Qwen2.5-VL-7B 从 43.2 提升至 59.0;但对于参数量较小的开源模型(如 Gemma-3-4B 和 LLaVA-OneVision-7B),加入图像并未产生正向收益,反而因图文对齐不准引入噪声。
  • 语义评分与物理执行存在巨大断层:即使闭源顶尖模型在裁判体系下取得了 80+ 的代码生成高分,在实际物理执行中,严格成功率(\(E_{\text{str}}\))最高仅达到 48.3%(GPT-4o 与 Claude-Sonnet-4.5)。
  • 引脚定位是顶级模型的关键阿喀琉斯之踵:顶级模型在宽容指标 \(E_{\text{per}}\) 下能够达到 80% 以上的成功率(如 Claude-Sonnet-4.5 达 86.2%,Mistral-Small-3-24B 达 82.8%),但严格成功率腰斩近半。这表明模型已经具备编写正确设备驱动逻辑的能力,但极易在板卡丝印遮挡、微小旋转视角下看错引脚编号(如将 A1 错认为 A0),产生「差之毫厘」的近错失败(near-miss)。
  • 模型能力的阶梯式分化:头部强模型主要受制于精细引脚定位;而小规模开源模型即使在宽容指标下成功率依然低于 25%,其失败根源在于基础时序控制、库调用以及外设协议层面的逻辑崩溃。

亮点与洞察

  • 硬件在环与双准则执行度量:将网页仿真器 Wokwi 与实物 MCU 硬件台引入多模态代码评测,并拆分为严格执行率和容忍引脚错误的宽容执行率。这一设计不仅排除了纯文本评估的虚高,而且精确隔离了「物理空间几何定位」与「控制时序逻辑生成」两项正交能力的瓶颈。
  • 自反思评分流程 Scoring-Refine:通过「初评-两轮反思-最终仲裁」的三步链条显著平抑了开放式长文本评测的随机波动,经由 12 位嵌入式领域专家审核证实了其极高的评分置信度,为无标准定长答案的工程级智能体基准提供了可靠模板。
  • 板级拓扑结构化推理的启发:案例研究清晰表明,人类在看被遮挡引脚时依赖开发板排针相对顺序与固定基准点的几何计数;未来嵌入式专用多模态模型应引入电路板拓扑先验与排针局部坐标系推理,而非单纯依赖全局 OCR 识别。

局限与展望

  • 样本规模与模态粒度受限:数据集当前包含 216 个经高质量清洗的人工精选三元组,在覆盖极端罕见工业传感器协议和多板级联复杂系统时样本量仍偏保守;
  • 纯静态图像视角的局限:现实开发往往需要动态多视角观察,单帧或少帧静态图像容易遭遇跳线被自身元器件遮挡的死角,未来可探索引入短视频或带有相机主动交互的具身探测环境;
  • 模型端改进方向:需探索针对硬件电路板的高分辨率局部放大(RoI-zoom)机制,以及结合微控制器引脚引脚图(Pinout Schematic)检索增强的物理拓扑感知生成范式。

相关工作与启发

  • vs EmbedBench / IoTPilot / AutoIOT: 此类现有嵌入式代码生成工作主要基于文本输入或结构化元器件知识库生成驱动,缺乏对真实物理连线和屏幕环境界面的直接多模态感知;本文则是首个端到端考量真实连线图像、环境视窗与物理执行的基准。
  • vs MMCode / Plot2Code / PCB-bench: MMCode 和 Plot2Code 侧重于算法图解与数据可视化图表的代码转换,PCB-bench 聚焦于 EDA 布线设计;本文直击物理微控制器原型开发生命周期,打通了「实物拍照 \(\rightarrow\) 引脚推断 \(\rightarrow\) 驱动编写 \(\rightarrow\) 物理上机点灯」的完整链条。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性开创面向硬件感知嵌入式系统开发的跨模态评测基准,直击物理世界代码部署的真实痛点。
  • 实验充分度: ⭐⭐⭐⭐⭐ 兼具 10 款主流开源闭源模型横向比对、文本与多模态消融、仿真器加实物硬件在环执行,以及详实的裁判一致性审计。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,方法与评测流程叙述清晰,实验对比图表与失败案例剖析极为详实。
  • 价值: ⭐⭐⭐⭐⭐ 为推动大模型从纯软件助理向物理具身工程智能体跨越提供了极具诊断价值的基石测试平台。