遇见数据集

EmbedCopilot-Bench

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

EmbedCopilot-Bench 是一个用于评估视觉语言模型能否在嵌入式设备教程中生成下一步具体指令的多模态基准数据集。该数据集旨在支持多模态程序推理、嵌入式设备辅助、教程理解以及视觉语言模型在硬件/软件工作流上的评估研究。数据集包含216个测试样本,存储为12个Parquet分片文件,每个样本包含10个字段,如唯一样本标识符、设备视图图像、摘要文本、任务查询、真实指令等。评估协议要求模型基于历史步骤、视觉上下文和任务查询生成下一步指令。数据集采用Creative Commons Attribution-NonCommercial 4.0 International许可证发布。

EmbedCopilot-Bench is a multimodal benchmark dataset designed to evaluate whether vision-language models can generate specific next-step instructions in embedded device tutorials. The dataset aims to support research in multimodal program reasoning, embedded device assistance, tutorial understanding, and the evaluation of vision-language models in hardware/software workflows. It contains 216 test samples stored as 12 Parquet shard files, with each sample comprising 10 fields, including a unique sample identifier, device view images, summary text, task queries, ground-truth instructions, etc. The evaluation protocol requires models to generate the next-step instructions based on historical steps, visual context, and task queries. The dataset is released under the Creative Commons Attribution-NonCommercial 4.0 International license.

创建时间:
2026-06-26
原始信息汇总

数据集概述:EmbedCopilot-Bench

  • 名称:EmbedCopilot-Bench
  • 许可证:CC BY-NC 4.0(仅限非商业用途)
  • 任务类别:视觉问答、图像到文本生成
  • 语言:英语
  • 标签:嵌入式系统、多模态、程序性推理、基准测试、计算机视觉
  • 数据集大小:少于1,000个样本

数据集描述

EmbedCopilot-Bench是一个多模态基准测试数据集,用于评估视觉语言模型能否根据嵌入式设备教程生成下一步的具体指令。每个样本基于连续的教程操作步骤构建:当前步骤提供视觉状态和已完成步骤的摘要,后续步骤提供任务查询和真实的下一步指令。

数据集结构

  • 划分:仅包含一个测试集,共216个测试样本。
  • 存储格式:数据以12个Parquet分片文件形式存储,路径为 data/test-*.parquet

数据字段说明

列名 类型 描述
question_id 字符串 唯一样本标识符。
device_image 图像 当前教程步骤的设备视图图像。
screenshot_image 图像或空 当前教程步骤的可选软件/屏幕视图图像。
history_summaries 字符串 目标步骤前已完成教程步骤的摘要。
task_query 字符串 用户针对目标下一步步骤的查询。
answer 字符串 真实的下一步指令。
capability 字符串 粗粒度能力标签(例如,硬件组装、软件设置)。
video_id 字符串 源教程视频标识符。
anchor_step_index 整数(int32) 源教程中的当前操作步骤索引。
target_step_index 整数(int32) 源教程中的目标下一步操作步骤索引。

评估协议

基准测试提示遵循论文中的答案生成设置:模型接收已完成步骤的历史、视觉上下文图像以及目标任务查询,然后生成完成下一步所需的即时方法或指令。随附的代码仓库提供了运行模型推理和基于评判的评估所需的脚本和笔记本。

预期用途

该数据集旨在用于多模态程序性推理、嵌入式设备辅助、教程理解以及视觉语言模型在硬件/软件工作流程上的评估研究。它被设计为一个评估基准,而非训练语料库。

ESR任务

代码仓库还包含用于可重复性研究的ESR任务材料,包括任务级别的README文件和Wokwi项目文件(在适用时)。这些文件记录了评估设置中预期的可执行行为。

仓库与代码

搜集汇总
数据集介绍
EmbedCopilot-Bench 数据集图片
构建方式
EmbedCopilot-Bench是一个面向嵌入式设备教程情境的多模态评测基准,旨在评估视觉语言模型生成下一步具体操作指令的能力。该数据集从连续的教程动作步骤中构建每个样本:当前动作步骤提供设备视角图像、可选的屏幕视角图像以及已完成步骤的历史摘要,而后续动作步骤则提供任务查询和真实下一步指令。数据集共包含216个测试样本,以12个Parquet分片形式存储在单一测试集中,确保数据加载的稳定性。每个样本包含问题标识符、设备图像、屏幕图像、历史摘要、任务查询、真实答案、能力标签、源教程视频标识符及当前与目标步骤索引等字段。
特点
该数据集具有鲜明的多模态与程序推理特征,专注于嵌入式设备操作场景中的指令生成任务。其独特之处在于要求模型在视觉输入(设备图像与屏幕图像)和文本历史摘要的背景下,理解当前进展并生成下一步具体操作方法。样本覆盖硬件组装与软件配置等粗粒度能力类别,问题设计强调对连续教程步骤的因果推理。作为纯粹的评测基准而非训练语料,数据集保证样本精炼且标注严谨,适合对模型在真实硬件与软件工作流中的实用推理能力进行深入剖析。
使用方法
使用EmbedCopilot-Bench时,需按照评测协议将已完成步骤历史、视觉上下文图像及目标任务查询作为输入,引导模型生成紧邻的下一步指令。研究者可借助官方代码仓库中的推理脚本与评估笔记本,直接加载Parquet格式的测试集并运行模型推断。评估基于裁判判断机制,将模型输出与真实答案进行对比以衡量正确性。该基准特别适用于研究多模态程序推理、嵌入式设备辅助、教程理解以及视觉语言模型在硬件/软件协作流程中的表现,为相关领域提供标准化评价平台。
背景与挑战
背景概述
嵌入式系统作为物联网与智能硬件的核心,其操作指导的自动生成对于降低用户学习成本、提升开发效率具有重要价值。在此背景下,来自X-EASys研究团队于2024年发布了EmbedCopilot-Bench基准数据集,专注于评估视觉-语言模型在嵌入式设备教程中生成下一步具体指令的能力。该数据集共包含216个精心构建的测试样本,每个样本基于连续教程动作步骤构建,综合了当前步骤的设备视图图像、历史步骤摘要以及用户查询,旨在检验模型对多模态过程推理的理解水平。EmbedCopilot-Bench作为该领域首个专注于嵌入式设备操作指导的多模态基准,为衡量视觉-语言模型在硬件与软件工作流中的实用性提供了标准化评估平台,推动了过程推理研究向实际应用场景的延伸。
当前挑战
EmbedCopilot-Bench所解决的核心领域挑战在于视觉-语言模型在嵌入式设备操作过程中的程序性推理能力不足,现有模型往往难以精准结合视觉上下文与历史操作步骤来生成合理的下一步指令。构建该数据集过程中面临多重挑战:首先,从真实教程视频中提取连续步骤并确保步骤之间逻辑连贯性极为复杂,需要人工精细标注与校验;其次,设备视图图像与软件截屏构成的多模态输入存在视角差异和内容模糊性,给标准的构建带来一致性难题;此外,样本数量有限(仅216个)使得数据集在覆盖各类硬件组装、软件配置等操作场景时面临代表性不足的约束,难以全面反映实际使用中的多样化需求。
常用场景
经典使用场景
EmbedCopilot-Bench是一个专为评估多模态大语言模型在嵌入式设备教程中生成下一步具体指令能力而设计的基准数据集。其核心任务设定为:模型需依据当前操作步骤的视觉状态(如设备图像或屏幕截图)、已完成步骤的历史摘要以及用户提出的任务查询,精准预测并生成下一个操作指令。该基准包含216个精心构建的测试样本,覆盖硬件装配与软件配置等典型能力范畴,每个样本均源自真实教程视频中的连续操作步骤。这一设计使其成为检验视觉语言模型在细粒度程序性推理任务上表现的标准测试平台。
解决学术问题
该数据集解决了视觉语言模型在程序性推理与多模态指令理解领域的评估难题。学术研究中,现有基准多侧重于静态场景理解或简单问答,难以衡量模型对分步骤、上下文依赖的操作流程的推理能力。EmbedCopilot-Bench通过引入教程步骤历史、多模态视觉上下文与任务查询的联合推理任务,填补了评估模型在嵌入式设备场景下动态决策能力的空白。它的出现推动了多模态模型从感知层面向复杂任务规划层面的能力评测,为理解模型在真实物理世界交互中的局限性提供了关键视角。
衍生相关工作
该数据集的发布衍生了一系列围绕多模态程序性推理的经典研究工作。首先,其配套的代码仓库提供了完整的评估脚本与ESR任务材料,包括可复现的Wokwi项目文件,为后续研究构建了标准化评测框架。其次,该基准激发了针对嵌入式设备教程理解的细粒度能力分析方法,促使研究者探索如何结合历史步骤摘要与视觉上下文进行更高效的指令生成。此外,围绕EmbedCopilot-Bench,学界开始关注如何将评估结果转化为模型训练的正向反馈信号,例如利用其测试样本构建小型微调数据集,从而提升模型在类似任务上的泛化性能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务