EmbedCopilot-Bench
收藏资源简介:
EmbedCopilot-Bench 是一个用于评估视觉语言模型能否在嵌入式设备教程中生成下一步具体指令的多模态基准数据集。该数据集旨在支持多模态程序推理、嵌入式设备辅助、教程理解以及视觉语言模型在硬件/软件工作流上的评估研究。数据集包含216个测试样本,存储为12个Parquet分片文件,每个样本包含10个字段,如唯一样本标识符、设备视图图像、摘要文本、任务查询、真实指令等。评估协议要求模型基于历史步骤、视觉上下文和任务查询生成下一步指令。数据集采用Creative Commons Attribution-NonCommercial 4.0 International许可证发布。
EmbedCopilot-Bench is a multimodal benchmark dataset designed to evaluate whether vision-language models can generate specific next-step instructions in embedded device tutorials. The dataset aims to support research in multimodal program reasoning, embedded device assistance, tutorial understanding, and the evaluation of vision-language models in hardware/software workflows. It contains 216 test samples stored as 12 Parquet shard files, with each sample comprising 10 fields, including a unique sample identifier, device view images, summary text, task queries, ground-truth instructions, etc. The evaluation protocol requires models to generate the next-step instructions based on historical steps, visual context, and task queries. The dataset is released under the Creative Commons Attribution-NonCommercial 4.0 International license.
数据集概述:EmbedCopilot-Bench
- 名称:EmbedCopilot-Bench
- 许可证:CC BY-NC 4.0(仅限非商业用途)
- 任务类别:视觉问答、图像到文本生成
- 语言:英语
- 标签:嵌入式系统、多模态、程序性推理、基准测试、计算机视觉
- 数据集大小:少于1,000个样本
数据集描述
EmbedCopilot-Bench是一个多模态基准测试数据集,用于评估视觉语言模型能否根据嵌入式设备教程生成下一步的具体指令。每个样本基于连续的教程操作步骤构建:当前步骤提供视觉状态和已完成步骤的摘要,后续步骤提供任务查询和真实的下一步指令。
数据集结构
- 划分:仅包含一个测试集,共216个测试样本。
- 存储格式:数据以12个Parquet分片文件形式存储,路径为
data/test-*.parquet。
数据字段说明
| 列名 | 类型 | 描述 |
|---|---|---|
question_id |
字符串 | 唯一样本标识符。 |
device_image |
图像 | 当前教程步骤的设备视图图像。 |
screenshot_image |
图像或空 | 当前教程步骤的可选软件/屏幕视图图像。 |
history_summaries |
字符串 | 目标步骤前已完成教程步骤的摘要。 |
task_query |
字符串 | 用户针对目标下一步步骤的查询。 |
answer |
字符串 | 真实的下一步指令。 |
capability |
字符串 | 粗粒度能力标签(例如,硬件组装、软件设置)。 |
video_id |
字符串 | 源教程视频标识符。 |
anchor_step_index |
整数(int32) | 源教程中的当前操作步骤索引。 |
target_step_index |
整数(int32) | 源教程中的目标下一步操作步骤索引。 |
评估协议
基准测试提示遵循论文中的答案生成设置:模型接收已完成步骤的历史、视觉上下文图像以及目标任务查询,然后生成完成下一步所需的即时方法或指令。随附的代码仓库提供了运行模型推理和基于评判的评估所需的脚本和笔记本。
预期用途
该数据集旨在用于多模态程序性推理、嵌入式设备辅助、教程理解以及视觉语言模型在硬件/软件工作流程上的评估研究。它被设计为一个评估基准,而非训练语料库。
ESR任务
代码仓库还包含用于可重复性研究的ESR任务材料,包括任务级别的README文件和Wokwi项目文件(在适用时)。这些文件记录了评估设置中预期的可执行行为。
仓库与代码





