IKEA-Bench
收藏资源简介:
IKEA-Bench是由阿尔托大学团队构建的跨描述对齐基准数据集,包含29款宜家家具产品的1623个评测问题,涵盖步骤识别、验证等6类任务。数据源自IKEA Manuals at Work数据集,通过视频帧与示意图的时间对齐标注构建,涉及2569个视频帧和132个结构化文本描述。该数据集专为评估视觉语言模型在抽象示意图与真实视频间的对齐能力而设计,旨在解决智能装配指导系统中的核心挑战——跨描述鸿沟问题。
IKEA-Bench is a cross-description alignment benchmark dataset constructed by the team at Aalto University. It contains 1623 evaluation questions across 6 task types including step recognition and verification, covering 29 IKEA furniture products. Derived from the IKEA Manuals at Work dataset, this benchmark is built via temporal alignment annotation between video frames and schematic diagrams, involving 2569 video frames and 132 structured text descriptions. Specifically designed to evaluate the alignment capabilities of vision-language models between abstract schematic diagrams and real-world videos, this dataset aims to address the core challenge of cross-description gap in intelligent assembly guidance systems.
IKEA-Bench 数据集概述
基本信息
- 数据集名称:IKEA-Bench
- 发布日期:2026年(arXiv预印本)
- 研究机构:Aalto University
- 作者:Zhuchenyang Liu · Yao Zhang · Yu Xiao
- 论文地址:https://arxiv.org/abs/2604.00913
- GitHub仓库:https://github.com/Ryenhails/IKEA-Bench
- HuggingFace数据集地址:https://huggingface.co/datasets/Ryenhails/IKEA-Bench
- 许可证:CC-BY-4.0
研究目标
- 系统评估视觉-语言模型在跨描绘对齐能力上的表现,即理解无文字组装示意图并将其与真实世界视频进行匹配的能力。
- 核心挑战是弥合**示意图(线条图)与真实视频(照片级真实感)**之间的描绘差距。
- 涵盖29种家具产品。
基准测试结构
- 基准问题数量:1,623个
- 评估的视觉-语言模型数量:19个
- 任务类型数量:6种
- 对齐策略数量:3种
任务详情
| 代码 | 任务名称 | 描述 | 类型 | 问题数量(N) |
|---|---|---|---|---|
| T1 | Step Recognition | 哪个示意图与视频中的动作匹配? | 4项选择题 | 320 |
| T2 | Action Verification | 这个视频是否匹配这个示意图? | 二分类 | 350 |
| T3 | Progress Tracking | 当前动作对应于完整序列中的哪一步? | 4项选择题 | 334 |
| T4 | Next-Step Prediction | 当前视频动作之后应该是哪个示意图? | 4项选择题 | 204 |
| D1 | Video Discrimination | 两个视频片段是否显示相同的组装步骤? | 二分类 | 350 |
| D2 | Instruction Comprehension | 三个打乱顺序的示意图的正确顺序是什么? | 4项选择题 | 65 |
主要结果(视觉基线设置下的准确率%)
- 最佳模型(Gemini-3-Flash)平均准确率为65.9%,远低于人类在这些任务上的表现。
- 完整排行榜见数据集详情页。
关键发现
- 示意图盲区:所有17个开源模型在仅使用视觉输入时,在D2任务上的表现比仅使用文本输入时更差,表明它们难以“阅读”训练过的示意图。
- 文本的双重作用:添加文本描述提升了对示意图的理解(D2任务提升24个百分点),但损害了跨模态对齐能力(T1任务下降6个百分点)。文本成为捷径,模型依赖文本匹配而减少对视觉内容的关注。
- 架构优于规模:在跨描绘任务上,Qwen3.5-9B(9B参数)的表现优于InternVL3.5-38B(38B参数)和Gemma3-27B(27B参数)。对于示意图理解,模型家族比参数数量更重要。
机制分析
通过三个处理阶段探究模型失败的原因:
- 表示层:示意图和视频在ViT层面的表示相似度中等(0.43–0.58),在视觉融合器后进一步下降,证实了表示差距。
- 隐藏状态层:当添加文本描述时,示意图对LLM预测的影响下降59%,而文本影响增加24%。模型从视觉推理转向文本介导的推理。
- 注意力层:当添加文本时,对示意图标记的每标记注意力下降52%,而文本标记吸收了释放的注意力。模型学会完全绕过示意图处理。
- 瓶颈识别:视觉编码器是瓶颈,即使在模态内表现良好的情况下,跨模态检索(示意图→视频)仍然失败,表明ViT无法创建对齐的跨描绘表示。
快速开始
-
克隆并安装 bash git clone https://github.com/Ryenhails/IKEA-Bench.git cd IKEA-Bench && pip install -r requirements.txt
-
下载数据(约300MB,从HuggingFace获取) bash python setup_data.py
-
评估模型 bash python -m ikea_bench.eval --model qwen3-vl-8b --setting baseline --input data/qa_benchmark.json --data-dir data --output results/qwen3-vl-8b_baseline.json
引用格式
bibtex @article{liu2026ikeabench, title={Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignment}, author={Liu, Zhuchenyang and Zhang, Yao and Xiao, Yu}, journal={arXiv preprint arXiv:2604.00913}, year={2026} }




