遇见数据集

InfoEdBench

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

InfoEdBench是一个用于评估多语言信息图形文档中文本编辑能力的基准数据集,包含两个子数据集:InfoDet-Edit和Crello-Edit。InfoDet-Edit基于InfoDet信息图基准构建,包含经过过滤的测试集信息图图像子集,配有多语言翻译(从英语到法语、意大利语、德语、西班牙语),并提供OCR验证的文本区域边界框注释及编辑指令,旨在评估模型在信息密集文档(如信息图)中进行高质量文本替换的能力。Crello-Edit源自Crello图形设计模板数据集,包含英文测试集的设计模板,同样配有多语言翻译(英→法、意、德、西),并提供文本区域的边界框注释和编辑指令,侧重于评估模型在具有分层结构的图形设计中进行文本编辑的效果,其测试集包含7,026个语言对(涉及1,920个独特的源图像)。两个数据集的数据结构类似,通常包含以下字段:样本ID、源语言和目标语言标签、全局描述提示、源文本列表、目标(翻译后)文本列表、归一化的文本边界框坐标(格式为[x1, y1, x2, y2])、有效边界框的布尔掩码、原始样本索引、源图像和目标图像(或单张图像及尺寸信息)。数据集适用于图像到图像任务,特别是多语言文本编辑、图形设计修改、文档编辑和信息图生成等场景的模型评估与基准测试,注释和翻译部分采用CC BY 4.0许可证发布。

InfoEdBench is a benchmark dataset for evaluating text editing capabilities in multilingual infographic documents. It consists of two sub-datasets: InfoDet-Edit and Crello-Edit. The dataset originates from the paper Shifting the Breaking Point of Flow Matching for Multi-Instance Editing (Zaccagnino et al., ICML 2026). InfoDet-Edit is built upon the InfoDet infographic benchmark and contains a filtered subset of test set infographic images. Each sample includes multilingual translations (from English to French, Italian, German, Spanish), along with OCR-verified text region bounding box annotations and editing instructions for each language. It is designed to assess models ability to perform high-quality text replacement in information-dense documents like infographics. Crello-Edit is derived from the Crello graphic design template dataset. It includes English test set design templates, also with multilingual translations (English to French, Italian, German, Spanish), and provides bounding box annotations and editing instructions for text regions. This dataset focuses on evaluating models effectiveness in text editing within graphic designs that have hierarchical structures. The Crello-Edit test set contains 7,026 language pairs (involving 1,920 unique source images). Both datasets have similar data structures, typically including fields such as sample ID, source and target language labels, global description prompts, source text lists, target (translated) text lists, normalized text bounding box coordinates (in the format [x1, y1, x2, y2]), boolean masks for valid bounding boxes, original sample indices, source and target images (or a single image with size information). The dataset is suitable for image-to-image tasks, particularly for model evaluation and benchmarking in scenarios like multilingual text editing, graphic design modification, document editing, and infographic generation. The annotations and translations are released under the CC BY 4.0 license.

创建时间:
2026-05-29
原始信息汇总

InfoEdBench 数据集概述

InfoEdBench 是一个用于评估多语言信息性图文文档中文本编辑能力的基准测试集,包含两个子数据集:InfoDet-EditCrello-Edit。该数据集在论文 Shifting the Breaking Point of Flow Matching for Multi-Instance Editing(Zaccagnino 等人,ICML 2026)中首次提出,相关项目页面为 idattn.silviacascianelli.com

  • 许可证:数据集的标注和翻译采用 CC BY 4.0 许可。Crello-Edit 图像源自 Crello 数据集,InfoDet-Edit 图像源自 InfoDet 数据集,两者均需遵循原始许可证条款。
  • 任务类别:图像到图像(image-to-image)
  • 语言:英语、法语、意大利语、德语、西班牙语
  • 标签:图形设计、文档编辑、多语言、文本编辑、信息图、基准测试
  • 数据集规模:1K < n < 10K

子数据集详情

InfoDet-Edit
  • 来源:基于 InfoDet 信息图图像基准数据集
  • 内容:包含经过筛选的测试集信息图图像,配有由英语到法语、意大利语、德语、西班牙语的多语言翻译,以及 OCR 验证的边界框标注和每语言的编辑指令。
  • 数据配置
    • 配置名infodet-edit
    • 特征id(字符串)、file_name(字符串)、language_source(字符串)、language_target(字符串)、width(整数)、height(整数)、text_source(字符串列表)、text_target(字符串列表)、bboxes_xyxy_normalized(浮点数列表,长度4)、image(图像)
    • 分割:仅测试集,共 1,820 个样本,数据集大小约 684 MB
Crello-Edit
  • 来源:基于 Crello 图形设计模板数据集
  • 内容:包含测试集的英文设计模板,配有英语到法语、意大利语、德语、西班牙语的多语言翻译,以及文本区域的边界框标注和编辑指令。
  • 数据配置
    • 配置名crello-edit

    • 特征id(字符串)、language_source(字符串)、language_target(字符串)、global_prompt(字符串)、text_source(字符串列表)、text_target(字符串列表)、bboxes_xyxy_normalized(浮点数列表,长度4)、valid_bboxes(布尔值列表)、original_sample_index(整数)、image_source(图像)、image_target(图像)

    • 分割:仅测试集,共 7,026 个样本(1,920 张独特源图像),数据集大小约 6.57 GB

    • 归档文件结构

      crello-edit/ ├── crello_processed_json/ │ ├── en_src_test_dataset.json # 完整测试集(7,026 对) │ └── crello_test_filtered.json # 筛选子集(4,367 对) ├── renderings_english_test/ │ └── test/composite/ # 1,954 张源 PNG 图像 ├── renderings_french_test/ │ └── test/composite/ # 1,954 张法语目标 PNG 图像 ├── renderings_italian_test/ │ └── test/composite/ # 1,954 张意大利语目标 PNG 图像 ├── renderings_german_test/ │ └── test/composite/ # 1,954 张德语目标 PNG 图像 └── renderings_spanish_test/ └── test/composite/ # 1,954 张西班牙语目标 PNG 图像

    • 元数据字段(以 en_src_test_dataset.json 为例):

      • id:原始 Crello 模板 ID
      • language1:源语言(英语)
      • language2:目标语言(法语/意大利语/德语/西班牙语)
      • image_source:源图像路径(旧前缀,需使用加载器重写)
      • image_target:目标图像路径(旧前缀,需使用加载器重写)
      • global_prompt:模板的简短描述
      • text_source:源图像中文本字符串列表
      • text_target:翻译后的文本字符串列表
      • bboxes_xyxy_normalized:各文本区域的归一化边界框 [x1, y1, x2, y2]
      • valid_bboxes:标记边界框是否合法的布尔掩码
      • original_sample_index:在原始 Crello 测试集中的索引

使用方式

  • 下载:通过 Hugging Face Hub 的函数 hf_hub_download 下载 crello-edit.tar.xzinfodet-edit.tar.xz 文件,解压到本地目录。
  • 加载
    • Crello-Edit:建议使用 IDAttn 评估代码中的 CrelloDatasetFromJson 加载器,它会自动将元数据中的绝对路径重写为相对于解压目录的路径。
    • InfoDet-Edit:类似地解压后,参考 InfoDet 数据集的标注模式进行加载。
搜集汇总
数据集介绍
InfoEdBench 数据集图片
构建方式
InfoEdBench是一个专为评估信息图形文档中多语言文本编辑效果而设计的基准数据集。其构建基于两大来源:InfoDet-Edit源自InfoDet信息图形图像基准,通过筛选测试集中的信息图并配以英语至法语、意大利语、德语和西班牙语的多语言翻译,结合OCR验证的边界框标注与逐语言编辑指令而成;Crello-Edit则衍生自Crello图形设计模板数据集,选取英语设计模板并生成对应的多语言翻译版本,包含完整的边界框标注和编辑说明,覆盖了从简单到复杂的多层次图形设计场景。
使用方法
使用InfoEdBench时,首先通过HuggingFace Hub下载相应的压缩包并解压至本地目录。Crello-Edit提供了专用的CrelloDatasetFromJson加载类,能够自动处理JSON元数据中的遗留路径问题,将其重写为相对于解压根目录的正确路径。用户可以通过指定源语言与目标语言、图像目录路径等参数灵活加载数据集,每条记录包含源图像、边界框、全局提示、源文本与目标文本等关键字段,便于直接接入模型评估流程。
背景与挑战
背景概述
InfoEdBench是一个面向多语言信息型图文文档文本编辑评估的基准数据集,由Zaccagnino等研究人员于2026年在ICML论文中提出。该数据集旨在解决图文混合内容中跨语言文本替换的质量评估问题,填补了现有基准在多语言图文编辑领域的空白。它整合了基于信息图基准InfoDet的InfoDet-Edit子集和基于Crello设计模板的Crello-Edit子集,涵盖英语到法语、意大利语、德语和西班牙语的翻译编辑任务,提供了OCR验证的边界框标注和逐语言编辑指令。InfoEdBench的发布推动了生成式模型在复杂版面设计中的多实例编辑能力评估,为信息密度高、布局多变的图文编辑研究奠定了标准化的评价基础。
当前挑战
InfoEdBench面临的核心挑战在于多语言图文编辑的高精度需求,尤其是处理信息密度高、布局复杂的文档时,模型需同时理解文本语义和版面结构,确保编辑后文本的自然嵌入和视觉一致性。构建过程中,挑战包括从现有数据集中筛选高质量样本,并克服OCR标注在密集文本区域和手写字体上的不准确性;此外,跨语言翻译需保持术语一致性,且不同语言文本长度差异可能导致版面偏移,需人工校验以维持标注可靠性。数据集还面临多语言配对数据的稀缺性,以及如何设计评估指标以全面反映编辑质量(如文本保真度、视觉对齐和布局协调性)的难题。
常用场景
经典使用场景
InfoEdBench作为面向信息密集型图形文档中多语言文本编辑任务的基准评测集,广泛应用于评估生成式模型在版面约束下的文字替换与翻译性能。该数据集融合了InfoDet信息图与Crello排版设计两大来源,提供涵盖英文至法、意、德、西四种语言的配对图像与归一化边界框标注。研究者利用其精心构建的测试样本,可系统性地检验模型在保持原始视觉布局与风格一致性的前提下,准确替换指定文本区域的能力,尤其适用于多实例并行编辑场景下的模型对比与消融实验。
解决学术问题
该数据集填补了图形文档多语言文本编辑领域标准化评估缺失的空白,解决了此前难以量化模型在复杂版面中执行精准文本替换的问题。通过引入跨语言翻译对与细粒度边界框标注,InfoEdBench使得研究人员能够严格评估生成模型在信息密度高、结构层次丰富的设计文档中的编辑保真度与多语言泛化能力。其发布推动了文本编辑从单一语言向多语言的学术范式演进,为流匹配、扩散模型等前沿生成技术在可控图像编辑任务中的性能边界研究提供了关键测试基石。
实际应用
在实际产业应用中,InfoEdBench所触及的图文编辑能力可直接赋能自动化广告海报本地化、多语言社交媒体素材批量制作与品牌版式一致性维护等场景。设计平台可利用该基准训练的模型,将英文模板快速转化为符合目标语言书写习惯的成品,而无需人工逐字重新排版。此外,在数字出版与信息可视化领域,该数据集支撑的文本替换技术能够高效实现对统计图表、流程说明等复合文档的多语言版本迭代,大幅降低跨国企业的内容生产成本与交付周期。
数据集最近研究
最新研究方向
InfoEdBench聚焦于多语言信息图文档的文本编辑评估,其最新研究《Shifting the Breaking Point of Flow Matching for Multi-Instance Editing》发表于ICML 2026,提出利用流匹配(flow matching)技术突破多实例编辑的性能瓶颈。该基准涵盖Crello-Edit和InfoDet-Edit两个子集,覆盖英语至法语、意大利语、德语、西班牙语的翻译场景,并通过OCR验证的边界框标注和编辑指令,为评估高密度信息图形中的文本替换质量提供了标准化框架。这一工作呼应了多模态生成与编辑领域对细粒度、多语言控制能力的需求,例如在自动化本地化设计、文档翻译校正等热点应用中的挑战。InfoEdBench的发布不仅推动了文本编辑从单一图像向复杂版面、多语言场景的扩展,还通过公开的基准与代码,为后续研究在跨语言图形编辑的鲁棒性和泛化性评估上奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务