遇见数据集

de-Rodrigo/merit

收藏
Hugging Face2024-07-22 更新2024-07-22 收录
官方服务:

资源简介:

MERIT数据集是一个多模态数据集(图像+文本+布局),旨在训练和基准测试大型语言模型(LLMs)在视觉丰富文档理解(VrDU)任务上的性能。该数据集是完全标注的合成数据集,涵盖了学校成绩单的记录,适合用于令牌分类或序列生成任务。数据集包含多个配置,分别针对英语和西班牙语,每个配置都有训练、测试和验证集。

The MERIT Dataset is a multimodal dataset (image + text + layout) designed for training and benchmarking Large Language Models (LLMs) on Visually Rich Document Understanding (VrDU) tasks. It is a fully labeled synthetic dataset and covers school transcripts of records, suitable for Token Classification or Sequence Generation. The dataset includes multiple configurations for English and Spanish, each with training, testing, and validation sets.

提供机构:
de-Rodrigo
原始信息汇总

数据集概述

基本信息

  • 名称: merit
  • 别名: de-Rodrigo/merit
  • 描述: The MERIT Dataset 是一个多模态数据集(图像 + 文本 + 布局),专为在视觉丰富的文档理解(VrDU)任务上训练和基准测试大型语言模型(LLMs)而设计。这是一个完全标记的合成数据集,您可以在 GitHub 上访问生成管道。
  • 创建者: de Rodrigo
  • 许可证: MIT
  • 关键词:
    • token-classification
    • image-to-text
    • English
    • Spanish
    • mit
    • 10K - 100K
    • parquet
    • Image
    • Text
    • Datasets
    • Dask
    • Croissant
    • 🇺🇸 Region: US
    • Synthetic

数据集结构

  • 分布:
    • repo:
      • 描述: The HF Mirror git repository.
      • 内容 URL: https://hf-mirror.com/datasets/de-Rodrigo/merit/tree/refs%2Fconvert%2Fparquet
      • 编码格式: git+https
    • parquet-files-for-config-en-digital-seq:
      • 描述: The underlying Parquet files as converted by HF Mirror.
      • 包含于: repo
      • 编码格式: application/x-parquet
      • 包含: en-digital-seq//.parquet
    • parquet-files-for-config-en-render-seq:
      • 描述: The underlying Parquet files as converted by HF Mirror.
      • 包含于: repo
      • 编码格式: application/x-parquet
      • 包含: en-render-seq//.parquet
    • parquet-files-for-config-es-digital-seq:
      • 描述: The underlying Parquet files as converted by HF Mirror.
      • 包含于: repo
      • 编码格式: application/x-parquet
      • 包含: es-digital-seq//.parquet
    • parquet-files-for-config-es-render-seq:
      • 描述: The underlying Parquet files as converted by HF Mirror.
      • 包含于: repo
      • 编码格式: application/x-parquet
      • 包含: es-render-seq//.parquet

记录集

  • en-digital-seq:
    • 描述: de-Rodrigo/merit - en-digital-seq subset
    • 字段:
      • en-digital-seq/image:
        • 描述: Image column image from the HF Mirror parquet file.
        • 数据类型: sc:ImageObject
      • en-digital-seq/ground_truth:
        • 描述: Column ground_truth from the HF Mirror parquet file.
        • 数据类型: sc:Text
  • en-render-seq:
    • 描述: de-Rodrigo/merit - en-render-seq subset
    • 字段:
      • en-render-seq/image:
        • 描述: Image column image from the HF Mirror parquet file.
        • 数据类型: sc:ImageObject
      • en-render-seq/ground_truth:
        • 描述: Column ground_truth from the HF Mirror parquet file.
        • 数据类型: sc:Text
  • es-digital-seq:
    • 描述: de-Rodrigo/merit - es-digital-seq subset
    • 字段:
      • es-digital-seq/image:
        • 描述: Image column image from the HF Mirror parquet file.
        • 数据类型: sc:ImageObject
      • es-digital-seq/ground_truth:
        • 描述: Column ground_truth from the HF Mirror parquet file.
        • 数据类型: sc:Text
  • es-render-seq:
    • 描述: de-Rodrigo/merit - es-render-seq subset
    • 字段:
      • es-render-seq/image:
        • 描述: Image column image from the HF Mirror parquet file.
        • 数据类型: sc:ImageObject
      • es-render-seq/ground_truth:
        • 描述: Column ground_truth from the HF Mirror parquet file.
        • 数据类型: sc:Text
搜集汇总
数据集介绍
构建方式
在视觉富文档理解(VrDU)领域,训练多模态大语言模型(LLMs)亟需兼具复杂性与灵活性的高质量数据集。MERIT数据集正是为此而生,它采用全自动合成管线生成,该管线已开源发布。数据集以学校成绩单为特定领域,通过两种途径构建:其一为纯数字方式生成样本,其二为利用Blender对数字样本施加各类退化效果(如线条、噪点、水印、旋转、缩放等)以模拟真实世界的复杂场景。每个样本均包含图像、文本标注及布局信息,支持序列生成(seq)与令牌分类(token-class)两种任务格式,覆盖英语和西班牙语两种语言。数据集规模庞大,包含数十个配置,每个配置均划分了训练集、测试集和验证集,样本量从数千到数万不等,为模型训练提供了充足的多样性。
特点
该数据集的核心特点在于其高度的可控性与挑战性。通过模拟多达数十种不同的数字退化类型(包括线条、噪点、段落、水印、旋转及多种缩放比例),并引入Blender渲染的物理世界修改,数据集能够逼真地再现文档在扫描、拍照或传输过程中可能出现的各类瑕疵,从而极大地增强了模型的鲁棒性。此外,数据集标注了超过400种不同的标签类别,远超常规文档理解数据集,为细粒度的令牌分类任务设置了极高的基准。其多语言(英语与西班牙语)特性与双任务格式(序列生成与令牌分类)的设计,使得研究者能够灵活地探索不同模型架构与训练策略。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载该数据集。数据集提供了数十个独立的配置(config),每个配置对应一种特定的退化类型或渲染方式,用户可根据研究目标选择加载,例如加载'en-digital-seq'用于纯数字序列生成任务,或加载'es-digital-water-mark-degradation-seq'用于西班牙语水印退化场景。每个配置均包含image(图像)和ground_truth(文本标注)两个特征字段。数据集已预分为train、test、validation三个子集,可直接用于模型训练与评估。论文中提供的基准实验(如LayoutLM系列模型在令牌分类任务上的表现)可作为比较基准,三个递增难度的场景设置(数字样本、跨域测试、Blender修改样本)为评估模型泛化能力提供了清晰的框架。
背景与挑战
背景概述
在视觉富文本理解领域,合成数据集因其可控性与可扩展性正逐渐成为推动多模态大语言模型发展的关键资源。de-Rodrigo/merit数据集由Rodrigo团队于2024年创建,旨在解决学业成绩单这类结构化文档的智能解析难题。该数据集以图像、文本与布局信息的多模态形式呈现,覆盖英语与西班牙语,通过开源流水线生成包含数字渲染与Blender物理模拟的多样化样本。其核心研究问题在于评估模型在超过400种标签下的序列生成与令牌分类能力,为LayoutLM等架构提供了具有挑战性的训练基准。该数据集的出现填补了高复杂度文档理解专用资源的空白,对推动教育领域自动化信息提取技术的发展具有重要意义。
当前挑战
merit数据集面临的核心挑战首先源自其解决的领域问题:学业成绩单的结构化理解需应对版面布局多变、字符密集与语义标签细粒度高等特性,传统光学字符识别与简单分类方法在此场景下表现欠佳。其次,构建过程中需克服合成数据与真实场景间的域迁移问题,尤其是Blender物理模拟引入的光照畸变、透视扭曲与噪声干扰,使得模型需同时适应数字渲染与物理渲染两种视觉分布。此外,多语言标签体系与超过400个细分类别的设计,对模型的特征判别能力与泛化性能提出了严苛要求,如何平衡样本复杂度与训练效率亦是技术难点之一。
常用场景
经典使用场景
在视觉富文档理解(VrDU)领域,MERIT数据集的核心经典用途在于训练与评估多模态大语言模型对复杂文档图像的解析能力。该数据集以合成方式生成,涵盖了英文与西班牙语两种语言的成绩单转录本,并提供了序列生成与令牌分类两种任务配置。研究者常利用其包含的多种退化形式——如噪声、水印、旋转与缩放等——来模拟真实世界中扫描或拍摄文档时的降质情形,从而检验模型在非理想条件下的鲁棒性。凭借超过400种标签的精细标注,MERIT为从图像到结构化文本的端到端学习提供了极具挑战性的基准平台。
衍生相关工作
围绕MERIT数据集已衍生出一系列具有影响力的研究工作,其中最具代表性的是对LayoutLM系列模型的系统性评估与微调。研究者利用该数据集的令牌分类配置,在包含数字样本与经Blender修改样本的三种基准场景下,深入分析了预训练语言模型在版面理解任务中的迁移能力。这些工作不仅验证了合成数据在缩小域差距方面的潜力,还催生了针对多语言、多退化类型的文档理解专用模型架构的探索。此外,MERIT的开源生成管道亦被后续工作借鉴,用于构建其他垂直领域(如医疗记录与法律文书)的合成数据集,从而持续拓展该研究方向的边界。
数据集最近研究
最新研究方向
MERIT数据集聚焦于视觉丰富文档理解(VrDU)领域的前沿研究,特别是在多模态大语言模型(LLMs)的训练与评估方面。当前研究热点集中于利用该数据集生成的合成样本,模拟真实世界中如成绩单等文档的复杂视觉退化(如线条、噪声、水印、旋转及缩放),以提升模型在Token分类与序列生成任务上的鲁棒性。通过引入Blender渲染的多样化退化场景,该数据集为跨域泛化研究提供了严苛的基准测试,推动LLMs在文档智能处理中的实际应用,例如自动化教育记录解析与数字化档案管理。其开源生成管线与大规模多语言配置(英语、西班牙语)显著降低了数据获取门槛,助力研究者探索模型在极端退化条件下的性能边界,对推动工业级文档理解系统的演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务