遇见数据集

infly/Infinity-Doc2-5M

收藏
Hugging Face2026-06-11 更新2026-06-14 收录
官方服务:

资源简介:

Infinity-Doc2-5M 是一个大规模、高质量的文档解析训练数据集,专门用于文档解析任务。该数据集包含500万个样本,覆盖多种文档类型,如学术论文、研究报告、财务报告、报纸、教科书、考试试卷、杂志等,支持中文和英文语言以及多种布局类型(如单栏、多栏、垂直文本)。数据集提供丰富的注释,包括块级类别(标题、文本段落、表格、公式、页眉、页脚等)、文档元素定位信息、每个元素区域的识别结果(文本字符串、表格HTML、公式LaTeX、化学SMILES、图表)以及文档的整体阅读顺序。此外,数据集设计了多样化的提示词以增强生成模型的训练多样性和泛化能力。数据质量高,通过人工过滤、智能标注和数据合成相结合,并经过专家质量检查,确保准确性。部分数据从原始语料库合成,无敏感信息,符合版权规定,适用于学术和非商业用途。该数据集为文档布局分析、元素检测与识别、公式解析和文档理解等任务提供了坚实的数据基础。

Infinity-Doc2-5M is a large-scale, high-quality document parsing training dataset specifically designed for document parsing tasks. This dataset contains 5 million samples, covering diverse document types including academic papers, research reports, financial reports, newspapers, textbooks, examination papers, magazines and more, and supports both Chinese and English languages as well as various layout types such as single-column, multi-column, and vertical text. The dataset provides rich annotations, including block-level categories (headings, text paragraphs, tables, formulas, headers, footers, etc.), positioning information of document elements, recognition results for each element region (text strings, table HTML, formula LaTeX, chemical SMILES, and charts), as well as the overall reading order of the document. Additionally, the dataset incorporates diverse prompt designs to enhance the training diversity and generalization capability of generative models. It guarantees high data quality through a combination of manual filtering, intelligent annotation, and data synthesis, alongside expert quality inspections to ensure accuracy. Some of the data is synthesized from original corpora, contains no sensitive information, complies with copyright regulations, and is suitable for academic and non-commercial use. This dataset provides a solid data foundation for tasks such as document layout analysis, element detection and recognition, formula parsing, and document understanding.

提供机构:
infly
搜集汇总
数据集介绍
infly/Infinity-Doc2-5M 数据集图片
构建方式
Infinity-Doc2-5M的构建融合了人工精细标注、智能标注与数据合成三种策略。首先,通过人工标注结合专家质量审核,确保文档图像标注数据的高品质。其次,基于语料库的数据合成引擎能够自主构建文档图像与对应的标注信息,实现百分百的准确率。数据覆盖学术论文、研究报告、财务报表、报纸、教科书、试卷、杂志等多种文档类型,并支持中英文及中英混合文本,以及单栏、多栏、竖排文字等多种复杂版式,充分体现了真实文档的多样性与复杂性。
特点
该数据集蕴含五百万样本,具备丰富的标注层次,包含从块级到页面级的标注,详细划分了标题、文本段落、表格、公式、页眉、页脚等文档结构元素。不仅提供元素检测框,还涵盖文本字符串、表格HTML、公式LaTeX、化学SMILES、图表等元素内容,以及文档整体阅读顺序。针对不同任务与场景设计的多样化提示,显著增强了生成式文档解析模型训练的多样性与泛化能力,数据质量经过严格把控,无敏感信息并完全符合版权规范。
使用方法
数据以压缩包或分片压缩包形式存储,用户需根据目录结构进行解压。对于单一tar.gz文件,直接使用tar -zxvf解压;对于分片文件(format part-xxxx-of-yyyy-images_labels),需按索引排序后通过cat命令拼接再解压。解压后的每个子任务目录包含images与labels两个文件夹,其中images存储图片,labels存储JSONL格式的标注文件。标注文件中的conversations字段记录人机对话训练样本,objects字段(可选)提供布局定位信息,attributes字段标注任务与子任务名称,便于用户按需进行模型训练与微调。
背景与挑战
背景概述
Infinity-Doc2-5M是由Infly AI团队于近期构建的大规模文档解析数据集,旨在应对多语言、多版式真实文档的结构化理解难题。该数据集包含超过500万页样本,涵盖学术论文、教科书、财务报告、报纸、杂志等丰富类型,支持中英文及中英混合文本,并覆盖单栏、多栏及竖排等复杂布局。其核心研究问题在于如何通过细粒度标注(如标题、段落、表格、公式、页眉页脚等区块类别与内容)和多样化提示设计,提升生成式文档解析模型的泛化能力与准确性。该数据集为文档布局分析、元素检测与识别、公式解析及文档理解等任务提供了坚实的数据基础,有望推动文档智能处理领域在多语言与多场景下的研究与应用进展。
当前挑战
该数据集所解决的领域问题挑战在于真实文档的多样性与复杂性:不同语言、版式及元素(如表格、公式、图表)的混合排列要求模型具备高鲁棒性的结构化理解能力,传统方法难以统一处理。构建过程中面临的挑战包括:高质量标注数据的获取成本极高,需要结合人工标注、智能标注与数据合成;为保证100%的标注准确率,设计了专家质检流程;同时需避免敏感信息并严格遵循版权合规,部分数据需从原始语料合成,这增加了数据生成的复杂度;此外,为提升模型泛化性,还需构建多样化的提示模板,避免训练数据中的提示单一化问题。
常用场景
经典使用场景
Infinity-Doc2-5M数据集专为文档解析任务设计,其经典使用场景聚焦于训练多模态大模型完成从文档图像到结构化信息的端到端转换。研究人员利用该数据集训练模型同时执行版面布局分析、文档元素检测与识别(如标题、段落、表格、公式)、光学字符识别(OCR)以及阅读顺序重建等子任务。凭借其五百万高质量样本覆盖学术论文、教材、试卷、财务报告等多种文档类型,并支持中英文及混合排版,该数据集成为提升模型在复杂文档场景下鲁棒性和泛化能力的基石,尤其适用于需要精确理解文档结构与语义的场合。
实际应用
在实际应用中,该数据集训练出的模型可深度赋能多种文档密集型行业。在企业场景中,可实现财务报告、合同发票的自动录入与结构化归档,大幅提升办公效率;在教育领域,能支撑教材、试卷的智能化解析,助力在线教育平台构建知识图谱和习题库;在图书馆与档案管理方面,可对历史文献、报纸杂志进行数字化重建与索引。此外,数据集对表格和公式的精细标注,为研究自动生成LaTeX公式或HTML表格提供训练素材,这直接推动了学术出版、科研数据提取和知识库构建等实际应用的落地。
衍生相关工作
围绕Infinity-Doc2-5M数据集,衍生了若干具有影响力的相关工作。最直接的成果是配套发布的Infinity-Parser2-Pro与Infinity-Parser2-Flash系列模型,前者提供高精度文档解析能力,后者则侧重轻量化与快速推理。这些模型通过该数据集训练,在版面分析、公式识别和表格重建等任务上取得了优异性能。此外,该数据集的构建方法论——结合人工标注与基于语料合成的数据引擎——为后续数据生成工作提供了参考范式。研究人员还借鉴其细粒度标注格式(如doc2json任务),推动形成统一的文档结构化表示标准,促进了不同模型间的可比较性与可复现性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务