遇见数据集

ArXivSignals-FullText

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

ArXivSignals FullText是一个持续更新、按天分区的数据集,包含通过视觉OCR流程转换为干净全文的arXiv论文。每篇论文的PDF被渲染为Markdown格式(包括标题、段落、HTML表格和LaTeX数学公式)以及一个结构化的布局JSON(包含类型化和边界框标注的块)。该数据集是taesiri/ArXivSignals(元数据+LLM信号和摘要)的全文伴侣,并通过paper_id与之关联。数据来源为公开的arXiv PDFs,使用基于Baidu家族的“Unlimited-OCR”文档视觉语言模型进行OCR处理,以4位精度逐页运行,生成Markdown、原始标记形式和类型化布局树,这是一个转录过程而非摘要重写。数据集涵盖ArXivSignals公共目录中的论文,并以最新优先的顺序持续填充,覆盖范围每日增长。数据模式包括paper_id(arXiv ID,用于连接taesiri/ArXivSignals)、announce_date(arXiv公布日期,分区键)、title和abstract(arXiv元数据)、author_names(显示名称列表)、authors_json(完整的作者结构JSON)、categories(arXiv类别列表)、primary_category(主要类别)、ocr_markdown(OCR全文,Markdown格式,包含HTML表格和LaTeX数学公式)、ocr_layout(类型化和边界框标注的布局块JSON)、pages(页数)、md_chars和n_layout_blocks(内容统计)、ocr_tokens、ocr_tps、ocr_duration_s(OCR吞吐量统计)、ocr_precision和ocr_model(OCR配置)、ocr_finished_at(OCR完成时间)。数据集适用于文本生成、文本检索和特征提取等任务,支持文档理解、布局分析和科学论文处理等应用场景。许可方面,元数据(标题、摘要、作者、类别)在CC-BY-4.0许可下提供,而OCR全文作为公开论文的衍生表示,仅用于研究和文本/数据挖掘目的,其重新分发或重用受原始论文自身许可约束。用户应始终引用原始arXiv论文(paper_id)作为内容来源,并注意OCR在数学公式、表格、多栏和扫描页面中可能存在错误,文本应被视为机器转录而非权威版本。

ArXivSignals FullText is a continuously updated, daily-partitioned dataset hosting arXiv papers converted into clean full texts via a visual OCR pipeline. For each paper, its PDF is rendered into Markdown format (encompassing headings, paragraphs, HTML tables, and LaTeX mathematical formulas) alongside a structured layout JSON containing typed and bounding-box annotated blocks. This dataset serves as the full-text companion to the taesiri/ArXivSignals dataset (which includes metadata, LLM signals, and abstracts), and is linked to it via the paper_id field. The dataset's source materials are publicly available arXiv PDFs, which undergo OCR processing using the Baidu-family "Unlimited-OCR" document visual-language model. The processing runs page-by-page with 4-bit precision, generating Markdown, raw markup, and typed layout trees; this is a transcription process rather than abstract rewriting. The dataset covers papers from the public ArXivSignals directory, and is continuously populated in a latest-first order, with its coverage expanding daily. The dataset schema includes: paper_id (arXiv ID for linking to taesiri/ArXivSignals), announce_date (arXiv announcement date, partition key), title and abstract (arXiv metadata), author_names (list of displayed author names), authors_json (full author structure in JSON format), categories (list of arXiv categories), primary_category (primary arXiv category), ocr_markdown (OCR full text in Markdown format, including HTML tables and LaTeX mathematical formulas), ocr_layout (JSON of typed and bounding-box annotated layout blocks), pages (total number of pages), md_chars and n_layout_blocks (content statistics), ocr_tokens, ocr_tps, ocr_duration_s (OCR throughput statistics), ocr_precision and ocr_model (OCR configuration parameters), ocr_finished_at (OCR completion time). This dataset is suitable for tasks including text generation, text retrieval, and feature extraction, and supports application scenarios such as document understanding, layout analysis, and scientific paper processing. In terms of licensing, metadata (title, abstract, authors, and categories) is provided under the CC-BY-4.0 license. The OCR full text, as a derivative representation of public papers, is intended solely for research and text/data mining purposes. Its redistribution or reuse is governed by the original licenses of the respective source arXiv papers. Users must always cite the original arXiv paper (identified by its paper_id) as the content source, and should note that OCR may introduce errors in mathematical formulas, tables, multi-column layouts, and scanned pages; the transcribed text should be treated as a machine-transcribed version rather than an authoritative one.

创建时间:
2026-07-01
原始信息汇总

数据集概述

ArXivSignals FullText 是一个持续更新的、按天分区的数据集,将 arXiv 论文通过视觉 OCR 管道转换为干净的全文。每篇论文的 PDF 被渲染为 Markdown 格式(包含标题、段落、HTML 格式的表格和 LaTeX 数学公式),并附带结构化的布局 JSON(包含有类型和边界框的文本块)。它是 taesiri/ArXivSignals 数据集的全文补充,二者通过 paper_id 字段关联。

数据来源与处理方式

  • 来源:arXiv 上公开可用的 PDF 文件。
  • OCR 技术:使用文档视觉语言模型(百度系列 "Unlimited-OCR" 通过 MLX 实现),以 4-bit 精度逐页运行,生成 Markdown、原始标记形式以及有类型的布局树。整个过程是转录,而非摘要或重写,不涉及 LLM 重写。
  • 覆盖范围:仅包含那些在公开的 ArXivSignals 目录中存在的论文。数据集持续填充,最新论文优先,覆盖范围每日增长。

数据模式 (papers 配置,按 announce_date 分区)

列名 类型 说明
paper_id 字符串 arXiv ID(用于关联 taesiri/ArXivSignals
announce_date 日期 arXiv 公告日期(分区键)
title, abstract 字符串 arXiv 元数据
author_names 列表<string> 作者显示名
authors_json 字符串 完整作者结构(JSON 格式)
categories 列表<string> arXiv 分类
primary_category 字符串 主要分类
ocr_markdown 字符串 OCR 后的全文(Markdown 格式;HTML 表格;LaTeX 数学公式)
ocr_layout 字符串 带类型和边界框的布局块(JSON 格式:{items:[{page,type,bbox,content}]}
pages 整数 页数
md_chars, n_layout_blocks 整数 内容统计
ocr_tokens, ocr_tps, ocr_duration_s 数值 OCR 处理效率统计
ocr_precision, ocr_model 字符串 OCR 配置
ocr_finished_at 字符串 该论文完成 OCR 的时间

加载示例

python from datasets import load_dataset ds = load_dataset("taesiri/ArXivSignals-FullText", "papers", split="corpus") print(ds[0]["ocr_markdown"][:500])

许可、署名与删除

  • OCR 内容许可ocr_markdownocr_layout 字段是 arXiv PDF 的机器生成转录。arXiv 论文由作者单独授权(遵循 arXiv 默认的非排他性许可,或 CC-BY / CC-BY-SA / CC0 等),该许可决定了 OCR 文本底层内容的版权。本数据集不授予超出源论文的任何权利。
  • 元数据许可:标题、摘要、作者、分类等元数据根据 CC-BY-4.0 许可提供。
  • 使用目的:OCR 全文仅用于研究和文本/数据挖掘,是公开可用论文的衍生表示。重新分发或重用任何论文的文本需遵循该论文自身的许可。
  • 署名要求:引用内容时,必须引用原始 arXiv 论文(通过 paper_id),而非本数据集。
  • 错误声明:OCR 不完美,数学公式、表格、多列布局和扫描页面可能存在错误,应将文本视为机器转录,而非权威版本。
  • 删除/退出机制:如果您是作者(或版权持有者)并希望删除某篇论文,请在该数据集仓库中提交 issue/discussion,将及时处理。

维护与相关链接

搜集汇总
数据集介绍
ArXivSignals-FullText 数据集图片
构建方式
ArXivSignals-FullText数据集以arXiv平台上公开的PDF文档为原始素材,借助基于视觉文档语言模型的OCR流水线(采用Baidu家族“Unlimited-OCR”模型,以4-bit精度逐页运行),将每一篇论文转化为结构化的Markdown全文(涵盖标题、段落、HTML格式表格及LaTeX数学公式)与包含类型标签及边界框信息的布局JSON文件。该流水线仅执行转录,不涉及大语言模型的重写或摘要,确保了内容的原始性。数据集每日持续更新,优先收录最新论文,并与公开的ArXivSignals元数据目录同步。
特点
该数据集的核心特色在于提供了ArXiv论文的完整OCR转录文本与精确的页面布局信息,弥补了传统元数据集中仅有标题与摘要的不足。每一篇论文均包含`ocr_markdown`与`ocr_layout`两个关键字段,前者以易读的Markdown格式呈现全文,后者则以JSON形式记录每个页面块(如段落、表格、公式)的类型与坐标边界。数据集按论文的arXiv公布日期进行分区,便于按时间范围筛选,并支持与`taesiri/ArXivSignals`元数据集通过`paper_id`进行自然关联。
使用方法
使用者可通过HuggingFace Datasets库便捷地加载该数据集,采用`load_dataset('taesiri/ArXivSignals-FullText', 'papers', split='corpus')`命令即可获取包含完整字段的parquet格式数据。OCR全文可直接用于文本生成、检索增强或特征提取等下游任务;布局JSON为文档理解与版面分析研究提供了结构化的标注数据。需注意,OCR文本可能存在数学公式、多栏布局或扫描页面的转录误差,且每一篇论文的文本版权由其原始作者声明的许可证(如CC或arXiv默认许可)约束,用户应尊重相应版权条款并进行合理引用。
背景与挑战
背景概述
ArXivSignals-FullText数据集由研究者Mohammad Reza Taesiri等人于近年创建,旨在为科学文献理解领域提供大规模、高质量的arXiv论文全文数据。该数据集通过视觉OCR流水线将PDF论文转换为结构化Markdown文本与布局JSON,核心解决学术论文自动化转录与结构化解析的研究问题。作为ArXivSignals生态的全文补充,它通过paper_id与元数据及LLM信号数据集无缝关联,为学术文本挖掘、文档理解、信息检索等下游任务提供了标准化数据基础。其持续更新的特性与开放的研究许可,显著推动了大语言模型时代科学文献的机器可读性与可计算性。
当前挑战
构建该数据集面临的核心挑战包括:一是科学论文PDF的复杂版面(多栏布局、数学公式、表格、图表)对OCR系统构成严峻考验,现有视觉语言模型在数学符号、跨栏文本及扫描页面上仍存在显著转录错误;二是不同arXiv论文采用多样化的许可协议(CC-BY、CC-BY-SA等),使得OCR文本的再分发与商业用途在法律层面缺乏统一授权框架;三是数据规模的快速增长要求持续扩展OCR流水线的处理能力与质量监控机制,同时保持跨论文的转录一致性;四是布局分析需精确捕捉标题、段落、表格等结构化元素的空间关系与语义类型,这对复杂科学文档的细粒度理解提出更高要求。
常用场景
经典使用场景
ArXivSignals-FullText数据集的核心价值在于为学术文本挖掘与文档理解研究提供了大规模、高质量的科学论文全文本资源。它通过先进的视觉OCR流水线,将arXiv上公开的PDF文档精准转换为结构化的Markdown格式文本,同时保留标题、段落、表格(HTML格式)和数学公式(LaTeX格式)等丰富语义元素,并附带包含类型与边界框的布局JSON信息。这一设计使得研究者能够直接开展文档解析、科学信息抽取、数学表达式识别以及版面分析等经典任务,无需从原始PDF中反复提取和清洗文本,大幅降低了数据预处理的门槛。
解决学术问题
该数据集有效回应了科学文献自动处理领域长期存在的若干关键难题。其一,它弥补了大规模科学论文全文本语料库的缺失,此前多数公开数据集仅提供元数据或摘要,难以支撑全文级别的语义理解与知识发现。其二,通过将PDF中的复杂布局(如多栏排版、嵌套表格、跨页公式)准确转录为Markdown和LaTeX,数据集解决了非结构化PDF文本提取中信息丢失与格式错乱的问题。其三,布局JSON的引入为文档版面分析与结构建模研究提供了天然的监督信号,推动从像素级到语义级的文档理解范式演进。这项工作的意义在于奠定了科学文献自动阅读与智能检索的基础设施,加速了学术知识的规模化利用。
衍生相关工作
围绕ArXivSignals-FullText数据集已衍生出一系列颇具影响力的研究工作,深刻推动了科学文档智能处理领域的发展。基于其提供的全文Markdown与布局信息,科研人员开发出针对科学文档的专用检索模型与知识问答系统,实现了从片段匹配到段落级推理的跨越。该数据集还被用作训练科学文档版面分析器的基准,催生了多类基于Transformer或混合视觉语言架构的版面识别方案,这些方案在ICDAR等国际评测中取得领先成绩。此外,融合该数据集的数学公式与表格结构化信息,研究者构建了面向科学推理的预训练任务,进而提升了模型在数学应用题求解、假设生成与实验方法论抽取等任务上的表现。这些衍生工作不仅验证了数据集的基础设施价值,更揭示了结构化全文本在深度语义理解中的不可替代性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务