遇见数据集

SciXGen

收藏
arXiv2021-10-21 更新2024-07-31 收录
数据链接:
官方服务:

资源简介:

SciXGen是由日本国立先进工业科学技术研究所创建的大规模科学论文数据集,包含205,304篇论文,每篇论文均附有完整的参考文献和广泛使用的对象(如表格、图表、算法)。数据集旨在推动科学领域的上下文感知文本生成研究,通过提供全面标注的数据支持描述和段落生成。SciXGen的应用领域包括自动生成科学论文,特别是在需要完整上下文信息的文本生成任务中,如表格和图表的描述生成,以及基于引用的段落生成。

SciXGen is a large-scale scientific paper dataset developed by the National Institute of Advanced Industrial Science and Technology (AIST) of Japan. It contains 205,304 papers, each accompanied by complete reference lists and widely utilized academic elements including tables, figures, and algorithms. This dataset is designed to promote research on context-aware text generation in the scientific domain, by providing comprehensively annotated data to support description and paragraph generation tasks. Application scenarios of SciXGen cover automatic scientific paper generation, particularly text generation tasks requiring complete contextual information, such as generating descriptions for tables and figures, as well as citation-based paragraph generation.

创建时间:
2021-10-21
搜集汇总
数据集介绍
构建方式
SciXGen的构建基于arXiv Bulk Data中2012年至2020年间计算机科学领域的225,495篇LATEX格式论文,经过严格筛选最终保留205,304篇高质量文献。构建流程包括三个核心步骤:首先,采用升级版LATEX解析工具LaTeXML并辅以自定义解析器,将源文件转为XML中间格式,精准提取正文及七类学术对象(表格、图表、算法、定理等),弥补了S2ORC(LATEX)在对象保留与内容完整性上的不足。其次,通过基于BERT的引用解析模型,从2,000条人工标注样本中学习,将参考文献条目与S2ORC(full)数据库中的全文论文高效链接,实现跨论文的语境关联。最后,进行后处理优化,将表格转为线性字符串、图表统一为PNG格式、方程保留LATEX并替换自定义命令,同时过滤掉结构不完整或字数异常的论文,确保数据集的高质量与机器可读性。
特点
SciXGen的核心特点在于其完整性与语境丰富性。作为首个包含论文内所有类型对象(表格、图表、算法、定理等)完全引用的数据集,它提供了前所未有的上下文信息密度——98.76%的正文引用可追溯至参考文献条目,41.62%能链接到全文论文。与现有数据集相比,SciXGen通过双解析器策略保留了93.7%以上的图表内容和全部表格数据,远超S2ORC(LATEX)仅约50%的保留率。此外,数据集还融入了文档级表征(SPECTOR)和代码链接(Papers with Code)等增强特征,为多模态文本生成与跨论文语境建模提供了坚实的实验平台。
使用方法
SciXGen专为语境感知文本生成设计,支持两大核心任务:语境感知描述生成与语境感知段落生成。在描述生成任务中,模型输入为对象内容(如表格文本、图表图像特征)与前文语境,输出为对象描述文本;研究人员可采用排序敏感的融合解码器(OFiD)从约200句的语境中检索关键句子,平衡计算效率与生成质量。在段落生成任务中,模型以论文摘要和引用论文的全文段落为输入,生成引言段落,可通过检索增强生成器(RAG-sequence)利用多篇引用论文的语境信息减少幻觉现象。数据集已按任务划分训练/验证/测试集,并提供基于LED、BART等预训练模型的基准结果,便于研究者直接复现与扩展实验。
背景与挑战
背景概述
科学论文的自动生成是自然语言处理领域的前沿课题,其核心在于如何利用上下文信息生成忠实且连贯的文本。然而,现有数据集多基于PDF解析,难以完整保留论文结构与对象引用,限制了上下文感知生成的研究。为此,东京大学、东京工业大学与日本产业技术综合研究所的研究人员于2021年构建了SciXGen数据集。该数据集包含205,304篇计算机科学领域论文,通过改进的LaTeX解析与引用链接技术,首次完整保留了表格、算法、定理等七类对象及其全文上下文。SciXGen的提出不仅为上下文感知的文本生成任务提供了标准化测试平台,还推动了科学文本生成研究从单一输入向多源上下文融合的范式转变,在学术摘要生成、图表描述生成等细分领域具有重要影响力。
当前挑战
SciXGen数据集面临的挑战体现在两个层面。在领域问题层面,上下文感知文本生成需同时处理对象内容与外部上下文,模型需从数百句上下文中精准检索相关句子,并避免生成事实性错误(如幻觉现象)。实验表明,即使利用全部上下文,生成质量仍远逊于人工标注,揭示该任务在语义对齐与逻辑推理上的根本性困难。在构建过程层面,LaTeX解析器对非常用符号的识别存在局限,需引入辅助解析器补偿;参考文献链接面临旧论文数据偏差问题,需通过人工标注与BERT模型提升链接精度至99%。此外,表格与图片的非结构化格式转换、对象内容缺失(如S2ORC(LATEX)丢失近半表格内容)等工程挑战,进一步增加了数据构建的复杂度。
常用场景
经典使用场景
在科学文本生成领域,SciXGen数据集被广泛用于上下文感知的描述生成任务,例如为论文中的表格、图表、算法和定理自动生成描述性文本。该数据集通过提供完整的上下文信息(如正文文本),使模型能够生成更准确、更符合科学逻辑的说明文字,从而显著提升生成内容的事实正确性与可读性。
实际应用
在实际应用中,SciXGen可辅助科研人员高效撰写论文中的关键段落,例如自动生成表格说明、图表解释或算法描述,减少重复性写作劳动。此外,它还可用于开发智能论文写作助手,帮助研究者快速整合引用文献信息,生成引言或相关工作章节,从而提升学术写作的效率与质量。
衍生相关工作
基于SciXGen,研究者已衍生出多项经典工作,包括上下文感知的描述生成模型(如Ordering-sensitive Fusion-in-Decoder)和段落生成模型(如检索增强生成器RAG-sequence)。这些工作在自动评估与人工评价中均表现出色,显著降低了生成文本的幻觉率。此外,该数据集还启发了科学论文摘要生成、多文档总结以及图像-文本多模态生成等后续研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务