domofon/Document-XML-100k
收藏官方服务:
资源简介:
Document-XML-100k是一个用于文档标记模型微调的数据集,包含118,000对数据,将嘈杂/非结构化文本转换为语义标记的XML。它支持英语和俄语,包含已验证和高质两个拆分,确保内容保真度和XML格式良好。数据集来源于FineWeb-2、CommonCrawl和Wikipedia,通过Gemma-4-31B-it和Qwen3.5-9B模型蒸馏生成,适用于文本到XML的生成任务。
Document-XML-100k is a dataset for fine-tuning document markup models, consisting of 118,000 pairs that convert noisy/unstructured text to semantically tagged XML. It supports English and Russian, includes verified and good splits with high content fidelity and well-formed XML, and is sourced from FineWeb-2, CommonCrawl, and Wikipedia, distilled using Gemma-4-31B-it and Qwen3.5-9B models for text-to-XML generation tasks.
提供机构:
domofon搜集汇总
数据集介绍
构建方式
Document-XML-100k数据集是针对文档结构标记任务的精细调优资源,其构建源于对海量非结构化文本的语义转化。研究者首先从FineWeb-2、CommonCrawl及Wikipedia等语料库中采集原始文档,随后利用Gemma-4-31B-it与Qwen3.5-9B等大语言模型作为教师网络,通过蒸馏技术将嘈杂文本自动转换为语义标注的XML格式。整个流程依托TPU集群(v5e/v6e)高效执行,并经过严格的自动化验证流水线,包括格式合规性、内容完整性、模式一致性及HTML标签剔除检测,最终筛选出118,000对高质量文本-XML样本,确保构建的科学性与可靠性。
特点
该数据集的核心优势在于其双层级划分与极高的内容保真度。它包含“verified”与“good”两个子集,前者保证输入文本与XML文本内容间字节级精确匹配,实现零信息损失;后者虽因换行符归并等细微规范化导致内容词重叠度略低(仍不低于85%),但所有XML格式均保持良好。数据覆盖英语与俄语双语,集成554种独特模式(涵盖核心标签与自定义扩展),支持段落、表格、代码块、引用等丰富的文档结构元素。超过97%的样本内容重叠度达95%以上,训练与验证一致性无虞。
使用方法
数据集可通过HuggingFace平台的datasets库便捷加载。用户直接调用`load_dataset("domofon/Document-XML-100k")`即可获取数据,随后推荐使用`concatenate_datasets`将verified与good子集合并以最大化训练样本量,亦可仅依赖verified子集以追求零信息损失的极致质量。每条记录包含原始输入文本、目标XML输出、语言标记、模式标识符及来源数据集等字段,便于适配多样化的文档标记模型调优任务。
背景与挑战
背景概述
Document-XML-100k数据集于近期由Domofon团队基于Gemma-4-31B-it与Qwen3.5-9B等大型语言模型的知识蒸馏技术构建而成,旨在解决非结构化或噪声文本向语义化XML文档标记的自动化转换问题。该数据集包含约11.8万对精心验证的“文本-XML”配对样本,覆盖英文与俄文,依托FineWeb-2、CommonCrawl及Wikipedia等多源语料,提供了554种不同的XML模式,极大丰富了文档结构标记的多样性。其核心研究问题聚焦于如何从原始、不规范文本中提取层次化语义结构,并通过大规模高质量配对数据提升标记模型的泛化能力与内容保真度。该数据集的出现,为文档结构理解、信息抽取及自动化排版等领域提供了关键的训练资源,有力推动了结构化文档生成技术的发展。
当前挑战
数据集所应对的领域挑战主要在于非结构化文档缺乏统一的层次化标签体系,传统方法难以从噪声文本中精准识别段落、标题、列表、表格等复杂结构,且不同来源文档的格式差异巨大,模型需同时具备多语言适应性与跨模式泛化能力。在构建过程中,团队面临了多重技术难题:首先,从FineWeb-2等大规模语料中自动提取XML结构时,需保证生成XML的格式正确性、内容完整性与语义一致性;其次,通过知识蒸馏从教师模型获取伪标签时,需克服教师模型自身输出的不稳定性与模式偏差;此外,数据清洗阶段需要剔除残存HTML标签、确保字节级内容无损,并处理换行符与引号等细微噪声,最终在18.7万原始样本中仅筛选出约11.8万高保真对,验证了构建过程的严苛性与复杂性。
常用场景
经典使用场景
Document-XML-100k数据集专为文本到结构化XML标注任务设计,其核心应用场景是将杂乱无章的原始文本转化为语义明确的XML文档。研究人员利用该数据集微调大语言模型,使其能够自动识别文档中的段落、标题、列表、表格等结构元素,并生成对应的XML标签。该数据集包含118K对高质量文本-XML配对,其中验证集(verified)确保字节级内容无损,而优秀集(good)则容忍轻微的空白标准化,两者均为训练鲁棒性模型提供了坚实基础。通过在此数据集上训练,模型能够学习从非结构化文本中抽取出层次化的文档结构,从而在文档理解与生成任务中展现卓越性能。
解决学术问题
该数据集有效解决了学术研究中长期存在的文档结构自动解析难题,即如何从噪声文本中精确提取并标记语义结构。传统方法依赖规则或简单统计,难以应对多样化的文档格式和复杂嵌套结构。Document-XML-100k通过提供554种独特XML模式、跨语言(英语和俄语)以及多来源(FineWeb-2、CommonCrawl、维基百科)的数据,使研究者能够训练出泛化能力强的文档结构标注模型。这一突破推动了文本生成领域在信息提取、知识整理和文档分类等方面的进展,其意义在于为大规模文档自动化处理提供了可复现的基准,并促进了从非结构化文本向结构化知识的有效转化。
衍生相关工作
Document-XML-100k的发布催生了多项相关研究工作。首先,基于该数据集的教师模型(Gemma-4-31B-it和Qwen3.5-9B)蒸馏技术被广泛研究,推动了小模型在文档结构标注任务上的高效部署。其次,该数据集的验证集和优秀集划分激发了关于内容保真度与标准化权衡的探索,衍生出对XML结构一致性与文本重叠度的度量方法。此外,由于数据涵盖554种自定义XML模式,研究者开始关注多模式适配问题,开发了适用于不同文档类型的通用标注框架。该数据集也为跨语言文档结构迁移学习提供了基准,鼓励了在英语和俄语之外的更多语言上扩展类似数据集的尝试。
以上内容由遇见数据集搜集并总结生成



