遇见数据集

docclass-merged

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Docclass Merged Corpus 是一个用于文档分类的文本分类数据集,包含 700 份法律文档,共三种类型:合同(contract)、合并协议(merger_agreement)和公司记录(corporate_record)。数据集来源于 CUAD v1(509 份合同)、MAUD v1(152 份合并协议)和 SEC EDGAR 公开文件(39 份 S-1 公司记录)。每行数据以 JSON 对象形式存储,包含文件名(filename)、文档全文(doc_text)、提示(prompt)、真实标签(expected)、二级标签(expected_subclass)、分割(split)以及元数据(metadata)。二级标签分别为合同子类(28 组)、MAUD 考虑类型和 S-1 记录子类。数据集采用确定性分割,约 10% 作为测试集(基于 md5(filename) mod 10 == 0),其余为训练集。该数据集适用于法律文档分类任务,可用于评估和训练文档分类模型。

Docclass Merged Corpus is a text classification dataset for document classification, containing 700 legal documents of three types: contract, merger_agreement, and corporate_record. The dataset is sourced from CUAD v1 (509 contracts), MAUD v1 (152 merger agreements), and SEC EDGAR public filings (39 S-1 corporate records). Each row is stored as a JSON object, including filename, doc_text, prompt, expected label, expected_subclass, split, and metadata. The subclasses include contract subclasses (28 groups), MAUD consideration types, and S-1 record subclasses. The dataset uses a deterministic split, with approximately 10% as the test set (based on md5(filename) mod 10 == 0) and the rest as the training set. It is suitable for legal document classification tasks and can be used for evaluating and training document classification models.

创建时间:
2026-08-22
原始信息汇总

数据集概述

Docclass Merged Corpus 是一个用于文本分类的英文法律文档数据集,包含 700 份法律文档,每行对应一份文档,采用扁平化的文档分类结构。

数据构成

数据集整合了三个来源的语料:

来源 文档数量 类别标签 原始出处
CUAD 合同 509 contract CUAD v1(CC BY 4.0)
MAUD 并购协议 152 merger_agreement MAUD v1(CC BY 4.0)
S-1 公司记录附件 39 corporate_record SEC EDGAR 公开文件

数据格式

每行数据为一个 JSON 对象,包含以下字段:

  • filename:源文件名(如 CUAD PDF 文件名或 MAUD/S-1 文件名)
  • doc_text:完整的文档文本
  • prompt:提示词
  • expected:一级类别标签(即文档类型)
  • expected_subclass:二级子类别标签(每行均有值,例如合同分组、MAUD 对价类型、S-1 记录子类)
  • split:数据划分标记,通过 md5(filename) mod 10 == 0 判定为测试集(约 10%),该规则确定且与顺序无关,可复现
  • metadata:各语料的来源元数据

数据集采用确定性排序(先按语料,再按文件名),重建时字节一致,数据集指纹为 cd652e77103556ac…

划分规则

  • 使用基于文件名的哈希函数确定训练集与测试集划分,约 10% 作为测试集。
  • 划分规则不强制按类别分层,但在当前规模下类别分布保持稳定。

来源与构建

数据集由 llm-entity-extraction 项目的 scripts/datasets/build_docclass_merged.py 脚本构建。CUAD 部分来自 Braintrust 镜像导出,MAUD 部分来自 Zenodo v1 语料库,S-1 附件部分直接从 SEC EDGAR 公开文件中提取。

许可

数据集采用 CC BY 4.0 许可协议,适用于文本分类任务,标签为英文。

搜集汇总
数据集介绍
docclass-merged 数据集图片
构建方式
Docclass Merged Corpus 是一个精心构建的文档分类数据集,旨在为法律文本分类任务提供一个统一且平坦的评估面。该数据集汇集了三个不同来源的语料库,共计700份法律文件,每份文件对应一行数据。具体而言,CUAD合同语料库贡献了509份合同文件,MAUD合并协议语料库提供了152份合并协议,而S-1公司记录附件则包含39份公司记录,这些文件均来源于SEC EDGAR的公开披露。数据集的构建遵循确定性流程,每一行包含文件名、完整文档文本、提示词、预期文档类型及子类标签,并基于文件名的MD5哈希值进行确定性划分,确保约10%的数据作为测试集。构建脚本由llm-entity-extraction项目提供,保证了数据来源的可追溯性和重建的稳定性。
特点
该数据集的核心特点在于其统一且丰富的标注体系。每个样本均包含三级标签:doc_type(文档类型)、expected_subclass(二级子类)以及基于哈希的确定性分割标签。这种设计使得数据集不仅适用于基础的文档分类任务,还能支持更细粒度的子类识别。此外,所有标签列均确保非空,避免了因缺失值导致的兼容性问题。数据集的构建过程严格遵循确定性排序和复制,确保了重建结果的字节级一致性,为可重复的科学实验提供了坚实基础。其来源多样性(涵盖合同、合并协议和公司记录)也增强了模型的泛化能力。
使用方法
使用该数据集时,用户可直接加载JSON格式的数据,每行对应一个独立样本。推荐使用预设的train/test划分,该划分基于文件名的MD5哈希值确定,稳定且可复现,便于进行模型评估和对比。由于数据集提供了完整的文档文本和提示词,研究者可以灵活地应用于文档分类、信息抽取或生成式任务,例如基于提示的零样本或少样本学习。此外,metadata字段提供了原始来源信息,便于进行溯源分析和数据过滤。用户可通过HuggingFace Hub轻松获取数据,并利用标准的数据加载工具进行预处理和训练。
背景与挑战
背景概述
Docclass Merged Corpus于2026年由Exios66团队构建,旨在统一法律文档分类的评估基准。该数据集整合了三个权威来源:CUAD合同语料(509份)、MAUD合并协议(152份)及SEC EDGAR的S-1公司记录(39份),总计700份法律文档。其核心研究问题是为大型语言模型(LLM)在法律文件处理中的文档类型识别提供一个扁平、可复现的分类表面,特别是针对“合同”、“合并协议”和“公司记录”三类。该数据集通过确定性哈希分割(约10%测试集)确保评估的稳定性和可重复性,对法律AI领域具有重要影响力,为模型在法律文档分类上的性能比较提供了标准化基准。
当前挑战
该数据集面对的挑战主要体现在领域问题和构建过程两方面。领域问题方面,法律文档分类需处理高度专业化和结构多样的文本,如合并协议的复杂条款、公司记录的标准化格式,同时需区分细微差别的文档类型,这对模型的语义理解能力提出高要求。构建过程中,挑战包括整合不同来源的语料(CUAD、MAUD、SEC EDGAR),确保数据格式统一和标签一致性;处理部分数据源(如S-1)的实时采集与解析;以及解决模式匹配问题,如处理空值标签以避免数据查看器转换错误。此外,设计稳定的哈希分割策略需在不强制分层的情况下保持类别平衡,确保评估的公平性和可复现性。
常用场景
经典使用场景
Docclass Merged Corpus 作为法律文本分类领域的综合性基准数据集,其经典使用场景聚焦于多源异构法律文档的自动归类。该数据集整合了 CUAD 合同、MAUD 并购协议及 SEC EDGAR 公开备案的企业记录,共计 700 份完整法律文本,每份文档均附有细粒度的类别标签和子类标签,为研究者提供了统一的文档分类测试平台。在此场景下,模型需在包含长篇幅、复杂法律术语和篇章结构的语料上实现精确的类别判别,从而检验算法对法律文本领域特征的理解与泛化能力。
解决学术问题
该数据集解决了跨语料库法律文档分类研究中长期存在的基准缺失与标签体系碎片化问题。既往研究常局限于单一来源数据,难以评估模型在不同法律文件类型间的迁移性能。Docclass Merged 通过构建统一的分类表面,并采用基于文件名的哈希确定性划分训练/测试集,保障了实验的可复现性与可比性,为学术社区提供了标准化的评测框架。其细粒度的子类标注亦支持层级分类任务的研究,推动了法律文本挖掘从粗粒度区分向语义细分类的深入探索。
衍生相关工作
该数据集的构建方法与应用催生了多项衍生工作。其一,围绕确定性哈希划分策略,研究者可借鉴其可复算的拆分逻辑,用于其他小规模专业领域数据集的设计,以增强评测的稳定性。其二,整合 CUAD、MAUD 与 SEC 数据的思路,启发了法律 AI 社区构建更大规模的多任务数据集,将文档分类与实体抽取、条款关联等任务结合。其三,该数据集的细粒度子类标注体系,为法律文档的层级分类与零样本分类研究提供了基准,促进了可解释性法律文本分析模型的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务