docclass-merged
收藏资源简介:
Docclass Merged Corpus 是一个用于文档分类的文本分类数据集,包含 700 份法律文档,共三种类型:合同(contract)、合并协议(merger_agreement)和公司记录(corporate_record)。数据集来源于 CUAD v1(509 份合同)、MAUD v1(152 份合并协议)和 SEC EDGAR 公开文件(39 份 S-1 公司记录)。每行数据以 JSON 对象形式存储,包含文件名(filename)、文档全文(doc_text)、提示(prompt)、真实标签(expected)、二级标签(expected_subclass)、分割(split)以及元数据(metadata)。二级标签分别为合同子类(28 组)、MAUD 考虑类型和 S-1 记录子类。数据集采用确定性分割,约 10% 作为测试集(基于 md5(filename) mod 10 == 0),其余为训练集。该数据集适用于法律文档分类任务,可用于评估和训练文档分类模型。
Docclass Merged Corpus is a text classification dataset for document classification, containing 700 legal documents of three types: contract, merger_agreement, and corporate_record. The dataset is sourced from CUAD v1 (509 contracts), MAUD v1 (152 merger agreements), and SEC EDGAR public filings (39 S-1 corporate records). Each row is stored as a JSON object, including filename, doc_text, prompt, expected label, expected_subclass, split, and metadata. The subclasses include contract subclasses (28 groups), MAUD consideration types, and S-1 record subclasses. The dataset uses a deterministic split, with approximately 10% as the test set (based on md5(filename) mod 10 == 0) and the rest as the training set. It is suitable for legal document classification tasks and can be used for evaluating and training document classification models.
数据集概述
Docclass Merged Corpus 是一个用于文本分类的英文法律文档数据集,包含 700 份法律文档,每行对应一份文档,采用扁平化的文档分类结构。
数据构成
数据集整合了三个来源的语料:
| 来源 | 文档数量 | 类别标签 | 原始出处 |
|---|---|---|---|
| CUAD 合同 | 509 | contract |
CUAD v1(CC BY 4.0) |
| MAUD 并购协议 | 152 | merger_agreement |
MAUD v1(CC BY 4.0) |
| S-1 公司记录附件 | 39 | corporate_record |
SEC EDGAR 公开文件 |
数据格式
每行数据为一个 JSON 对象,包含以下字段:
- filename:源文件名(如 CUAD PDF 文件名或 MAUD/S-1 文件名)
- doc_text:完整的文档文本
- prompt:提示词
- expected:一级类别标签(即文档类型)
- expected_subclass:二级子类别标签(每行均有值,例如合同分组、MAUD 对价类型、S-1 记录子类)
- split:数据划分标记,通过
md5(filename) mod 10 == 0判定为测试集(约 10%),该规则确定且与顺序无关,可复现 - metadata:各语料的来源元数据
数据集采用确定性排序(先按语料,再按文件名),重建时字节一致,数据集指纹为 cd652e77103556ac…。
划分规则
- 使用基于文件名的哈希函数确定训练集与测试集划分,约 10% 作为测试集。
- 划分规则不强制按类别分层,但在当前规模下类别分布保持稳定。
来源与构建
数据集由 llm-entity-extraction 项目的 scripts/datasets/build_docclass_merged.py 脚本构建。CUAD 部分来自 Braintrust 镜像导出,MAUD 部分来自 Zenodo v1 语料库,S-1 附件部分直接从 SEC EDGAR 公开文件中提取。
许可
数据集采用 CC BY 4.0 许可协议,适用于文本分类任务,标签为英文。




