遇见数据集

ContractScrub

收藏
arXiv2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

ContractScrub是由汤森路透基础研究与帝国理工学院联合创建的首个专用于评估法律合同终审校对的基准数据集。该数据集包含3,014个标注任务,涵盖44份合同中的九类典型错误,如定义术语误用、引用错误和语言不一致等,均由资深律师手工标注并注入额外错误以构建黄金标准。数据来源为公开的CUAD合约库,经过严格筛选、现有错误标注及针对性错误注入三阶段流程生成。该基准旨在衡量大语言模型在真实合同审查场景中的缺陷识别能力,填补了现有法律推理基准与经济效益之间的空白,为自动化合同校对提供可靠评估。

ContractScrub is the first benchmark dataset specifically designed for evaluating final proofreading of legal contracts, jointly created by Thomson Reuters Basic Research and Imperial College London. This dataset includes 3,014 annotation tasks, covering nine typical error categories across 44 contracts, such as misused defined terms, citation errors, and linguistic inconsistencies. All annotation work was manually completed by senior lawyers, with additional targeted errors injected to establish the gold standard. Derived from the publicly available CUAD contract corpus, the dataset was generated through a three-stage workflow consisting of strict screening, annotation of existing errors, and targeted error injection. This benchmark aims to evaluate the defect detection capability of Large Language Models (LLMs) in real-world contract review scenarios, filling the gap between existing legal reasoning benchmarks and practical economic benefits, and providing a reliable evaluation framework for automated contract proofreading.

创建时间:
2026-08-21
原始信息汇总

数据集概述:tri-fair-lab/contract_scrub

  • 数据集名称:contract_scrub
  • 提供机构:tri-fair-lab
  • 许可证:CC BY-NC 4.0(知识共享-署名-非商业性使用 4.0 国际许可协议)
  • 当前状态:该数据集详情页面标注为“即将推出”(Coming soon!),目前尚未正式发布具体的数据内容、格式或使用说明。
  • 访问地址:https://huggingface.co/tri-fair-lab/contract_scrub

该页面目前仅包含基础的许可信息与占位说明,无更多关于数据规模、字段定义、采集方式或应用场景的详细描述。

搜集汇总
数据集介绍
ContractScrub 数据集图片
构建方式
ContractScrub基准的构建源于对合同审查流程的深入理解,其数据源自开放获取的CUAD数据集,经过资深律师的精心筛选与审阅,确保源合同囊括多样化的主题与起草风格。构建流程分为三个阶段:首先,对被选合同进行结构审查,确保其具备适合验证的长度与完整性;其次,由执业经验丰富的律师团队对合同内已有的定义术语及各类潜在错误进行细致标注;最后,通过人为植入具有代表性的起草错误,如定义术语的误用、交叉引用的错乱及语言不一致等,生成包含金标准答案的最终数据集。整个构建过程由九位执业超过八年的律师参与,保证了数据在法律上的严谨性与现实的代表性。
特点
ContractScrub作为首个针对合同‘清洗’任务的基准,其特色鲜明地体现在对九种精细错误类别的覆盖上,从定义术语的提取到不一致语言的识别,无一不考验模型对长文档的深度理解与细节把握。该基准突出了错误检测的召回率敏感性,强调全文档级别的完整性检查,而非孤立的任务解析。其金标准由专业律师手工标注,确保了错误标注的客观性与法律专业性。此外,数据集规模的适中(44份合同,3014个标注任务)在保证评估效度的同时,也便于研究者进行深入的错误分析,从而揭示模型中隐藏的推理短板。
使用方法
使用ContractScrub基准评估模型时,需遵循既定的评估协议:模型需根据指示,针对每份合同生成包含九个类别错误识别的结构化JSON输出。评估采用多集比较策略,通过标准化预处理(如术语小写化、位置字段规范化)后,计算各类别上的召回率、精确率与F1分数,并以宏平均召回率作为主要性能指标。该基准支持两种评估模式:完整评估与仅限术语评估,后者可分离错误识别与定位的差异。研究者可将此基准用于不同模型家族与规模的性能对比,或通过调整推理策略(如启用推理)来探索模型能力的提升空间,为自动化合同审查系统的研发提供实证依据。
背景与挑战
背景概述
ContractScrub是由汤森路透基础研究团队与帝国理工学院联合推出的首个针对法律合同终审复核(scrubbing)任务的专项基准,创建于2026年。该基准聚焦于合同交易生命周期中至关重要的最终审查环节,旨在评估大语言模型在识别合同文本中定义术语误用、交叉引用错误、语言不一致等九类起草缺陷方面的能力。研究团队基于CUAD数据集筛选并人工构造了44份合同,包含3014项专家标注任务,由经验丰富的执业律师精心设计错误案例。ContractScrub填补了法律AI领域从能力评估到实际经济价值转化之间的空白,其发布为衡量LLMs在法律实务中的真实应用潜力提供了高生态效度的评测工具。
当前挑战
ContractScrub所面对的挑战多维且严峻。领域层面,合同scrubbing是一项结合长上下文推理、结构化一致性检查、稀疏错误检测、异构错误类型及文档内部语境依赖的复杂任务,要求模型在完整合同中自主发现缺陷,而非简单分类或抽取。构建层面,需由资深律师耗时费力地人工审查、标注既有错误并有意植入合理错误,同时确保错误分类均衡、文档合法性与连贯性,过程繁琐且依赖专家判断。评测中发现,即便最先进的GPT-5.5模型宏平均召回率仅0.750,F1分数均低于0.650,且在需推断上下文中意图的类别(如未定义大写术语)表现尤差,凸显了任务难度与模型实际能力之间的显著鸿沟。
常用场景
经典使用场景
ContractScrub作为首个专为法律合同终审核验(scrubbing)设计的基准测试,广泛应用于评估大型语言模型(LLMs)在合同审查任务中的性能。该数据集包含44份由资深律师手工标注的合同,涵盖九类错误,如定义术语误用、引用错误、语言不一致等。其经典使用场景是模拟律师在合同签署前进行的最终审查流程,要求模型从整份合同中识别并定位各类缺陷,以此检验模型在长文档理解、一致性检验和命名实体识别等综合能力上的表现。
解决学术问题
ContractScrub解决了当前法律AI评估中缺乏针对合同核验任务的生态有效性基准的问题。现有基准多侧重于法律推理或条款分类,而ContractScrub专注于缺陷识别这一真实工作流,填补了从能力评估到实际应用之间的鸿沟。研究揭示,前沿模型在此任务上表现不佳,最佳模型宏平均召回率仅0.75,远低于其在通用基准上的成绩,凸显了领域特定基准对于衡量模型真实影响力的必要性。该数据集为理解LLM在专业任务中的局限性提供了理论洞见,并推动了针对合同审查的专项评估方法论的发展。
衍生相关工作
ContractScrub的发布推动了多项相关研究,包括对LLM在长文档中跨距离引用错误识别能力的深入分析,揭示了性能随引用距离增加而显著下降的现象。此外,基于该基准的消融实验探讨了推理机制对各类错误识别的影响,发现推理对依赖全文一致性的任务增益明显,而对需要深层语义判断的任务提升有限。该数据集还促进了针对合同核验的提示工程和后处理策略研究,并为构建更广泛的生态有效法律AI基准提供了范式参考,激励了后续在跨语言、多类型合同上的扩展工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务