遇见数据集

legalbench-deep

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

LegalBench-Deep 是一个多文档法律AI基准数据集,旨在评估法律AI系统在真实尽职调查工作流中处理数百份文档时的表现。该数据集针对现有基准的局限性而设计,现有基准通常只测试单次、狭窄的合成任务,无法有效评估系统在跨文档交叉引用义务、跟踪定义术语或推理累积风险暴露等复杂场景下的性能。数据集包含五个核心任务,按认知深度递增排列:DD-Review(跨N份合同查找所有风险条款)、DD-Consistency(跨文档跟踪定义术语并标记不一致)、DD-Exposure(聚合投资组合中的定量风险)、DD-Conflict(检测主协议与补充协议之间的冲突义务)以及DD-Missing(识别缺失必需条款的合同,涉及否定推理)。这些任务采用深度评分公式(D = log₂(文档数) × 推理级别 × (1 + 合成级别))来生成深度-准确度曲线,揭示模型性能下降点。评估采用三轨隔离方法:Track A(原始)将所有文档置于上下文中以测试纯模型能力;Track B(RAG)要求系统自行检索文档以测试模型与检索能力;Track C(Oracle)提供黄金文档以测试模型与合成能力,排除检索噪声。这允许将性能分解为检索增益、合成增益和整体工具贡献。数据规模属于 10K<n<100K 类别,并包含两个生成的样本数据室:sample_dataroom_20(20份合同)和 sample_dataroom_50(50份合同)。每份合同包含18个部分,风险条款以10-38%的受控比例植入,涵盖五种类型:无限责任、自动续约、知识产权缺口、控制权变更和单方面修改。所有文档均为合成生成,并带有完美的黄金标注。该数据集适用于法律AI系统的基准测试,特别是在多文档尽职调查、风险分析、合同审查和一致性检查等场景中。

LegalBench-Deep is a multi-document legal AI benchmark dataset designed to evaluate the performance of legal AI systems in real-world due diligence workflows when handling hundreds of documents. This dataset addresses the limitations of existing benchmarks, which typically test only single, narrow synthetic tasks and fail to effectively assess system performance in complex scenarios such as cross-document cross-referencing of obligations, tracking defined terms, or reasoning about cumulative risk exposures. The dataset includes five core tasks, arranged in increasing order of cognitive depth: DD-Review (finding all risk clauses across N contracts), DD-Consistency (tracking defined terms across documents and flagging inconsistencies), DD-Exposure (aggregating quantitative risks in a portfolio), DD-Conflict (detecting conflicting obligations between master and supplemental agreements), and DD-Missing (identifying contracts missing essential clauses, involving negative reasoning). These tasks use a depth scoring formula (D = log₂(document count) × reasoning level × (1 + synthesis level)) to generate depth-accuracy curves, revealing model performance degradation points. Evaluation employs a three-track isolation method: Track A (raw) places all documents in context to test pure model capabilities; Track B (RAG) requires systems to retrieve documents themselves to test model and retrieval capabilities; Track C (oracle) provides gold documents to test model and synthesis capabilities, excluding retrieval noise. This allows performance to be decomposed into retrieval gain, synthesis gain, and overall tool contribution. The data scale falls into the 10K<n<100K category and includes two generated sample datarooms: sample_dataroom_20 (20 contracts) and sample_dataroom_50 (50 contracts). Each contract contains 18 sections, with risk clauses implanted at controlled rates of 10-38%, covering five types: unlimited liability, auto-renewal, intellectual property gaps, change of control, and unilateral modification. All documents are synthetically generated and come with perfect gold annotations. The dataset is suitable for benchmarking legal AI systems, particularly in scenarios such as multi-document due diligence, risk analysis, contract review, and consistency checks.

创建时间:
2026-07-03
原始信息汇总

数据集概述

LegalBench-Deep 是一个面向法律领域的人工智能基准测试数据集,旨在评估 AI 系统在数百份文档的真实尽职调查工作流中的性能。

核心动机

现有法律 AI 基准测试仅针对单一、合成的“一问一答”任务,无法衡量系统在跨文档引用义务(如50+份合同)、追踪跨文件定义术语或分析投资组合累积风险暴露时的表现。LegalBench-Deep 专门设计用于测试这种复杂场景。

方法与任务

该基准包含五个任务,针对递增的认知深度:

任务 深度 测试内容
DD-Review 3 在N份合同中查找所有风险条款
DD-Consistency 4 跨文档追踪定义术语,标记不一致之处
DD-Exposure 5 跨投资组合聚合定量风险
DD-Conflict 4 检测主协议与补充函之间的冲突义务
DD-Missing 3 识别缺少必需条款的合同(否定推理)

深度分数 公式为:D = log₂(N_docs) × reasoning_level × (1 + synthesis_level),可生成深度-准确率曲线,展示模型性能退化点。

三轨评估体系

系统将性能分解为三个维度:

  • Track A (Raw):所有文档置于上下文中 → 纯模型容量
  • Track B (RAG):系统自行检索文档 → 模型+检索框架
  • Track C (Oracle):提供黄金标准文档 → 模型+框架综合,排除检索噪声

最终通过差值计算检索增益(B-A)、综合增益(C-A)和框架整体贡献(B-C)。

数据组成

数据集包含两个生成的示例数据室:

数据集 合同数 风险条款类型 黄金标注
sample_dataroom_20 20 5种(无限责任、自动续约、知识产权缺口、控制权变更、单方修改) 逐文档 + 清单
sample_dataroom_50 50 5种(同上) 逐文档 + 清单

每份合同包含18个章节,以10%-38%的控制率植入风险条款。所有文档均为合成生成,并具备完美的黄金标签。

仓库结构

├── METHODOLOGY.md # 完整方法论文档 ├── tasks/ │ └── dd_review/ │ ├── task_spec.py # 可运行评估框架 │ └── README.md # 任务文档 ├── data/ │ └── generate_dataset.py # 合成数据生成器 ├── evaluation/ │ └── metrics.py # 共享指标实现 ├── sample_dataroom_20/ # 20份合同样本数据集 └── sample_dataroom_50/ # 50份合同样本数据集

快速开始

可通过脚本自定义生成数据室并运行评估:

bash

生成自定义数据室

python data/generate_dataset.py --n-docs 100 --output ./dataroom --seed 42

运行 DD-Review 评估(存根模式,无需GPU)

python tasks/dd_review/task_spec.py --dataroom ./dataroom --clause-type uncapped_liability --track all --model stub

搜集汇总
数据集介绍
legalbench-deep 数据集图片
构建方式
LegalBench-Deep数据集的构建基于对法律尽职调查工作流的深度模拟,旨在评估AI系统在跨文档场景中的表现。其核心通过合成数据生成器(generate_dataset.py)创建包含大量合同文档的数据室,每份合同均由18个章节构成,并以10%至38%的受控比例植入五种风险条款类型(如无上限责任、自动续期等)。数据集覆盖20至50份合同的样本规模,并配备每份文档及全局清单的完美金标签,确保评估的精确性。任务设计上,五个子任务(DD-Review、DD-Consistency、DD-Exposure、DD-Conflict、DD-Missing)对应递增的认知深度,通过深度评分公式D = log₂(N_docs) × reasoning_level × (1 + synthesis_level)量化模型退化曲线,同时采用三轨评估体系(原始、RAG、Oracle)分离检索与合成能力的影响。
特点
该数据集的突出特点在于其多文档、高复杂度的评测架构,弥补了现有法律AI基准在跨文档推理上的空白。通过深度评分机制,它能精确刻画模型在处理50余份合同时的性能衰减轨迹,而三轨评估设计则巧妙分解了模型容量、检索能力与合成能力的独立贡献。任务覆盖从风险条款定位(DD-Review)到矛盾检测(DD-Conflict)的渐进式认知层级,其中DD-Exposure任务需聚合整个合同组合的定量风险,DD-Missing任务则融入否定推理,显著提升挑战性。所有数据均为合成生成,确保标签无噪声,并支持自定义数据室规模,为可复现的基准测试提供坚实基础。
使用方法
用户可通过命令行直接生成自定义数据室,例如运行`python data/generate_dataset.py --n-docs 100 --output ./dataroom --seed 42`创建包含100份合同的测试集。评估执行采用轻量级存根模式,无需GPU资源,例如通过`python tasks/dd_review/task_spec.py --dataroom ./dataroom --clause-type uncapped_liability --track all --model stub`启动DD-Review任务的完整三轨评测。用户亦可自由切换任务类型与评估轨迹,以测试不同模型在检索或合成环节的表现。详细方法论请参考METHODOLOGY.md文件,其中提供了完整的实验设计文档。
背景与挑战
背景概述
LegalBench-Deep数据集由国际法律科技研究团队于2024年创建,旨在突破现有法律人工智能评估基准的局限性。传统法律AI基准测试如LegalBench等,多聚焦于单文档、单轮问答的简单任务,无法真实反映法律AI系统在复杂尽职调查场景中的表现。该数据集的核心研究问题是如何评估AI在处理跨文档法律推理、多合同风险汇总、定义条款一致性追踪等高阶认知任务时的能力。通过模拟包含数百份合同的数据室环境,LegalBench-Deep引入了认知深度指标(D值)和三轨评估框架,为法律AI系统的检索、合成与整体性能分离提供了标准化测量工具,对法律科技领域的大模型评估范式产生了重要影响。
当前挑战
数据集面临的核心挑战在于解决法律尽职调查领域的高阶推理难题。现有基准无法评估AI在跨50份以上合同中追踪定义条款一致性、检测主协议与补充函间的义务冲突,或聚合量化风险敞口的认知能力,这些任务要求模型具备跨文档语境理解、逻辑推理与综合判断能力。在构建过程中,数据合成面临控制风险条款植入率(10-38%)与保持文本自然性的平衡难题,同时需要设计精细化的评估指标以隔离检索与合成阶段的性能贡献,避免模型在单任务上的过拟合。此外,如何确保合成数据生成的合同文档在保持法律专业性的同时,具备足够的多样性和复杂性以逼近真实商业场景,也是一项持续的技术挑战。
常用场景
经典使用场景
LegalBench-Deep作为一项前沿法律AI基准测试,专为检验多文档法律推理能力而设计。其经典使用场景聚焦于模拟真实的尽职调查工作流,要求系统在数百份合同中交叉引用义务条款、追踪跨文档的定义术语、汇总投资组合的累积风险敞口。该基准通过五项递进式任务——DD-Review(风险条款检索)、DD-Consistency(术语一致性核查)、DD-Exposure(量化风险聚合)、DD-Conflict(义务冲突检测)和DD-Missing(缺失条款识别)——构建起从基础检索到深层推理的完整评估体系,尤其适用于测试大语言模型在长上下文、多文档、多跳逻辑下的法律文本理解与合成能力。
衍生相关工作
LegalBench-Deep的发布已催生了一系列延伸性研究工作。在方法论层面,研究者借鉴其三维轨道分离思想,开发出针对法律合同中隐含承诺(Implied Covenant)的逻辑冲突检测模型;在数据集层面,有团队基于其合成数据生成策略(data/generate_dataset.py),扩展了涵盖兼并与收购、知识产权许可和劳动法规等领域的多合同语料库。此外,其深度评分框架被整合进若干开源法律AI评估套件,用以比较不同架构(如稀疏注意力与全注意力机制)在长序列法律文本上的推理退化边界。部分工作还尝试将基准中的DD-Exposure任务适配至金融风险评估领域,形成了跨学科的法律-金融量化分析评测协议。
数据集最近研究
最新研究方向
LegalBench-Deep 数据集致力于评估法律AI系统在多文档尽职调查流程中的真实认知能力,突破了现有基准仅测试单轮、单文档任务的局限。其核心价值在于通过五种递增认知深度任务(如跨文档条款追踪、定义一致性检测、组合风险量化)模拟律师在数十份合同间的复杂推理场景。该基准引入深度-精度曲线与三轨评估框架(原始/检索/合成),系统性地量化模型在纯容量、检索增强与合成推理各环节的性能衰减,精准揭示当前大语言模型在处理长文本关联与密集型法律推理时的短板。这一工作与生成式AI在专业领域的落地热点紧密相关,为构建具备真正多文档逻辑推理能力的法律助手提供了关键性评测标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务