遇见数据集

inject-or-navigate

收藏
github2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

该数据集是用于论文Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents的伴随数据集和评估工具。它包含一个评分基准,其中包含20个问题,覆盖6个公共交易法律文件,涉及设施协议、有限合伙协议和股份/资产购买协议等领域,每个问题都有验证过的参考答案;还包括一个52个问题的DocNavBench开发集。数据集用于评估LLM在交易法律文件分析中的检索效率。

This dataset serves as both the accompanying dataset and evaluation toolkit for the paper *Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents*. It includes a scoring benchmark containing 20 questions covering 6 public transactional legal documents across domains such as facility agreements, limited partnership agreements, and share/asset purchase agreements, with each question paired with verified reference answers. It also features a 52-question DocNavBench development set. This dataset is designed to evaluate the retrieval efficiency of large language models (LLMs) in the analysis of transactional legal documents.

创建时间:
2026-07-07
原始信息汇总

数据集概述

该数据集是论文《Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents》的配套基准测试集和评估工具,旨在研究面向法律文档的LLM检索效率。

数据集构成

1. 评分基准测试集(data/benchmark_qa.json

  • 规模:包含 20 个问题,覆盖以下领域:
    • 6 份公开交易法律文档(SEC EDGAR 备案文件),涉及三种业务类型:
      • 融资协议(FA)
      • 有限合伙协议(LP)
      • 股份/资产购买协议及披露附表(SP)
    • 18 个文档绑定问题(每份文档 3 个),附有已验证的标准答案
    • 2 个范围外控制问题,答案不在任何文档中(用于测试正确的“拒绝回答”能力)
  • 数据格式(JSON)
    • id:问题标识(源文件名称 + _Q<n>,控制问题为 out_of_scope_Q1/Q2
    • doc:文档短键(与 data/sources.md 一致;控制问题为 OOS
    • text:问题内容
    • answer:已验证的标准答案

2. DocNavBench 开发集(data/docnavbench_questions.json

  • 规模52 个问题(FA 13 个,LP 17 个,SP 22 个)
  • 特点
    • 由律师编写,基于议题驱动,与文档无关(问题可能合理结论为“协议中不存在”)
    • 无标准答案,仅通过成对偏好评分
    • 设计用于测试嵌入检索的弱点:许多问题为复合型(例如部分易定位,部分要求查找很可能缺失的具体条款),正确答案需部分拒绝回答
  • 难度等级high / medium

文档来源

  • 所有文档均为 SEC EDGAR 公开备案文件,未在此仓库中重新分发
  • 可通过 harness/fetch_docs.py 从原始来源获取(见 data/sources.md 中的链接)

许可证

主要引用

论文:arXiv:2607.05764(https://arxiv.org/abs/2607.05764)

搜集汇总
数据集介绍
构建方式
该数据集旨在评估大型语言模型在分析交易性法律文档时,采用全量上下文注入与结构化检索两种策略的效能差异。其构建方式基于六份从SEC EDGAR公开获取的交易法律文件,涵盖贷款协议、有限合伙协议及股权购买协议三大领域。研究团队精心设计了20道具有已验证标准答案的基准问题,其中18道问题严格限定在文档内容范围内,每份文档对应三道问题,另设两道超出文档范围的控制性问题以测试模型正确拒绝回答的能力。数据集还包含一个由52道律师撰写的问题组成的DocNavBench开发集,这些问题具有复合性特征,专门用于检验嵌入检索在面对部分信息缺失场景时的局限性。所有问题的答案均经过人工校验,确保评估的可靠性。
特点
该数据集的核心特点在于其精细化的实验设计和严谨的评估框架。首先,基准问题集包含了文档范围内与外两类问题,使得评估不仅能衡量检索的准确性,还能考察模型判断信息存在与否的能力。其次,DocNavBench开发集专门设计了大量复合性问题,其中一部分答案明确存在于文档中,而另一部分则故意缺失,这种结构对依赖语义相似度的向量嵌入检索构成了严峻挑战。此外,数据集提供了一套完整的评估协议,包括五个系统提示和可公开运行的评估工具包,支持全量注入与两类结构化检索(嵌入检索与导航检索)的对比实验,能够量化不同方法在令牌消耗、成本效益和准确率之间的权衡关系。
使用方法
使用该数据集时,研究者首先需通过提供的脚本从SEC EDGAR获取原始法律文档文本。随后,可基于基准问题集中的20个问题运行评估协议,该协议支持三种检索模式的对比:全量上下文注入、基于通用文本嵌入的语义检索以及基于紧凑结构化索引的导航检索。评估采用受位置偏差控制的成对比较审判器,以参考答案为锚点进行判定。数据集附带了一个公开的评估工具包,能够复现论文中的评估流程,但为了完整复现论文中的核心方法,研究者需要自行实现文档的结构感知分块与索引构建。所有结果可通过令牌总数、美元成本以及与全量注入基准的匹配率进行综合比较分析。
背景与挑战
背景概述
在大型语言模型(LLM)应用于法律文书分析这一前沿领域,如何高效地从海量交易性法律文档中检索信息始终是一个核心难题。2026年,由Syntheia公司Mahmoud Hany、Mourad ElSheraey等研究人员主导提出的'Inject or Navigate?'数据集,旨在系统性地对比全文档注入与结构化检索两种范式。该数据集精心构造了20个经人工验证答案的基准问题,覆盖三类交易法律文书(信贷协议、有限合伙协议及股权收购协议),并设计了52个用于开发阶段的无标注问答集,专门用于测试模型处理复合型问题的能力。其研究问题直指LLM在长上下文场景下的性能退化与成本控制,对法律科技领域的大模型应用具有重要的方法论指导意义。
当前挑战
该数据集所应对的核心领域挑战在于:全文档注入虽能最大化检索召回率,但需将整份文档嵌入上下文窗口,导致token消耗随文档规模线性增长,且长上下文场景下模型精度会显著退化。在构建过程中,研究团队面临两大难点:一是如何设计结构感知的文档分块策略以兼顾语义完整性与检索效率;二是需构建复合型难题(如部分信息存在、部分缺失的问题)以暴露嵌入检索的局限性——即向量检索常因表面语义相似性而遗漏需要'拒绝回答'的答案。此外,52个开发集问题均无标准答案,仅能通过成对偏好比较进行评估,增加了验证的复杂性。
常用场景
经典使用场景
在司法科技与法律文本分析的前沿领域,Inject or Navigate 数据集为评估大语言模型在交易性法律文档上的问答能力提供了关键基准。其最经典的使用场景是衡量两种检索范式——全量文档注入(Injection)与结构化索引导航(Navigation)——在处理法律协议(如贷款协议、有限合伙协议、股权购买协议)时的效能差异。通过20道精心设计的验证性问题(含2道无答案控制题),该数据集允许研究者精确比较不同检索策略在答案准确性、令牌消耗与成本效率上的权衡,尤其适合评估模型在文档边界内定位具体条款、回答复合问题或正确拒绝无关查询的能力。
实际应用
在实际法律业务中,Inject or Navigate 数据集直接赋能企业级合同分析系统的架构决策。例如,律所或企业法务部门在部署智能合同审查工具时,可依据该数据集验证的缓存交叉规则(当语料规模超过检索载荷的十倍时,注入策略才具有成本优势)来设计工程方案。金融机构亦可利用其结构化索引方法,实现对贷款协议、私募文件等复杂文书的即时问答,同时将每次查询的令牌支出降低56倍以上。该工作衍生的开源评估工具链,更使中小企业能够无需依赖商业黑盒模型,自主构建符合合规审计要求的法律文档分析管线。
衍生相关工作
围绕Inject or Navigate 数据集已衍生出一系列推动法律NLP发展的后续工作。其核心贡献之一的DocNavBench(52题开放检索集)专门设计用于对抗向量嵌入检索的固有弱点——即对复合问题中缺失条款的误判——这直接催生了关于结构化索引与多跳推理结合的研究方向。论文中提出的位置偏差控制、参考锚定成对评判器等方法论,已成为评估法律问答系统时消除上下文位置干扰的标准工具。此外,该数据集公开的快速实验框架与结构感知分块思想,为后续诸如法律文档摘要生成、跨文档事实核查等任务提供了可复现的基线系统与评估协议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务