遇见数据集

RedlineBench

收藏
github2026-06-17 更新2026-06-19 收录
官方服务:

资源简介:

RedlineBench是一个用于AI合同修订的基准测试数据集,它通过模拟真实的SaaS交易和律师生成的关键修订决策解释,捕获多轮修订工作流程,并评估模型在五个维度上的表现:法律正确性、商业对齐、谈判质量、对手接受预测和交易完成导向。数据集包含140个可运行任务,覆盖3个场景,每个场景代表供应商与企业客户之间的完整多轮谈判,任务涉及4个谈判轮次,测试模型在合同修订中的法律判断、谈判技巧、文档机制和沟通能力。

RedlineBench is a benchmark dataset for AI-powered contract revision. It captures multi-round contract revision workflows by simulating real SaaS transactions and key revision decision explanations generated by lawyers, and evaluates model performance across five dimensions: legal correctness, business alignment, negotiation quality, opponent acceptance prediction, and transaction completion orientation. The dataset contains 140 runnable tasks covering 3 scenarios, where each scenario represents a complete multi-round negotiation between a vendor and an enterprise customer. Each task involves 4 negotiation rounds, and tests the model's legal judgment, negotiation skills, document mechanism capabilities, and communication proficiency in contract revision.

创建时间:
2026-06-16
原始信息汇总

数据集概述:RedlineBench

RedlineBench(Crosby–micro1 RedlineBench)是一个专注于衡量AI代理在合同谈判中执行红线性修订(redlining) 能力的基准测试。它模拟真实的SaaS交易场景,将合同谈判视为一系列基于法律判断的商业决策,而非孤立的条款编辑。

  • 核心目标:评估AI代理是否能像真实律师一样,生成包含原生跟踪修订和边栏评论的Word .docx 文件,并根据律师编写的评分标准进行评判。

评估维度

该基准从五个维度对模型进行评估:

  1. 商业契合度(Commercial context): 占比33.4%。评估是否违反明确的商业指令(如预算上限、上线日期、交易决定性条款)。
  2. 法律正确性(Legal correctness): 占比25.7%。评估是否存在法律表述错误、引入不可执行的措辞或造成合同冲突。
  3. 谈判质量(Negotiation quality): 占比17.0%。评估在给定的谈判地位和阶段下,是否过于激进或保守,轻易让步或过度纠缠无关紧要的问题。
  4. 交易促成导向(Deal-closing orientation): 占比13.7%。评估是否追求在所有条款上“获胜”而忽视促成交易,有无过多低影响修订。
  5. 对手方接受度预测(Counterparty-acceptance prediction): 占比10.2%。评估是否提出了明显不可行的方案,未能识别已有利的措辞,或无故接受极端立场。

数据集结构

  • 总任务数: 140个独立任务。
  • 场景: 基于3个完整的多轮谈判场景,涉及供应商(AgentCo, 一家AI招聘平台公司)和企业客户之间的合同谈判。
场景 描述 任务数
1 供应商主导的SaaS MSA:AgentCo 首先对 LargeCo 的模板进行标记。 50
2 客户主导的SaaS MSA:LargeCo 首先起草标记。 40
3 专业服务MSA:AgentCo 在 GiantCo 的采购模板上进行操作。 50
  • 谈判轮次: 覆盖4轮谈判。第1轮为对初始模板的初次标记;第2-4轮为回应轮次,代理需要分类并回应对方的所有现有修订和评论。
  • 任务分组: 任务名称编码其所在谈判树节点(如 redline-s1-t1-g01a)。属于同一输入组(如 g01a, g01b, g01c)的任务,AI面对完全相同的输入,但由不同律师的评分标准进行评判,以衡量多专家下的表现。

代理环境与工具

  • 环境三要素:
    • 只读输入: 任务说明、背景文件(己方剧本和共享商业背景)、源合同(模板或带有跟踪修订的草稿)。
    • 工具接口: 内置的 contract-redliner 技能。
    • 只写输出: 代理需在 /output/contract.docx 中生成带有跟踪修订和评论的最终文档。
  • 核心技能: contract-redliner 技能包含四个Python脚本,用于:将合同渲染为带段落ID和修订摘要的Markdown、批量应用带评论的跟踪修订(替换/删除/插入)、添加评论和线程回复、以及执行章节删除并保留编号。

任务评分机制

  • 有效性验证: 输出必须是一个可加载的 .docx 文件,并包含至少一个归属于代理的跟踪修订或评论。
  • LLM评判: 输出的修订版合同被渲染为带注释视图,并由一个3裁判小组(由 gpt-5.4-mini, claude-haiku-4-5, gemini-3.1-flash-lite 三个模型构成、与被评测模型不同家族)根据权重为1-10的评分标准(rubrics)进行PASS/FAIL判定。部分标准带有负权重(惩罚不良编辑)。
  • 最终得分: reward = clamp(Σ earned − Σ penalties, 0, Σ positive weights) / Σ positive weights,分值范围为[0, 1]。
  • 基准集计分: 先计算每个输入组内任务得分的平均值,再计算各组平均值的均值,并按轮次、代理方和场景进行细分。

数据获取与复现

  • 数据位置: 数据集托管在 HuggingFace 上,地址为 crosbylegal/RedlineBench,不直接提交在GitHub仓库中。
  • 复现命令: 通过安装Harbor并配置相关API密钥后,可使用 redlinebench-reproduce 命令一键运行完整基准测试(下载任务、运行代理、评判、评分)。

许可信息

  • 代码: MIT 许可 (© 2026 Crosby Legal)。
  • 数据集: CC-BY-4.0 许可。
搜集汇总
数据集介绍
RedlineBench 数据集图片
构建方式
RedlineBench数据集基于真实SaaS交易场景与律师撰写的红线决策解释构建而成,涵盖140个多轮谈判任务,分布于三个完整谈判场景中:供应商主导的SaaS MSA、客户主导的SaaS MSA以及专业服务MSA。每个任务按谈判轮次(共四轮)和输入组进行编码,同一输入组内的任务共享完全相同的模型输入,仅通过不同律师的评分标准衡量性能。数据集以Harbor任务架构自包含地封装,每个任务包含配置元数据、律师指令、含可编辑合同文档的环境以及验证器侧的评分材料,黄金标准律师红线文档仅放置于验证器端,确保模型无法窥见。
使用方法
使用RedlineBench需先安装Harbor框架与Docker环境,配置OpenAI、Anthropic及Gemini的API密钥以驱动法官面板。运行单个命令即可启动完整流程,包括下载数据集、执行Harbor代理操作、汇编三法官判决结果、计算评分及生成指标摘要。支持多种代理框架驱动,包括Codex、OpenCode及自定义代理。通过指定任务名称可执行单任务烟雾测试,运行环境支持本地多并发或云端并行模式。每次完整重跑具有非确定性,因此运行间差异属预期现象,基准的核心发现聚焦于任务难度而非精确分数。
背景与挑战
背景概述
RedlineBench 数据集诞生于人工智能辅助法律文本处理的前沿领域,由 Crosby Legal 团队于 2026 年构建,旨在系统化评估 AI 代理在复杂合同谈判中的逐条修订(redlining)能力。研究核心聚焦于模拟真实软件即服务(SaaS)交易的多轮谈判流程,通过 140 个精心设计的任务,覆盖供应商主导、客户主导及专业服务三种典型场景。该数据集突破性地将合同谈判定义为一系列判断决策的序列,而非孤立的条款编辑,并在法律正确性、商业契合度、谈判质量、对方接受度预测及成交导向五个维度上构建评价体系。RedlineBench 的发布为法律人工智能领域提供了首个标准化、可复现的基准,推动了智能合约处理从简单编辑向深度协商能力的范式转变。
当前挑战
RedlineBench 所应对的核心挑战在于弥合 AI 单纯语法修正与律师真实谈判智慧之间的鸿沟。具体而言,领域挑战包括:其一,法律判断的复杂性,要求模型精准识别影响本方风险的关键条款并做出法律上有意义的修改;其二,谈判策略的动态性,需在接收对方修订后能做出接受、拒绝、完善或评论回复等恰当反应;其三,文档机械操作的精确性,需在真实 OOXML 格式中实现字词级修订标记、编号和交叉引用的保留。数据集构建过程中的挑战同样严峻:一是生成了 138 份专家律师的黄金标准修订文档作为评分参照,二是设计了含负权重评分规则的法官评估系统,三是构建了支持多轮谈判状态继承的仿真环境,这些都对数据质量和评估公平性提出了极高标准。
常用场景
经典使用场景
RedlineBench数据集最经典的使用场景聚焦于评估AI智能体在合同谈判中的多轮修订能力。该数据集精心构建了140个模拟真实SaaS交易场景的任务,涵盖供应商主导、客户主导及专业服务三种谈判范式,每个任务将智能体置于具体的谈判回合中,要求其扮演内部法律顾问,基于给定的商业背景、谈判手册和当前合同状态,生成带有真实Word审阅模式修订标记和批注的法律文档。这一设计精准复现了法律实务中律师逐轮推敲条款的思维过程与操作流程。
解决学术问题
从学术研究视角审视,RedlineBench系统性地解决了合同AI领域长期缺乏标准化、多维评估基准的困境。该数据集通过法律正确性、商业对齐度、谈判质量、对方接受度预测及交易促成导向五个维度对模型进行量化评测,尤其引入了加权评分机制与负面惩罚项,能够精准识别模型在法律推理、风险判断和谈判策略上的偏差。它填补了现有NLP基准在大规模、结构化、多轮合同谈判评估方面的学术空白,为法律AI的可信性研究提供了理论支撑。
实际应用
在实际应用层面,RedlineBench深刻影响了企业法务智能化工具的研发方向。它推动AI系统从简单的条款搜索与替换,进化为能够理解商业场景、权衡法律风险并主动推进交易的智能谈判助手。数据集所倡导的多轮修订格式输出能力,使生成的合同可直接纳入企业现有的Word审阅工作流,实现与法律科技产品的无缝对接。目前,该基准已成为评估GPT-5.5、Claude Opus 4.8等前沿模型在法务场景中实际表现的重要标尺。
数据集最近研究
最新研究方向
在人工智能辅助法律合同审查的浪潮中,RedlineBench开创性地将合同谈判评估从孤立的条款修订转变为多轮判断序列的测试框架。该基准模拟真实SaaS交易中律师的逐轮标注工作流,通过140个涵盖供应商与客户主导的双向谈判场景,系统测评AI模型在法律正确性、商业对齐度、谈判质量、对手方接受度预测及交易促成导向五个维度的综合能力。研究前沿聚焦于评估AI代理是否能像真正律师那样,在保留原生修订标记与评论线程的Word文档中完成精细化操作,而非简单生成静态文本。这一设计精准回应了企业法务部门对自动谈判工具日益增长的现实需求,为衡量大语言模型在复杂法律协商中的实际效用提供了标准化、可复现的评估范式,对推动法律科技从文本生成向谈判智能的跃迁具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务