遇见数据集

RedlineBench

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

RedlineBench是一个专门用于评估AI代理在合同谈判(红批)任务中表现的基准数据集。它通过模拟真实的SaaS(软件即服务)交易和专业服务主协议(MSA)谈判,构建了多轮红批工作流程,旨在衡量AI模型如何像真实律师一样处理合同谈判——即在Word文档(.docx)中生成带有跟踪更改和线程评论的实际红批。数据集包含140个可运行任务,覆盖三个不同的谈判场景:两个SaaS MSA场景和一个专业服务MSA场景,每个场景进行四轮交替谈判。每个任务都是一个完整的谈判单元,包括任务配置、律师指令、待红批的合同文档、商业背景资料和特定方剧本、律师编写的加权评分标准(rubrics),以及作为专家基准的律师红批文档(138个任务提供)。数据集通过五个核心维度评估模型表现:法律正确性(占评分标准的25.7%)、商业一致性(33.4%)、谈判质量(17.0%)、对方接受度预测(10.2%)和交易达成导向(13.7%)。评分基于资深技术交易律师实时编写的评分标准,由LLM评审团执行。数据集中的所有材料均为合成数据,不包含真实个人身份信息或客户材料。该数据集适用于文本生成任务,特别是法律领域的合同谈判和红批自动化评估。

RedlineBench is a benchmark dataset specifically designed to evaluate the performance of AI agents in contract negotiation (redlining) tasks. It simulates real-world SaaS (Software as a Service) transactions and professional services master agreement (MSA) negotiations, constructing multi-round redlining workflows to measure how AI models handle contract negotiations like real lawyers—i.e., generating actual redlines with track changes and threaded comments in Word documents (.docx). The dataset includes 140 executable tasks covering three distinct negotiation scenarios: two SaaS MSA scenarios and one professional services MSA scenario, each conducted over four alternating rounds. Each task is a complete negotiation unit, comprising task configurations, lawyer instructions, contract documents to be redlined, business background materials and specific party scripts, lawyer-authored weighted scoring rubrics, and lawyer-redlined documents as expert benchmarks (provided for 138 tasks). Model performance is evaluated across five core dimensions: legal correctness (25.7% of the scoring rubric), business alignment (33.4%), negotiation quality (17.0%), counterparty acceptance prediction (10.2%), and deal-closing orientation (13.7%). Scoring is based on rubrics written in real-time by senior technology transactions lawyers and executed by an LLM jury. All materials in the dataset are synthetic and do not contain real personal identity information or client materials. This dataset is suitable for text generation tasks, particularly in the legal domain for contract negotiation and redlining automation assessment.

创建时间:
2026-06-16
原始信息汇总

数据集概述:RedlineBench

RedlineBench(全称 Crosby–micro1 RedlineBench)是一个专注于合同谈判评估的基准测试数据集,旨在衡量AI代理在模拟合同谈判流程中的表现,而非仅评估独立的条款编辑。该数据集由法律专家生成,面向单语言(英语)文本生成任务,类别为基准测试(benchmark),数据规模小于1000条。

  • 许可证:CC-BY-4.0
  • 发布时间:2025年3月
  • 关联资料
    • 发布报告:https://intelligence.crosby.ai/benchmark
    • 代码与复现工具:https://github.com/crosbylegal/redline-bench

数据内容与结构

  • 样本数量:共 140个可执行任务(基于Harbor框架),覆盖3个多轮谈判场景,包含4个交替轮次。
  • 任务标识格式redline-s{场景}-t{轮次}-g{组别}{变体},编码了谈判树结构。
  • 场景描述:所有场景均围绕了一家名为AgentCo的A轮HR科技公司展开,涉及SaaS(软件即服务)服务协议和专业服务协议的模拟谈判。三个场景分别为:
    • 场景1(占39.2%):AgentCo审阅LargeCo的SaaS模板并发起首次修改;
    • 场景2(占28.6%):AgentCo发送自己的模板,LargeCo发起首次修改;
    • 场景3(占32.3%):AgentCo与GiantCo的“必须赢”重要交易,需要将专业服务协议适配为SaaS协议且避免过度修改。
  • 每任务布局:每个任务包含配置文件、律师简报(instruction.md)、环境设置(Dockerfile、待修改的合同文件contract.docx、背景资料等)、以及测试文件夹(包含律师编写的评估标准rubrics.json、评分脚本judge.py和专家修改的黄金文档attorney_redlines.docx,其中138/140个任务提供黄金标准)。

数据字段(数据集查看器列)

数据集以Hugging Face Dataset格式提供,包含以下关键字段:

  • task_id:标准任务标识符
  • scenario_id:场景编号(1、2或3)
  • scenario_label:场景可读标签
  • turn:谈判轮次(1至4)
  • represented_party:模型所代表的当事方(如AgentCo、LargeCo、GiantCo)
  • counterparty:对手方
  • rubric_variant:律师撰写的评估标准变体
  • instruction_preview:任务指令的前500个字符预览
  • rubric_count:评估标准准则数量
  • rubric_category_counts:五个评估维度的准则数量分布
  • rubric_criteria_preview:前五条评估标准预览
  • contract_path:起始合同文件路径
  • rubrics_path:评估标准文件路径
  • attorney_redline_doc_path:黄金标准修改文档路径(两个接受任务为null)
  • source_task_path:完整任务包的根路径

评分体系

Senior技术交易律师在每次谈判中实时编写评估标准,每条标准包含:

  • 内容:应该被评估的具体要点
  • 重要性:解释为什么重要
  • 权重:从 -10到10 的数值(反映重要性和方向)
  • 所属评估维度:映射到五个维度之一

得分通过加权通过率计算,由LLM评审小组汇总。

评估维度及权重分布

维度 占比 惩罚行为描述
商业背景(Commercial context) 33.4% 违反明确的商业指令(如预算上限、上线日期、交易破裂点);提出超出既定保护线的后备方案
法律正确性(Legal correctness) 25.7% 法律表述错误;引入不可执行的语言;在合同其他部分产生歧义或冲突
谈判质量(Negotiation quality) 17.0% 相对于杠杆和阶段而言过度或不足的侵略性;过早放弃关键条款;过度强调非实质性问题;遗漏权衡
交易成交导向(Deal-closing orientation) 13.7% 过度追求“赢”每个条款而非促成成交;因微小、低影响的修改而延长标记工作
对手接受度预测(Counterparty-acceptance prediction) 10.2% 提出明显的难以接受方案;未能识别已有利的语言;未经合理理由接受极端立场

评分机制与排行榜

  • 得分计算:每个任务的得分通过公式 clamp((earned − penalty) / total_positive) 计算,基于加权评估标准裁决。
  • 汇总方式:先在同一输入组内平均得分,再将12个(场景×轮次)单元格等权平均。
  • 排行榜:已在Hugging Face注册为基准测试(eval.yaml),提供名为 redline_overall 的总排行榜,评分范围为 0–100 分。

其他信息

  • 环境设置:每个任务提供一个沙箱环境,包含只读输入区(技能文件、背景文件、源合同)、读写工具表面(包含5个JSON格式工具:文档读取、批量修改提议、添加评论、标记保留区域、结束会话)以及只写输出区(生成修改后的contract.docx)。
  • 匿名化:所有数据均为合成数据,当事方名称均为虚构,联系信息及文档元数据已清理,不含真实个人身份信息或客户材料。
  • 使用方式:可通过 pip install -e .uv tool install harbor 安装后,使用 redlinebench-reproduce 命令复现结果。
搜集汇总
数据集介绍
RedlineBench 数据集图片
构建方式
RedlineBench的构建根植于真实的法律谈判实践,通过模拟三家科技公司之间一系列多轮SaaS和专业服务主协议的谈判场景,构建了140个可运行的Harbor任务。每个任务包含完整的谈判状态,包括律师简报、环境配置(含待修订的合同文档、剧本和商业背景)以及评分测试文件。评分测试文件由资深交易律师实时撰写,包含了针对每个回合关键修改点的加权通过/失败标准,其中138个任务还提供了专家黄金修订文档作为基准。数据集通过交替谈判角色和变化初始模板,系统性地覆盖了从标准模板审查到高 stakes 交易谈判的多样性。
特点
该数据集最显著的特点是其全面且多维度的评估体系,从商业背景一致性、法律正确性、谈判质量、交易促成导向以及对手方接受度预测五个维度对模型输出进行评分,其中商业背景和法律正确性占据了近60%的权重。数据集的另一独特之处在于其设计反映了真实的修订工作流:模型需要产生包含原生修订标记和评论的Word文档,并使用由多名律师独立编写的评分标准进行评估,从而降低对单一专家偏好的依赖。此外,所有材料均为合成数据,确保不包含真实个人信息或客户信息,符合隐私保护要求。
使用方法
使用者可以通过安装提供的Python包和Harbor框架工具来运行RedlineBench。具体而言,执行命令行redlinebench-reproduce并指定目标AI代理和模型,系统会自动下载数据集并在沙盒环境中执行任务。每个任务要求AI代理在只读输入(技能文件、背景文档、当前合同状态)的基础上,通过一系列工具接口(如读取文档、提出修订、添加评论、标记保留段落和最终化)对合同文档进行修订,最终生成带有修订标记的Word文档。评分过程由LLM评委面板依据律师编写的加权标准自动完成,最终结果以0-100分的综合得分形式呈现在Hugging Face排行榜上。
背景与挑战
背景概述
RedlineBench 由 Crosby Legal 与 micro1 于 2025 年联合创建,专注于合同谈判中人工智能代理的评估问题。在传统法律人工智能基准多聚焦于静态条款分类的背景下,该数据集首创性地将合同标注(redlining)建模为多轮决策序列,而非孤立的编辑集合。研究团队基于真实 SaaS 交易场景,设计了三项涵盖双方缔约立场交替的谈判情境,并邀请资深交易律师实时撰写评判准则与专家标注样本,从法律正确性、商业一致性、谈判质量、对方接受度预测及交易促成导向五个维度对模型表现进行系统度量。该工作对法律人工智能领域产生了显著影响,推动了从文本解析向动态谈判推理的范式转变。
当前挑战
RedlineBench 所解决的领域核心挑战在于,现有评测体系无法捕捉合同谈判的递进性与策略性——传统方法仅评估单一文本修改的合规性,而忽视了对谈判态势的理解、对方心理的预判以及交易闭环的权衡。在构建过程中,团队面临多重困难:需要模拟律师在真实谈判中“何为重要批注”的直觉判断,并通过加权评分体系量化不同条款的博弈优先级;必须确保每轮谈判输入文档的演化状态与上下文衔接的连贯性;此外,设计135个可运行任务及其对应的专家标注、教练手册与评估准则,要求对复杂商业条款进行结构化抽象与人工审核的双重投入,工作量与质量控制难度均极为突出。
常用场景
经典使用场景
在合同谈判与法律科技的交汇地带,RedlineBench被设计为一项衡量人工智能代理在真实法律工作流中执行合同修订能力的基准测试。其经典使用场景在于模拟多轮次合同谈判中的逐条修订过程,代理需要基于提供的商业背景、谈判策略手册以及当前版本的合同文档,以原生Word文档格式生成带修订标记和批注的修改稿。数据集覆盖了三组复杂的企业级软件即服务主服务协议谈判场景,包含从初始草案审查到最终条款接受的完整谈判周期,特别强调在交替回合中代理需根据对方立场动态调整修订策略。这一设计使得研究人员能够将合同修订这一高度专业化的法律任务从非结构化的文本生成问题转化为可量化评估的多步决策过程。
衍生相关工作
围绕RedlineBench已衍生出一系列推动法律人工智能边界拓展的经典工作,这些工作主要聚焦于评估框架的深化与代理能力的提升。该数据集本身作为Hugging Face平台上的基准测试,催生了专门的评测排行榜,吸引研究社区开发适配合同修订任务的大语言模型推理策略。基于其任务设计,后续工作探索了将检索增强生成技术用于动态获取谈判相关的法律先例和行业标准,以及利用多代理辩论机制模拟谈判双方的真实互动。此外,该数据集所公开的评估方法论和复现代码库,为后续构建更大规模、覆盖更多合同类型的法律领域基准提供了可复用的技术架构。这些衍生工作共同构成了一个从评测到改进的闭环,持续推动合同自动化领域从理论验证向实际部署迈进。
数据集最近研究
最新研究方向
RedlineBench数据集聚焦于合同谈判智能化这一前沿方向,通过构建多轮次、多视角的合同红线条目模拟环境,精准评估AI代理在复杂法律谈判中的综合能力。该基准涵盖140个任务,基于真实SaaS交易场景与律师撰写的评分标准,从法律正确性、商业契合度、谈判质量、对方接受度预测及交易完成导向五个维度进行系统性衡量。这一研究方向回应了生成式AI在法律实务中从文档处理向决策辅助升级的迫切需求,尤其强调了合同修订的序列化判断特性,而非孤立的条款编辑,为法律科技领域提供了更具生态效度的评估范式。其发布的公开报告与开源工具链,标志着合同自动化评估从理论探讨迈向可复现的实证阶段,具有推动法律AI可信落地的里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务