RedlineBench
收藏资源简介:
RedlineBench是一个用于AI合同修订的基准测试数据集,它通过模拟真实的SaaS交易和律师生成的关键修订决策解释,捕获多轮修订工作流程,并评估模型在五个维度上的表现:法律正确性、商业对齐、谈判质量、对手接受预测和交易完成导向。数据集包含140个可运行任务,覆盖3个场景,每个场景代表供应商与企业客户之间的完整多轮谈判,任务涉及4个谈判轮次,测试模型在合同修订中的法律判断、谈判技巧、文档机制和沟通能力。
RedlineBench is a benchmark dataset for AI-powered contract revision. It captures multi-round contract revision workflows by simulating real SaaS transactions and key revision decision explanations generated by lawyers, and evaluates model performance across five dimensions: legal correctness, business alignment, negotiation quality, opponent acceptance prediction, and transaction completion orientation. The dataset contains 140 runnable tasks covering 3 scenarios, where each scenario represents a complete multi-round negotiation between a vendor and an enterprise customer. Each task involves 4 negotiation rounds, and tests the model's legal judgment, negotiation skills, document mechanism capabilities, and communication proficiency in contract revision.
数据集概述:RedlineBench
RedlineBench(Crosby–micro1 RedlineBench)是一个专注于衡量AI代理在合同谈判中执行红线性修订(redlining) 能力的基准测试。它模拟真实的SaaS交易场景,将合同谈判视为一系列基于法律判断的商业决策,而非孤立的条款编辑。
- 核心目标:评估AI代理是否能像真实律师一样,生成包含原生跟踪修订和边栏评论的Word
.docx文件,并根据律师编写的评分标准进行评判。
评估维度
该基准从五个维度对模型进行评估:
- 商业契合度(Commercial context): 占比33.4%。评估是否违反明确的商业指令(如预算上限、上线日期、交易决定性条款)。
- 法律正确性(Legal correctness): 占比25.7%。评估是否存在法律表述错误、引入不可执行的措辞或造成合同冲突。
- 谈判质量(Negotiation quality): 占比17.0%。评估在给定的谈判地位和阶段下,是否过于激进或保守,轻易让步或过度纠缠无关紧要的问题。
- 交易促成导向(Deal-closing orientation): 占比13.7%。评估是否追求在所有条款上“获胜”而忽视促成交易,有无过多低影响修订。
- 对手方接受度预测(Counterparty-acceptance prediction): 占比10.2%。评估是否提出了明显不可行的方案,未能识别已有利的措辞,或无故接受极端立场。
数据集结构
- 总任务数: 140个独立任务。
- 场景: 基于3个完整的多轮谈判场景,涉及供应商(AgentCo, 一家AI招聘平台公司)和企业客户之间的合同谈判。
| 场景 | 描述 | 任务数 |
|---|---|---|
| 1 | 供应商主导的SaaS MSA:AgentCo 首先对 LargeCo 的模板进行标记。 | 50 |
| 2 | 客户主导的SaaS MSA:LargeCo 首先起草标记。 | 40 |
| 3 | 专业服务MSA:AgentCo 在 GiantCo 的采购模板上进行操作。 | 50 |
- 谈判轮次: 覆盖4轮谈判。第1轮为对初始模板的初次标记;第2-4轮为回应轮次,代理需要分类并回应对方的所有现有修订和评论。
- 任务分组: 任务名称编码其所在谈判树节点(如
redline-s1-t1-g01a)。属于同一输入组(如g01a,g01b,g01c)的任务,AI面对完全相同的输入,但由不同律师的评分标准进行评判,以衡量多专家下的表现。
代理环境与工具
- 环境三要素:
- 只读输入: 任务说明、背景文件(己方剧本和共享商业背景)、源合同(模板或带有跟踪修订的草稿)。
- 工具接口: 内置的
contract-redliner技能。 - 只写输出: 代理需在
/output/contract.docx中生成带有跟踪修订和评论的最终文档。
- 核心技能:
contract-redliner技能包含四个Python脚本,用于:将合同渲染为带段落ID和修订摘要的Markdown、批量应用带评论的跟踪修订(替换/删除/插入)、添加评论和线程回复、以及执行章节删除并保留编号。
任务评分机制
- 有效性验证: 输出必须是一个可加载的
.docx文件,并包含至少一个归属于代理的跟踪修订或评论。 - LLM评判: 输出的修订版合同被渲染为带注释视图,并由一个3裁判小组(由
gpt-5.4-mini,claude-haiku-4-5,gemini-3.1-flash-lite三个模型构成、与被评测模型不同家族)根据权重为1-10的评分标准(rubrics)进行PASS/FAIL判定。部分标准带有负权重(惩罚不良编辑)。 - 最终得分:
reward = clamp(Σ earned − Σ penalties, 0, Σ positive weights) / Σ positive weights,分值范围为[0, 1]。 - 基准集计分: 先计算每个输入组内任务得分的平均值,再计算各组平均值的均值,并按轮次、代理方和场景进行细分。
数据获取与复现
- 数据位置: 数据集托管在 HuggingFace 上,地址为
crosbylegal/RedlineBench,不直接提交在GitHub仓库中。 - 复现命令: 通过安装Harbor并配置相关API密钥后,可使用
redlinebench-reproduce命令一键运行完整基准测试(下载任务、运行代理、评判、评分)。
许可信息
- 代码: MIT 许可 (© 2026 Crosby Legal)。
- 数据集: CC-BY-4.0 许可。





