RedlineBench
收藏资源简介:
RedlineBench是一个专门用于评估AI代理在合同谈判(红批)任务中表现的基准数据集。它通过模拟真实的SaaS(软件即服务)交易和专业服务主协议(MSA)谈判,构建了多轮红批工作流程,旨在衡量AI模型如何像真实律师一样处理合同谈判——即在Word文档(.docx)中生成带有跟踪更改和线程评论的实际红批。数据集包含140个可运行任务,覆盖三个不同的谈判场景:两个SaaS MSA场景和一个专业服务MSA场景,每个场景进行四轮交替谈判。每个任务都是一个完整的谈判单元,包括任务配置、律师指令、待红批的合同文档、商业背景资料和特定方剧本、律师编写的加权评分标准(rubrics),以及作为专家基准的律师红批文档(138个任务提供)。数据集通过五个核心维度评估模型表现:法律正确性(占评分标准的25.7%)、商业一致性(33.4%)、谈判质量(17.0%)、对方接受度预测(10.2%)和交易达成导向(13.7%)。评分基于资深技术交易律师实时编写的评分标准,由LLM评审团执行。数据集中的所有材料均为合成数据,不包含真实个人身份信息或客户材料。该数据集适用于文本生成任务,特别是法律领域的合同谈判和红批自动化评估。
RedlineBench is a benchmark dataset specifically designed to evaluate the performance of AI agents in contract negotiation (redlining) tasks. It simulates real-world SaaS (Software as a Service) transactions and professional services master agreement (MSA) negotiations, constructing multi-round redlining workflows to measure how AI models handle contract negotiations like real lawyers—i.e., generating actual redlines with track changes and threaded comments in Word documents (.docx). The dataset includes 140 executable tasks covering three distinct negotiation scenarios: two SaaS MSA scenarios and one professional services MSA scenario, each conducted over four alternating rounds. Each task is a complete negotiation unit, comprising task configurations, lawyer instructions, contract documents to be redlined, business background materials and specific party scripts, lawyer-authored weighted scoring rubrics, and lawyer-redlined documents as expert benchmarks (provided for 138 tasks). Model performance is evaluated across five core dimensions: legal correctness (25.7% of the scoring rubric), business alignment (33.4%), negotiation quality (17.0%), counterparty acceptance prediction (10.2%), and deal-closing orientation (13.7%). Scoring is based on rubrics written in real-time by senior technology transactions lawyers and executed by an LLM jury. All materials in the dataset are synthetic and do not contain real personal identity information or client materials. This dataset is suitable for text generation tasks, particularly in the legal domain for contract negotiation and redlining automation assessment.
数据集概述:RedlineBench
RedlineBench(全称 Crosby–micro1 RedlineBench)是一个专注于合同谈判评估的基准测试数据集,旨在衡量AI代理在模拟合同谈判流程中的表现,而非仅评估独立的条款编辑。该数据集由法律专家生成,面向单语言(英语)文本生成任务,类别为基准测试(benchmark),数据规模小于1000条。
- 许可证:CC-BY-4.0
- 发布时间:2025年3月
- 关联资料:
- 发布报告:https://intelligence.crosby.ai/benchmark
- 代码与复现工具:https://github.com/crosbylegal/redline-bench
数据内容与结构
- 样本数量:共 140个可执行任务(基于Harbor框架),覆盖3个多轮谈判场景,包含4个交替轮次。
- 任务标识格式:
redline-s{场景}-t{轮次}-g{组别}{变体},编码了谈判树结构。 - 场景描述:所有场景均围绕了一家名为AgentCo的A轮HR科技公司展开,涉及SaaS(软件即服务)服务协议和专业服务协议的模拟谈判。三个场景分别为:
- 场景1(占39.2%):AgentCo审阅LargeCo的SaaS模板并发起首次修改;
- 场景2(占28.6%):AgentCo发送自己的模板,LargeCo发起首次修改;
- 场景3(占32.3%):AgentCo与GiantCo的“必须赢”重要交易,需要将专业服务协议适配为SaaS协议且避免过度修改。
- 每任务布局:每个任务包含配置文件、律师简报(instruction.md)、环境设置(Dockerfile、待修改的合同文件contract.docx、背景资料等)、以及测试文件夹(包含律师编写的评估标准rubrics.json、评分脚本judge.py和专家修改的黄金文档attorney_redlines.docx,其中138/140个任务提供黄金标准)。
数据字段(数据集查看器列)
数据集以Hugging Face Dataset格式提供,包含以下关键字段:
- task_id:标准任务标识符
- scenario_id:场景编号(1、2或3)
- scenario_label:场景可读标签
- turn:谈判轮次(1至4)
- represented_party:模型所代表的当事方(如AgentCo、LargeCo、GiantCo)
- counterparty:对手方
- rubric_variant:律师撰写的评估标准变体
- instruction_preview:任务指令的前500个字符预览
- rubric_count:评估标准准则数量
- rubric_category_counts:五个评估维度的准则数量分布
- rubric_criteria_preview:前五条评估标准预览
- contract_path:起始合同文件路径
- rubrics_path:评估标准文件路径
- attorney_redline_doc_path:黄金标准修改文档路径(两个接受任务为null)
- source_task_path:完整任务包的根路径
评分体系
Senior技术交易律师在每次谈判中实时编写评估标准,每条标准包含:
- 内容:应该被评估的具体要点
- 重要性:解释为什么重要
- 权重:从 -10到10 的数值(反映重要性和方向)
- 所属评估维度:映射到五个维度之一
得分通过加权通过率计算,由LLM评审小组汇总。
评估维度及权重分布
| 维度 | 占比 | 惩罚行为描述 |
|---|---|---|
| 商业背景(Commercial context) | 33.4% | 违反明确的商业指令(如预算上限、上线日期、交易破裂点);提出超出既定保护线的后备方案 |
| 法律正确性(Legal correctness) | 25.7% | 法律表述错误;引入不可执行的语言;在合同其他部分产生歧义或冲突 |
| 谈判质量(Negotiation quality) | 17.0% | 相对于杠杆和阶段而言过度或不足的侵略性;过早放弃关键条款;过度强调非实质性问题;遗漏权衡 |
| 交易成交导向(Deal-closing orientation) | 13.7% | 过度追求“赢”每个条款而非促成成交;因微小、低影响的修改而延长标记工作 |
| 对手接受度预测(Counterparty-acceptance prediction) | 10.2% | 提出明显的难以接受方案;未能识别已有利的语言;未经合理理由接受极端立场 |
评分机制与排行榜
- 得分计算:每个任务的得分通过公式
clamp((earned − penalty) / total_positive)计算,基于加权评估标准裁决。 - 汇总方式:先在同一输入组内平均得分,再将12个(场景×轮次)单元格等权平均。
- 排行榜:已在Hugging Face注册为基准测试(
eval.yaml),提供名为redline_overall的总排行榜,评分范围为 0–100 分。
其他信息
- 环境设置:每个任务提供一个沙箱环境,包含只读输入区(技能文件、背景文件、源合同)、读写工具表面(包含5个JSON格式工具:文档读取、批量修改提议、添加评论、标记保留区域、结束会话)以及只写输出区(生成修改后的contract.docx)。
- 匿名化:所有数据均为合成数据,当事方名称均为虚构,联系信息及文档元数据已清理,不含真实个人身份信息或客户材料。
- 使用方式:可通过
pip install -e .和uv tool install harbor安装后,使用redlinebench-reproduce命令复现结果。




