PLAWBENCH
收藏资源简介:
PLAWBENCH是由阿里巴巴集团等机构联合构建的实用法律评测基准,旨在模拟真实法律工作流程中的复杂性和模糊性。该数据集包含850个问题,覆盖公共法律咨询、实际案例分析和法律文件生成三大任务类型,数据来源于多源法律数据库和专家标注,并通过细粒度评估细则(约12,500条)量化模型表现。其构建过程强调对法律推理步骤的拆解和任务特异性设计,适用于评估大语言模型在法律问题识别、事实澄清、结构化推理及专业文档生成等核心能力,为解决当前法律AI在真实场景中适应性不足的问题提供了标准化评测工具。
PLAWBENCH is a practical legal evaluation benchmark jointly constructed by Alibaba Group and other institutions. It is designed to simulate the complexity and ambiguity inherent in real-world legal work workflows. This dataset includes 850 questions covering three core task categories: public legal consultation, practical case analysis, and legal document generation. Its data is sourced from multi-source legal databases and expert annotations, and model performance is quantified using approximately 12,500 fine-grained evaluation criteria. The development process of PLAWBENCH emphasizes the decomposition of legal reasoning steps and task-specific design. It is suitable for evaluating key capabilities of Large Language Models (LLMs), such as legal problem identification, fact clarification, structured reasoning, and professional document generation, thus providing a standardized evaluation tool to address the issue of insufficient real-world adaptability of current legal AI systems.
PLawbench 数据集概述
数据集简介
PLawbench 是一个基于量规的基准测试,旨在评估大语言模型在法律实践中的性能。它包含三项法律任务:法律咨询、案件分析和法律文书起草,涵盖个人事务、婚姻家庭法、知识产权、刑事诉讼等多种现实法律领域。
数据集构成
数据集由以下文件组成:
- practical_case_analysis_250.jsonl:包含案件分析问题。共开源250个问题,包括问题、参考答案、评分量规和评分表。
- public_legal_consultation_18.json:包含法律咨询问题。共开源18个问题,包括咨询场景和评分量规。
- Defendants_Statement.json 和 Plantiffs_Statement.json:分别为起草答辩状和起诉书的法律文书撰写任务。共开源12个问题,包括撰写场景和评分量规。
任务描述
- 公共法律咨询任务:模拟律师与客户之间的互动,测试模型能否正确理解用户的法律需求,并识别和引出当事人未披露的关键事实。
- 案件分析任务:每个案例结构分为结论、法律事实、推理和法律条文四部分,并为每个部分设计了专门的量规。对于选定的问题,进一步指定了特定的法律推理路径,以评估模型在现实案例中进行结构化、合理法律推理的能力。
- 法律文书起草任务:要求模型根据提供的场景生成法律文书(如起诉状、答辩状),旨在评估模型在法律专业写作方面的熟练程度。
主要贡献
- 更真实地模拟法律实践:忠实模拟现实世界的法律实践场景,所有任务均改编自真实案例。基准测试将法律任务组织为公共法律咨询、实践案例分析和法律文书生成三个层次,反映了法律从业者的完整工作流程。
- 细粒度推理步骤:在任务设计和评估中明确纳入细粒度的法律推理步骤,以检验大语言模型能否执行多阶段法律推理。
- 任务特定量规:采用由法律专家标注的个性化、任务特定的量规进行评估,超越纯粹基于结果或形式的指标,以评估实质性的法律推理和决策过程。
模型性能排名(部分摘要)
下表展示了部分模型在基准测试中的综合与分项表现:
| 系列 | 模型 | 综合得分 | 任务2-平均 | 任务2-结论 | 任务2-事实 | 任务2-推理 | 任务2-法条 | 任务1 | 任务3-平均 | 任务3-原告 | 任务3-被告 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT | GPT-5.2-1211-global | 69.67 | 66.37 | 69.93 | 88.26 | 60.38 | 48.59 | 79.57 | 68.58 | 58.25 | 63.42 |
| Claude | Claude-opus-4-5-20251101 | 66.47 | 68.00 | 69.82 | 83.61 | 65.49 | 53.61 | 68.92 | 62.27 | 56.54 | 68.01 |
| Gemini | Gemini-3.0-pro-preview | 66.35 | 64.95 | 72.03 | 77.79 | 65.00 | 46.42 | 70.17 | 66.13 | 63.84 | 68.42 |
| Qwen | Qwen3-235b-a22b-instruct-2507 | 63.08 | 65.57 | 64.34 | 91.90 | 60.07 | 42.52 | 67.79 | 55.78 | 42.04 | 69.51 |
注:
- 任务1:公共法律咨询。
- 任务2:案件分析(包含结论、事实、推理、法条四个子项)。
- 任务3:法律文书起草(包含原告、被告两个子项)。

- 1PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice阿里巴巴集团; 清华大学; 上海交通大学; 滑铁卢大学; 匹兹堡大学; 博洛尼亚大学 · 2026年



