遇见数据集

ZhiFa-Bench

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

ZhiFa-Bench 是一套面向中文法律场景的开源评测基准,服务于“智法AI”评测体系,旨在评估中文法律人工智能模型在法律问答、合同审查和案情预测三大任务上的综合能力。该基准覆盖17个子任务,总计约3,770条样本,具体包括:法律问答模块(10个子任务,2,300条),分为记忆、理解、应用三个递进层次,涵盖法条事实查询、法律知识选择题、法条背诵、阅读理解、论点理解、争议焦点识别、案情摘要、咨询事实追问、案情分析和法律文书生成;合同审查模块(3个子任务,320条),包括条款纠错、合同风险检测与修订建议;案情预测模块(4个子任务,1,150条),包括法条预测、罪名预测、刑期预测和综合判决预测。每个子任务设计有standard(常规)、challenge(难例)和adversarial(反例)三种难度,以充分评估模型的能力边界。评估方式采用客观指标(如Accuracy、F1、EM、Rouge-L等)和LLM-as-Judge的结构化Rubric评分,从事实准确性、法条引用正确性、证据可追溯性、法律推理逻辑性、完整性、安全合规性和用户可理解性7个维度进行评测。数据来源包括CAIL系列、JEC_QA、裁判文书网等公开数据集的整理改编,以及项目组自行构造的评测样本和评分标准。所有数据均经过多重校验,确保质量。本基准仅用于学术研究。

创建时间:
2026-09-08
搜集汇总
数据集介绍
ZhiFa-Bench 数据集图片
构建方式
在中文法律人工智能评测资源相对匮乏的背景下,ZhiFa-Bench 以已有开源数据的整理清洗为基底,融合项目组自行构造的评测样本与评分标准,形成覆盖法律问答、合同审查、案情预测三大模块共17个子任务的基准体系。法律问答部分的数据主要改编自 CAIL 系列、JEC_QA、LawRefBook、LAIC2021 等公开数据集,合同审查与案情分析、咨询追问、文书生成等开放式任务则因缺乏现成带标注数据而完全自行构造。构造过程采用 LLM 生成与人工审核相结合的方式,并引入三重校验机制——以不同模型进行交叉校验、以规则核验分值一致性与字段完整性、由人工核查法律准确性与评分可操作性,从而确保每条样本与评分标准均具备可靠的质量保障。
特点
ZhiFa-Bench 的显著特征在于其遵循 Bloom 认知分类学,将法律问答能力拆解为记忆、理解、应用三个递进层次,逐级检验模型从知识召回、语义理解到实务推理的完整能力链。该基准不仅设有常规的 standard 样本,还针对部分子任务额外构建了 challenge 难例与 adversarial 反例两档样本,分别用于考察深层法律推理能力与对貌似正确内容的辨识能力。评测体系兼顾规则精确匹配、NLI 蕴含检测等客观指标与 LLM-as-Judge 结构化 Rubric 主观评分,并围绕事实准确性、法条引用正确性、证据可追溯性、法律推理逻辑性、完整性、安全合规性、用户可理解性七个维度展开,涵盖民事、刑事、行政等主要法律领域,兼具广度与深度。
使用方法
使用者可通过 HuggingFace datasets 库以配置名称直接加载各子任务数据,例如指定 factual_query、legal_knowledge_mcqa 或 comprehensive_judgment_prediction 等 config,并按 standard、challenge、adversarial 划分选取所需样本。数据格式依据任务类型而异:客观评分任务采用含 instruction、question、answer 的通用问答格式;开放式生成任务则提供结构化的 Rubric 评分标准,包含模块划分、分值分配、评估维度及三级评分细则,供 LLM-as-Judge 逐项评分。模型输出后,可由评测方按对应指标计算 Accuracy、F1、Rouge-L 等客观得分,或依据 Rubric 对事实准确性、法律推理逻辑性等维度进行主观评分,从而获得多维度的能力画像。
背景与挑战
背景概述
随着人工智能技术向法律垂直领域的渗透,中文法律智能评测长期面临资源匮乏的困境。在此背景下,智法AI团队于近年构建了ZhiFa-Bench评测基准。该基准依托CAIL系列、JEC_QA、裁判文书网等公开数据,并参考LawBench、PLawBench等已有工作,系统性地覆盖法律问答、合同审查与案情预测三大模块,共17个子任务。其核心研究问题在于如何从记忆、理解到应用的多层次认知维度,全面评估法律大模型的真实能力边界,填补了中文法律领域尤其是合同审查与文书生成方向缺乏公开标注评测数据的空白,为后续研究提供了可复用的标准化评估框架。
当前挑战
ZhiFa-Bench所应对的领域问题具有显著复杂性。法律问答要求模型在事实准确性、法条引用与推理逻辑之间保持高度一致,而案情预测则需在罪名、法条与刑期等多标签间实现精准映射。构建过程中的挑战同样严峻:中文法律场景公开标注数据稀缺,合同风险与文书生成等任务缺乏现成Rubric,需自行构造并设计多维度评分标准。为区分模型能力层次,基准额外构建了挑战样本与对抗样本,前者要求更深层的法律推理,后者检验模型对“貌似正确”答案的辨识能力。此外,开放式生成任务的自动评分依赖LLM-as-Judge与结构化Rubric,如何确保评分标准的法律准确性与可操作性,亦是构建中需持续攻克的关键难题。
常用场景
经典使用场景
在中文法律人工智能的评测实践中,ZhiFa-Bench构成了面向法律问答、合同审查与案情预测三大领域的综合性基准。该数据集经典使用场景在于,通过记忆、理解、应用三个递进层次评估模型的法律能力,涵盖法条事实查询、法律知识选择题、争议焦点识别、案情摘要、法律文书生成等十七项子任务,并借助客观指标与LLM-as-Judge结构化评分相结合的方式,对模型的事实准确性、法条引用正确性、证据可追溯性、法律推理逻辑性、完整性、安全合规性及用户可理解性七个维度进行系统考量。
解决学术问题
针对中文法律领域开源评测资源稀缺、合同审查与法律文书生成等方向缺乏公开标注数据的困境,ZhiFa-Bench通过整合CAIL系列、JEC_QA、裁判文书网等公开数据集,并自行构造缺失的评测样本与评分标准,弥补了既有基准在开放性生成任务、对抗性样本和难例设计方面的空白。其以Bloom认知分类学为框架的能力分层设计,为衡量法律AI从知识召回到实务推理的完整能力链提供了可复现的学术标尺,对推动法律智能评价体系的规范化具有积极意义。
衍生相关工作
ZhiFa-Bench的构建过程与评测框架设计借鉴了LawBench、PLawBench、Legal-Eval等已有基准的工作,同时整合了CAIL2018、CAIL2019、CAIL2021、CAIL2022系列评测数据以及JEC_QA、CrimeKgAssitant等公开资源。围绕该基准,相关衍生工作涉及难例与对抗性样本的构造方法、基于结构化Rubric的LLM-as-Judge评分机制、以及面向合同风险清单与法律文书生成的多维度评价体系,为后续中文法律评测研究提供了可扩展的参考范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务