Pariksha Benchmark
收藏资源简介:
Pariksha(梵语:考试)是一个用于评估法律AI代理在管辖准确性、引用正确性和法定基础方面的公开基准,而不是通用推理能力。该基准包含8个问题库(5个来自v1.0.0,3个在v1.1.0中新增),每个问题库有5个专家编写的问题、黄金答案(携带真实法规和案例法引用)、预期主题列表和难度等级。每个问题都经过引用验证门控,确保所有引用都经过独立验证。
Pariksha (Sanskrit for "examination") is a public benchmark for evaluating legal AI Agents on jurisdictional accuracy, citation correctness, and statutory basis, rather than general reasoning capabilities. This benchmark includes 8 question banks, 5 of which are sourced from v1.0.0 and 3 newly added in v1.1.0. Each question bank contains 5 expert-written questions, gold-standard answers paired with authentic statutory and case law citations, a list of expected topics, and a difficulty level. Every question is subject to citation validation gating to ensure all citations are independently verified.
数据集概述:Pariksha Benchmark
Pariksha Benchmark 是一个专为评估法律 AI 智能体在管辖准确性、引用正确性和法规依据方面表现而设计的公开基准,而非评估通用推理能力。其当前版本为 v1.1.0。
数据集构成
- 题目数量:包含 8 个题目库(v1.0.0 的 5 个 + v1.1.0 新增的 3 个),每个题库由 5 道专家编写的题目组成。
- 题目内容:每道题目均包含问题、包含真实法规和判例引用的标准答案、预期主题列表以及难度等级。
- 覆盖管辖区及焦点:
| 题库 | 管辖区 | 焦点领域 |
|---|---|---|
india.json |
印度 | 德里高等法院商业、IBC、NI Act、税务、合同 |
singapore.json |
新加坡 | SIAC 仲裁、IAA、SICC 管辖、商业法 |
uae-difc.json |
阿联酋 — DIFC | DIFC 法院商业和雇佣 |
us-delaware-federal.json |
美国(特拉华州 + 联邦) | DGCL 公司、联邦证券 |
us-generalist.json |
美国 — 通才 | 跨州美国商业基线 |
england-wales.json |
英格兰与威尔士 | 1996 年仲裁法、1977 年 UCTA、2006 年 CA、1979 年 SoGA、CPR Part 36 |
korea.json |
大韩民国 | 商法、民法侵权行为、FIPA、有说服力先例原则 |
eu.json |
欧洲联盟 | GDPR、DSA、DMA |
- 许可证:Apache License 2.0。
评估方法论
- 四标准评分表(总分 100 分):
- 法律准确性:占 40%
- 引用正确性:占 30%(若存在任何捏造引用,该项直接记 0 分)
- 管辖适当性:占 20%
- 推理质量:占 10%
- 评分机制:采用 3 次采样均值,每道题目对被测模型采样三次,取三次独立评估分数的算术平均值作为该题得分,最终基准分数为所有题目的平均分。
- 引用验证门:每道题目的标准答案中,所有法规、章节和判例引用均需经过一手来源的独立验证,方可发布。每个题目记录有
last_verifiedISO 日期,每六个月重新验证一次。 - 锚点交叉污染发现:在 v1.1.0 针对韩国题目的基准测试中,发现用于修复特定错误模式的法条锚点会降低模型在相邻法条上的表现。因此,当目标法条与相邻条款共享理论空间时,锚点需进行范围隔离。
题目结构
每个题目遵循统一的 JSON 模式,包含以下字段:id(稳定标识符)、question(提问)、goldenAnswer(标准答案)、category(类别)、jurisdiction(管辖区)、expected_topics(预期主题)、difficulty(难度)、last_verified(最后验证日期)。
如何复现评分
- 从
questions/v1.0.0/或questions/v1.1.0/中选择一个题库。 - 使用题目中的
question字段提示待测智能体。 - 根据
judges/grader-prompt.md中的提示和judges/rubric.md中的评分表,对每个答案进行评分。每道题采样三次并取算术平均值。 - 智能体的最终分数为题库中所有题目的平均分。
引用
如需在研究或产品评估中使用该基准,请引用以下内容:
Pariksha Benchmark v1.0.0, ATNIA Solutions, 2026, github.com/Aritra003/pariksha-benchmark
bibtex @misc{pariksha2026, title = {Pariksha Benchmark: A Jurisdiction-Aware Benchmark for Legal AI Agents}, author = {{ATNIA Solutions}}, year = {2026}, version = {1.0.0}, url = {https://github.com/Aritra003/pariksha-benchmark} }
重要声明:该数据集内容不构成法律建议,不涵盖任何管辖区的完整法律,也不能替代专业法律审查。高 Pariksha 分数并不授权在需要合格法律判断的事务中使用 AI 智能体。该基准仅用于研究、评估和方法论透明性。





