遇见数据集

Pariksha Benchmark

收藏
github2026-05-31 更新2026-06-07 收录
官方服务:

资源简介:

Pariksha(梵语:考试)是一个用于评估法律AI代理在管辖准确性、引用正确性和法定基础方面的公开基准,而不是通用推理能力。该基准包含8个问题库(5个来自v1.0.0,3个在v1.1.0中新增),每个问题库有5个专家编写的问题、黄金答案(携带真实法规和案例法引用)、预期主题列表和难度等级。每个问题都经过引用验证门控,确保所有引用都经过独立验证。

Pariksha (Sanskrit for "examination") is a public benchmark for evaluating legal AI Agents on jurisdictional accuracy, citation correctness, and statutory basis, rather than general reasoning capabilities. This benchmark includes 8 question banks, 5 of which are sourced from v1.0.0 and 3 newly added in v1.1.0. Each question bank contains 5 expert-written questions, gold-standard answers paired with authentic statutory and case law citations, a list of expected topics, and a difficulty level. Every question is subject to citation validation gating to ensure all citations are independently verified.

创建时间:
2026-05-30
原始信息汇总

数据集概述:Pariksha Benchmark

Pariksha Benchmark 是一个专为评估法律 AI 智能体在管辖准确性引用正确性法规依据方面表现而设计的公开基准,而非评估通用推理能力。其当前版本为 v1.1.0。

数据集构成

  • 题目数量:包含 8 个题目库(v1.0.0 的 5 个 + v1.1.0 新增的 3 个),每个题库由 5 道专家编写的题目组成。
  • 题目内容:每道题目均包含问题、包含真实法规和判例引用的标准答案、预期主题列表以及难度等级。
  • 覆盖管辖区及焦点
题库 管辖区 焦点领域
india.json 印度 德里高等法院商业、IBC、NI Act、税务、合同
singapore.json 新加坡 SIAC 仲裁、IAA、SICC 管辖、商业法
uae-difc.json 阿联酋 — DIFC DIFC 法院商业和雇佣
us-delaware-federal.json 美国(特拉华州 + 联邦) DGCL 公司、联邦证券
us-generalist.json 美国 — 通才 跨州美国商业基线
england-wales.json 英格兰与威尔士 1996 年仲裁法、1977 年 UCTA、2006 年 CA、1979 年 SoGA、CPR Part 36
korea.json 大韩民国 商法、民法侵权行为、FIPA、有说服力先例原则
eu.json 欧洲联盟 GDPR、DSA、DMA
  • 许可证:Apache License 2.0。

评估方法论

  • 四标准评分表(总分 100 分):
    • 法律准确性:占 40%
    • 引用正确性:占 30%(若存在任何捏造引用,该项直接记 0 分)
    • 管辖适当性:占 20%
    • 推理质量:占 10%
  • 评分机制:采用 3 次采样均值,每道题目对被测模型采样三次,取三次独立评估分数的算术平均值作为该题得分,最终基准分数为所有题目的平均分。
  • 引用验证门:每道题目的标准答案中,所有法规、章节和判例引用均需经过一手来源的独立验证,方可发布。每个题目记录有 last_verified ISO 日期,每六个月重新验证一次。
  • 锚点交叉污染发现:在 v1.1.0 针对韩国题目的基准测试中,发现用于修复特定错误模式的法条锚点会降低模型在相邻法条上的表现。因此,当目标法条与相邻条款共享理论空间时,锚点需进行范围隔离。

题目结构

每个题目遵循统一的 JSON 模式,包含以下字段:id(稳定标识符)、question(提问)、goldenAnswer(标准答案)、category(类别)、jurisdiction(管辖区)、expected_topics(预期主题)、difficulty(难度)、last_verified(最后验证日期)。

如何复现评分

  1. questions/v1.0.0/questions/v1.1.0/ 中选择一个题库。
  2. 使用题目中的 question 字段提示待测智能体。
  3. 根据 judges/grader-prompt.md 中的提示和 judges/rubric.md 中的评分表,对每个答案进行评分。每道题采样三次并取算术平均值。
  4. 智能体的最终分数为题库中所有题目的平均分。

引用

如需在研究或产品评估中使用该基准,请引用以下内容:

Pariksha Benchmark v1.0.0, ATNIA Solutions, 2026, github.com/Aritra003/pariksha-benchmark

bibtex @misc{pariksha2026, title = {Pariksha Benchmark: A Jurisdiction-Aware Benchmark for Legal AI Agents}, author = {{ATNIA Solutions}}, year = {2026}, version = {1.0.0}, url = {https://github.com/Aritra003/pariksha-benchmark} }

重要声明:该数据集内容不构成法律建议,不涵盖任何管辖区的完整法律,也不能替代专业法律审查。高 Pariksha 分数并不授权在需要合格法律判断的事务中使用 AI 智能体。该基准仅用于研究、评估和方法论透明性。

搜集汇总
数据集介绍
Pariksha Benchmark 数据集图片
构建方式
Pariksha基准测试集的构建遵循严谨的专家驱动与司法管辖验证双重路径。首先,该数据集的核心内容源自经验丰富的法律专家精心撰写的题目,每个题目均附带包含真实法条与判例引用的标准答案。所有引文在纳入正式题库前,均需通过严格的引文验证关卡,确保每条法条、章节及判例均依据一手资料或经明确标注的可靠二手来源核实,并记录最近验证日期以确保时效性。题库目前涵盖8个司法管辖区的题目集,每个集合包含5道题目,并明确了对应的司法管辖区域与法律焦点,从而为评估模型在特定法律体系下的表现提供了结构化基础。
使用方法
使用Pariksha基准进行评估时,首先需选择一个题库文件,随后将每个题目中的‘问题’字段作为提示词,输入至待测的法律AI代理中,并可附带系统提示或定义其司法管辖范围。接着,利用专门的评分提示词与评分量规对代理的答复进行评分,每道题需进行三次采样并计算平均分。最后,代理在该题库上的最终得分即为所有题目平均分值的算术平均数。若评分员三次采样结果的分数差异超过10分,则需参考专门的不一致处理协议。完整的复现流程与引文验证的详细操作均记录在方法论论文中,确保评估过程的透明与可重复性。
背景与挑战
背景概述
Pariksha Benchmark是一个由ATNIA Solutions于2026年创建的公开基准测试框架,旨在评估法律人工智能代理在管辖意识任务上的表现。该数据集的核心研究问题聚焦于法律AI的司法准确性、引文正确性及法规依据性,而非通用的推理能力。通过覆盖印度、新加坡、阿联酋迪拜国际金融中心、美国、英国、韩国和欧盟等多个司法管辖区的8个问题库,Pariksha为法律AI的跨域评估提供了标准化工具。其独特的四维评分体系(法律准确性40%、引文正确性30%、司法适当性20%、推理质量10%)和引文验证机制,确保了评估结果的可靠性和专业性,对法律AI领域的研究和产品开发产生了重要影响。
当前挑战
Pariksha Benchmark面临的核心挑战在于解决法律AI的司法准确性难题,确保模型输出的法律主张与特定司法管辖区法规精确匹配,避免跨域混淆。构建过程中的主要挑战包括:1)引文验证的高标准要求——每个黄金答案中的法规、判例和条款必须经原始来源独立核实,且需每六个月重新验证,以确保时效性和权威性;2)锚定交叉污染问题——在韩国基准测试中发现,针对特定法规的锚定提示虽能修复某个错误模式,却意外导致相邻法规评估得分骤降,揭示了上下文干扰的复杂性;3)多司法管辖区的差异性与覆盖广度——每个问题库仅含5个问题,难以代表任一地区的完整法律体系,需在有限样本中平衡代表性和专业性。
常用场景
经典使用场景
Pariksha Benchmark最经典的使用场景在于对法律人工智能代理进行跨司法管辖区的精细化评估。不同于通用推理能力测试,该基准专注于检验AI系统在特定法域下的法律准确性、引用正确性及成文法依据的可靠性。通过提供涵盖印度、新加坡、阿联酋迪拜国际金融中心、美国特拉华州及联邦法、英格兰与威尔士、韩国、欧盟等8个司法管辖区的标准化试题库,研究者可以系统性地考察法律AI代理在商业合同、公司治理、仲裁、数据保护等专业领域中的表现。每道试题均配有经独立验证的黄金答案,确保所有法律引用均源自一手权威资料,从而为模型在法律文本理解与案例推理方面的能力提供可靠度量。
解决学术问题
该基准有效解决了法律人工智能学术研究中长期存在的评估方法缺失问题。长期以来,学界缺乏一个能够严格检验AI系统在特定司法管辖区法律适用能力的标准化工具,多数评测仅停留于通用法律知识问答层面,无法区分模型是真正理解法域规则还是依赖表面模式匹配。Pariksha Benchmark通过引入四项加权评分准则——法律准确性占40%、引用正确性占30%、司法管辖区适切性占20%、推理质量占10%,并设置严格的引用验证机制,迫使研究者关注模型在法域特异性任务中的真实表现。其重要性体现在推动了法律AI评估从模糊的通用标准向精细化、可复现的领域化评价范式转变,为后续研究树立了方法论标杆。
实际应用
在实际应用中,Pariksha Benchmark可服务于法律科技产品的质量保障与合规验证。法律科技公司可利用该基准对其开发的司法管辖区感知型AI助手进行上线前测试,例如检验针对印度《 negotiable instruments Act》或新加坡国际仲裁法规的问答系统是否准确引用最新判例与成文法。此外,律所及企业法务部门可借助评估结果筛选适用于特定跨境业务场景的AI工具,降低因法律意见不准确引发的执业风险。该基准还支持持续验证功能,每半年重新核查引用来源的时效性,确保评测结果与法律动态保持同步,从而为法律AI的实际部署提供动态、可信的参考依据。
数据集最近研究
最新研究方向
在人工智能与法律交叉领域,Pariksha Benchmark的发布标志着对法律AI智能体进行评估的范式革新,其研究焦点从通用推理能力转向司法管辖感知与法定引用的精确性。最新进展体现在v1.1.0版本新增英格兰与威尔士、韩国及欧盟三大法域题库,并揭示了静态锚定策略可能引发跨法规性能塌陷的锚定交叉污染现象——例如针对韩国商法典特定条款的锚定块竟导致邻近民法侵权行为问题的评分从92分骤降至5分。这一发现促使研究界重新审视法律AI中知识锚定的范围隔离机制,推动开发更鲁棒的管辖敏感型智能体架构。该基准通过严格的引文验证门控与加权评分体系,为评估大语言模型在真实法律场景下的应用可靠性提供了可重复的量化标准,其多法域覆盖能力对跨辖区法律科技产品落地具有重要指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务