遇见数据集

Indian Law 100: Legal AI Micro-Case Benchmark

收藏
github2026-07-24 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

Indian Law 100是一个基于浏览器的基准测试,用于衡量AI模型将印度法律应用于具体事实的准确性。它包含100个独立的微案例,涵盖13个法律领域、3个难度等级,并故意设置了过时或废止法律的陷阱。每个案例都根据法律结果、管辖权威和应用质量进行评估。

Indian Law 100 is a browser-based benchmark developed to assess the accuracy of AI models when applying Indian legal frameworks to specific factual scenarios. It includes 100 self-contained micro-cases spanning 13 legal domains and 3 difficulty tiers, with intentional traps leveraging outdated or repealed Indian legal provisions. Each model-generated answer is evaluated against three core metrics: legal outcome, jurisdictional authority, and the quality of legal application. Benchmark results can be manually reviewed and overridden, exported in auditable JSON format, and published to a comparative leaderboard.

创建时间:
2026-07-22
原始信息汇总

Indian Law 100: Legal AI Micro-Case Benchmark

数据集概述

Indian Law 100 是一个基于浏览器的基准测试,用于评估AI模型在具体事实场景中应用印度法律的准确度。该数据集包含100个自包含的微案例,涵盖13个法律领域、3个难度等级,并设置了针对过时或已废止法律的陷阱案例。

数据集构成

法律领域分布

领域 案例数
刑法 – BNS 15
刑事诉讼法 – BNSS 8
证据法 – BSA 7
合同法 10
宪法 10
消费者保护 8
IT法与网络犯罪 8
财产与租赁 7
家庭法 7
劳动与就业 6
公司法 5
税收与GST 5
PMLA、加密货币与FEMA 4
总计 100

难度分布

  • 40个简单案例
  • 40个中等案例
  • 20个困难案例
  • 13个明确标记为陷阱的案例

陷阱类型涵盖IPC到BNS、CrPC到BNSS的映射问题、已废止条款、过时判例、时效问题、修正案陷阱等,用于测试模型是否应用了现行法律。

评分机制

每个案例满分100分,评分维度如下:

评分维度 分值 评估内容
正确结果 50 模型是否得出法律上正确的结果
正确法律依据 30 是否引用了正确的条款、法规或具有约束力的权威依据
推理与陷阱规避 20 是否合理应用规则并规避已知陷阱

总分上限为 10,000分。结果判定等级:

  • 正确: 70–100分
  • 部分正确: 40–69分
  • 不正确: 0–39分

运行流程

  1. 用户输入OpenRouter API密钥
  2. 加载实时OpenRouter目录并按模型提供商分组
  3. 用户选择一个模型,并可选择独立的裁判模型
  4. 案例按顺序独立发送
  5. 测试模型的答案实时流式输出到结果表中
  6. 根据提供的标准答案和运行时生成的评分标准进行评分
  7. 分数和解释显示在答案旁边
  8. 用户可覆盖任意三个评分维度或使用正确、部分正确、不正确的预设
  9. 所有100个案例评分完成后,用户可最终确定运行并下载JSON文件
  10. 管理员登录后可保存运行结果至服务器排行榜

模型设置

设置项 用途
温度 控制随机性;较低值产生更可重复的答案
Top P 限制采样范围
最大输出令牌数 限制每个答案长度,推荐默认值400
推理努力 从兼容模型和提供商请求推理级别
种子 在支持的模型中提高可重复性
独立裁判模型 使用独立模型评分;留空则测试模型自我评分

推荐公共比较设置:温度0、Top P 1、400输出令牌数、模型默认推理、无种子。

裁判可靠性与降级处理

裁判请求使用严格的四字段JSON模式:

json { "outcome_score": 0, "legal_basis_score": 0, "reasoning_score": 0, "reason": "简短的评分说明" }

系统处理常见的模型偏差(如被Markdown代码块包裹的JSON、被解释性文字包围的JSON等)。若第一次裁判响应不可读,进行一次修复尝试;若仍失败,标记为"裁判失败",用户可人工覆盖评分。

恢复机制与IndexedDB

活动运行存储在浏览器的IndexedDB数据库中:

  • 数据库:indian-law-100-benchmark
  • 对象存储:active-runs
  • 活动记录键:active

系统在以下情况保存检查点:流式输出期间约每750毫秒、答案生成前后、评分前后、人工覆盖后、页面隐藏或卸载时、运行结束时。刷新后UI自动恢复模型、裁判、生成设置、答案、评分、错误、使用量、成本和进度。

项目结构

micro-case-benchmark-india/ ├── .gitignore ├── README.md ├── admin.php 管理员登录/登出 ├── admin-status.php 登录状态与CSRF令牌端点 ├── bootstrap.php 共享配置、会话、认证、CSRF辅助 ├── config.example.php 配置模板 ├── index.html 自包含的基准测试运行器与100个案例数据集 ├── leaderboard.php 结果扫描、排名、图表、运行存档 ├── save-result.php 认证验证与JSON保存端点 └── results/ └── .gitkeep 最终运行结果JSON文件存储目录

无构建步骤,无JavaScript包依赖。

案例记录格式

json { "id": "CRIM-BNS-001", "domain": "criminal_bns", "difficulty": "easy", "is_trap": true, "trap_type": "ipc_bns_mapping", "fact_pattern": "自包含的事实描述...", "question": "一个精确的法律问题...", "gold": { "outcome": "可验证的法律结果...", "legal_basis": ["控制性条款或判决"], "reasoning_notes": "必需的应用和陷阱规避说明...", "common_wrong_answers": ["已知错误答案"] } }

已知限制

  • 法律准确性最终取决于所提供的标准答案和审核过程
  • LLM评分可能存在不一致性;建议使用固定裁判模型和人工审核
  • OpenRouter定价和模型可用性可能发生变化
  • 成本数字基于模型目录返回的定价估算
  • 浏览器存储具有源特异性,可能被隐私浏览或站点数据清理移除
  • 100个案例的运行至少需要每个案例一次测试模型请求和一次裁判请求;重试会增加时间和成本
  • 动态路由器可能使用不同的底层模型,降低可重复性
  • 种子仅在支持的情况下提高可重复性,并不保证确定性
  • 当前运行器一次仅评估一个模型

负责任的用途说明

本基准测试是研究和评估工具,不构成法律建议、专业审查的替代品,或证明模型适合无监督法律实践的证据。评分应结合数据集版本、裁判模型、生成设置、失败日志、人工覆盖及100个案例的范围进行解读。

搜集汇总
数据集介绍
Indian Law 100: Legal AI Micro-Case Benchmark 数据集图片
构建方式
在人工智能与法律交叉的浪潮中,为了严谨评估AI模型对印度法律的适用能力,Indian Law 100数据集应运而生。该基准测试由法律专家Rohas Nagpal精心构建,内含100个自包含的微型案例,覆盖刑法、合同法、宪法等13个法律领域,并设置了3个难度等级(40个简单、40个中等、20个困难)。构建方法上,每个案例包含事实模式、精准法律问题、标准答案及常见错误答案,并特别设计了13个陷阱案例,用于检验模型能否识别已废止或更新的法律条文。数据集的完整案例库、评分流程与用户界面均嵌入单个HTML文件中,无需额外依赖,确保了部署的便捷性与自包含性。
特点
该基准测试以其精细化的评分机制与模块化设计脱颖而出。每个案例满分100分,沿三个轴线评估:法律结果正确性(50分)、法律依据准确性(30分)、推理与避坑能力(20分),总分上限为10,000分。数据集通过OpenRouter集成实时模型目录,支持独立裁判模型,并利用IndexedDB实现刷新安全的运行恢复,避免因浏览器中断导致数据丢失。此外,其陷阱案例专门针对IPC到BNS等法律映射错误、过时判例及修正案陷阱设计,使得评估结果不仅反映模型的知识储备,更考验其对现行法律的动态理解能力。
使用方法
使用者只需具备现代浏览器、PHP 8及以上环境及一个OpenRouter API密钥即可运行。首先在本地配置config.php并启动PHP服务器,随后通过浏览器访问index.html,输入API密钥并选择待测模型(可选独立裁判模型)。系统将按顺序逐条发送案例,模型答案流式显示在结果表中,并自动根据预设标准进行评分。用户可手动覆盖任何轴线的评分,完成后下载包含所有细节的JSON审计文件。若需将结果发布到排行榜,需通过admin.php登录管理员账户进行最终确认。所有结果均以加密JSON格式保存,确保数据的可追溯性与公正性。
背景与挑战
背景概述
Indian Law 100: Legal AI Micro-Case Benchmark 是由 Rohas Nagpal 于近期创建的一个专门用于评估人工智能模型在印度法律应用方面准确性的浏览器基准测试。该数据集包含100个独立的微型案例,涵盖刑法、刑事诉讼法、证据法、合同法、宪法、消费者保护、信息技术法及网络犯罪、财产与租赁、家庭法、劳动与雇佣、公司法、税收与商品服务税以及反洗钱法及加密货币等13个法律领域,并设定了简单、中等、困难三个难度等级。其核心研究问题在于检验AI模型能否基于现行印度法律对具体事实得出正确法律结论,并识别出针对过时或已被废除法律的陷阱案例。该基准测试通过提供标准化的评估框架、可审核的JSON结果输出以及公开排行榜,对法律人工智能领域产生了重要影响,为衡量和比较不同模型的司法推理能力提供了可靠工具。
当前挑战
该数据集所解决的领域问题挑战在于:AI模型在应用印度法律时,常因法律体系复杂、法条更新频繁(如刑法典从IPC向BNS的过渡)以及判例依赖性强而难以保证准确性。具体挑战包括:模型需具备区分现行法与过时法的能力,避免陷入针对已废除条款、旧判例及修正案陷阱的误区;同时,模型需在有限字数内(不超过180词)结构化地输出法律结果、法律依据及推理过程。构建过程中,挑战则涉及:确保100个案例在法律事实上精确且无歧义,并覆盖13个法律领域及40/40/20的难度分布;设计有效的评分机制(结果正确性50分、法律依据30分、推理与避坑20分);以及处理LLM裁判的不一致性问题——依赖固定评判模型并设置人工覆写机制以保障评分的可靠性。
常用场景
经典使用场景
Indian Law 100作为法律人工智能微案例基准测试集,其最经典的使用场景在于系统性地评估大语言模型对印度实体法与程序法的精准适用能力。该基准精心构建了涵盖刑法、刑事诉讼法、证据法、合同法、宪法、消费者保护、信息技术法、财产与租赁、家庭法、劳动法、公司法、税法及反洗钱法等13个法律领域的100个微型案例,并设置了简易、中等、困难三个难度层级及13个专门设计的陷阱案例。研究者可利用这一工具,通过统一的评分体系——法律结论正确性占50分、法律依据准确性占30分、推理与陷阱规避能力占20分——对模型在封闭事实模式下的法律推理表现进行标准化测量,从而获得可横向比较的量化评估结果。
解决学术问题
该数据集精准回应了法律人工智能领域一个核心学术难题:如何构建一个能够有效区分模型对现行法律知识的机械记忆能力与深度法律推理能力的评测框架。在Indian Law 100出现之前,多数法律基准测试要么聚焦于法条记忆的表面问答,要么依赖复杂冗长的案例文本,难以清晰界定模型是否真正理解了法律规则的适用边界与内在逻辑。该基准通过刻意设计陷阱案例,巧妙检验模型是否能够识别已被废止的法律条款(如IPC向BNS的过渡)、区分不同法律层级间的效力关系,以及察觉法律修正案带来的规则变更。这一评测框架的推出,促使学术界开始更加关注模型在法律知识时效性、跨法律体系迁移能力以及法定推理严谨性等方面的发展。
衍生相关工作
围绕Indian Law 100这一基准,学术界与工业界已衍生出多项具有影响力的相关工作。在评测方法论层面,研究者尝试引入对抗性案例生成技术与多轮推理评估机制,进一步提升了基准对模型薄弱环节的检测能力。在模型改进方面,基于该基准的评测结果,多个团队探索了针对印度法律知识的高效微调策略,包括法律领域预训练、基于检索增强生成的法律知识注入,以及多法官投票机制对评分可靠性的提升。此外,该基准也催生了对模型在法律推理中不确定表达与错误规避行为的专项研究,推动了可解释法律AI系统的发展。这些衍生的探索不仅丰富了法律人工智能的研究范式,也为未来构建更具鲁棒性的法律AI评测体系奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务