kaushik-harsh-99/Indian-legal-data-v3
收藏资源简介:
Indian Legal Dataset V3 是一个大规模指令微调数据集,专注于印度法律、宪法、刑法、法律推理、法律文书起草以及现实世界法律辅助。与V2版本相比,此版本扩展了数据集,包含:法律起草指令对、假设性法律场景、详细的IPC(印度刑法典)相关数据、实用的现实世界法律指令以及简洁的法律问答对。在整合新数据源后,数据集经过清洗、规范化和去重,以减少冗余,同时保持法律多样性。最终数据集包含约194,000个指令-响应对。
language: - 英语 license: MIT许可证 tags: - 法律 - 法学 - 印度法律 - 法律AI - 指令微调 - 监督微调 - 法律问答 - 宪法法律 - IPC(印度刑法典) - 刑法 - 法律推理 - 法律文书撰写 - 大语言模型(LLM) - 监督微调(SFT) - 数据集 task_categories: - 文本生成 - 问答 pretty_name: 印度法律数据集V3 size_categories: - 10万<n<100万 configs: - config_name: 上下文长度小于4096 Token data_files: - split: train path: "Context Below 4096/below_4096_tokens.jsonl" - config_name: 上下文长度大于4096 Token data_files: - split: train path: "Context Above 4096/above_4096_tokens.jsonl" # 印度法律数据集V3 ## 概述 印度法律数据集V3是一款大规模指令微调数据集,聚焦印度法律、宪法法律、刑法、法律推理、法律文书撰写以及现实世界法律协助场景。 相较于V2版本,本版数据集新增了以下内容: - 法律文书撰写指令对 - 假设性法律场景 - 详细的印度刑法典(IPC)相关数据 - 实用的现实世界法律指导 - 简洁的法律问答对 在整合新增数据源后,数据集再次经过清洗、规范化与去重处理,在保留法律领域多样性的同时降低了数据冗余。最终数据集包含约**19.4万条指令-回复对**。 # V3版本新增内容 ## 法律文书撰写数据 V3版本引入了面向文书撰写的法律指令对,例如: - 法律通知书 - 起诉状 - 宣誓书 - 申请书 - 请愿书 ### 示例 json { "instruction": "Draft a legal notice for non-payment of rent.", "output": "Subject: Legal Notice for Non-Payment of Rent... This notice is issued to inform you..." } ## 假设性法律场景 本数据集现已包含假设性与现实性法律场景,涵盖: - 财产纠纷 - 刑事指控 - 宪法冲突 - 程序问题 - 消费者权益 ### 示例 json { "instruction": "A landlord forcefully evicts a tenant without notice. What legal remedies are available under Indian law?", "output": "The tenant may approach the appropriate civil court seeking restoration of possession, injunction relief, and damages..." } ## 扩充的印度刑法典(IPC)覆盖范围 V3版本大幅扩充了与IPC相关的指令对,涵盖: - 条款释义 - 刑罚规定 - 犯罪分类 - 刑事诉讼程序 ### 示例 json { "instruction": "Explain Section 420 IPC.", "output": "Section 420 IPC deals with cheating and dishonestly inducing delivery of property. It is punishable with imprisonment which may extend to seven years along with fine." } ## 现实世界法律指导 本数据集包含实用的法律交互场景,例如: - 程序指导 - 法律权利咨询 - 法律适用场景 - 日常法律问题解析 ### 示例 json { "instruction": "What should I do if my employer refuses to pay my salary?", "output": "You may issue a formal demand notice, approach the labour commissioner, or file a claim before the appropriate labour authority depending on the nature of employment." } ## 法律摘要生成 本数据集包含基于以下内容的摘要生成类指令对: - 法院判决 - 法律命令 - 司法推理 - 程序进展 ### 示例 json { "instruction": "Summarize the following legal judgment: <judgment text>", "output": "The Court held that demolition proceedings must comply with principles of natural justice and directed authorities to ensure rehabilitation measures before eviction." } # 数据集结构 每条样本遵循简洁的指令微调格式: json { "instruction": "...", "output": "..." } # 数据集统计信息 | 属性 | 数值 | |---|---| | 近似样本量 | ~19.4万 | | 主要语言 | 英语 | | 格式 | JSONL | | 领域 | 印度法律体系 | # 覆盖领域 - 宪法法律 - IPC(印度刑法典) - 刑法 - 民法 - 程序法 - 法律文书撰写 - 法律摘要生成 - 法律问答 - 司法推理 # 数据处理流程 本数据集历经多阶段预处理,包括: - JSON规范化 - 精确去重 - 系统提示词移除 - 指令-回复结构重构 - 格式清理 - 异常样本过滤 - 长上下文过滤 为保留法律领域多样性与精细化的法律覆盖范围,本数据集刻意未采用语义去重。 # V2与V3版本差异 | 特征 | V2 | V3 | |---|---|---| | 法律问答 | ✓ | ✓ | | 法律摘要生成 | ✓ | ✓ | | 法律文书撰写数据 | ✗ | ✓ | | 假设性法律场景 | ✗ | ✓ | | 详细的IPC覆盖 | 有限 | 已扩充 | | 现实世界法律指导 | 有限 | ✓ | | 近似数据集规模 | 较小 | ~19.4万 | # 预期用途 本数据集适用于: - 监督微调(SFT) - 法律领域适配 - 法律助手开发 - 法律推理研究 - 法律文书撰写辅助 兼容的模型包括: - Qwen - Llama - Mistral - Gemma - DeepSeek # 局限性 - 部分样本仍可能包含OCR识别痕迹或格式不一致问题 - 本数据集的回复不应被视为专业法律建议 - 法律解读可能因管辖区域与具体场景而异



