nyayasetu-legal-dialogues-multilingual
收藏资源简介:
NyayaSetu + ZamanatAI自适应法律数据集是一个为印度弱势公民设计的、基于WhatsApp风格交互的多语言法律访问助手数据集。该数据集旨在将用户通过WhatsApp或网页发送的法律帮助信息转换为结构化的记录,涵盖保释、案件状态、法律权利、担保债券、FIR副本、法庭日期和免费法律援助等法律领域。数据集采用自适应学习循环机制:用户发送消息后,系统预测语言、法律意图、实体和所需文档类型;用户或审核者提供关于语言、意图、完整性或有用性的反馈;修正以字段级事件形式存储;每个样本都带有修正前后的置信度版本控制。数据集包含丰富的字段:样本ID、训练/验证/测试划分、来源类型、输入文本、输入语言、语言名称、地区提示、法律领域、意图、输出文档类型、紧急程度、实体字段、证据清单、缺失信息标签、预期回复、安全免责声明、反馈、修正字段、适应历史、修正前后置信度、质量评分、PII脱敏标志、会话ID和时间戳。数据集涵盖22种印度语言,包括印地语、马拉地语、孟加拉语、泰米尔语、泰卢固语、卡纳达语、古吉拉特语、旁遮普语、奥里亚语、阿萨姆语、孔卡尼语、马拉雅拉姆语、乌尔都语、尼泊尔语、信德语、迈蒂利语、桑塔利语、博多语、多格拉语、克什米尔语、曼尼普尔语和英语,其中特别关注了多种低资源语言。数据集包含2,120个反馈事件(类型包括错误语言、错误意图、部分答案、缺失信息、有帮助回复和优秀回复)和771个修正事件(以结构化字段更新形式表示,如输入语言、意图、实体等)。该数据集展示了真实的法律援助交互、多语言自适应扩展、人类风格反馈事件、字段级修正事件、版本化适应历史以及用于评估和模型改进的仪表板就绪导出,特别注重通过自适应格式衡量低资源语言的改进效果。
数据集概要
该数据集名为 NyayaSetu + ZamanatAI Adaptive Legal Dataset,是一个面向印度公民的多语言法律帮助助手数据集,专注于处理保释、案件状态、法律权利、担保书、FIR副本、开庭日期及免费法律援助等法律事务。
核心特性
- 多语言覆盖:支持22种语言,包括印地语、马拉地语、孟加拉语、泰米尔语、泰卢固语、卡纳达语、古吉拉特语、旁遮普语、奥里亚语、阿萨姆语、孔卡尼语、马拉雅拉姆语、乌尔都语、尼泊尔语、信德语、迈蒂利语、桑塔利语、博多语、多格拉语、克什米尔语、曼尼普尔语和英语。其中明确追踪12种低资源语言。
- 自适应学习循环:模拟用户从发送WhatsApp或网页消息开始,系统进行语言、意图、实体及文档类型预测,用户或审核员提供反馈,系统记录字段级修正,并基于修正前后置信度进行版本迭代。
- 反馈与修正:包含2,120个反馈事件(如错误语言、错误意图、部分回答、信息缺失等类型)和771个修正事件(如语言、意图、实体等字段级更新)。
- 应用场景:专为印度低资源语言的法律访问设计,涵盖逮捕、保释、FIR副本、开庭日期等现实法律场景。
数据集结构
每行数据包含以下字段:样本ID、训练/验证/测试划分、来源类型、输入文本、输入语言、语言名称、地区提示、法律领域、意图、输出文档类型、紧急程度、实体字段、证据清单、缺失信息标签、预期回复、安全声明、反馈与修正字段、适应历史、修正前置信度、修正后置信度、质量评分、PII脱敏标志、会话ID和时间戳。
文件列表
- 推荐上传文件:
adaption_expert_legal_qa.csv(小型专家法律问答数据集,含密集法律推理、引用、证据清单、后续问题及自适应修正信号) - 备份文件:
adaption_legal_qa_premium.csv(大型高级备份)、adaption_upload_gold.csv(结构化上传备份) - 模型就绪导出文件:
adaptive_dataset.csv和adaptive_dataset.jsonl
数据来源与用途
- 数据来源:以真实的WhatsApp法律对话作为种子数据。
- 用途:用于模型的持续学习、人类反馈循环、数据集演化及多语言自适应智能训练。
- 公开发布平台:
- Hugging Face:https://huggingface.co/datasets/Ananya80/nyayasetu-legal-dialogues-multilingual
- Kaggle:https://www.kaggle.com/datasets/ananyadaitkar/nyayasetu-legal-dialogues-multilingual





