遇见数据集

nyayasetu-legal-dialogues-multilingual

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

NyayaSetu + ZamanatAI自适应法律数据集是一个为印度弱势公民设计的、基于WhatsApp风格交互的多语言法律访问助手数据集。该数据集旨在将用户通过WhatsApp或网页发送的法律帮助信息转换为结构化的记录,涵盖保释、案件状态、法律权利、担保债券、FIR副本、法庭日期和免费法律援助等法律领域。数据集采用自适应学习循环机制:用户发送消息后,系统预测语言、法律意图、实体和所需文档类型;用户或审核者提供关于语言、意图、完整性或有用性的反馈;修正以字段级事件形式存储;每个样本都带有修正前后的置信度版本控制。数据集包含丰富的字段:样本ID、训练/验证/测试划分、来源类型、输入文本、输入语言、语言名称、地区提示、法律领域、意图、输出文档类型、紧急程度、实体字段、证据清单、缺失信息标签、预期回复、安全免责声明、反馈、修正字段、适应历史、修正前后置信度、质量评分、PII脱敏标志、会话ID和时间戳。数据集涵盖22种印度语言,包括印地语、马拉地语、孟加拉语、泰米尔语、泰卢固语、卡纳达语、古吉拉特语、旁遮普语、奥里亚语、阿萨姆语、孔卡尼语、马拉雅拉姆语、乌尔都语、尼泊尔语、信德语、迈蒂利语、桑塔利语、博多语、多格拉语、克什米尔语、曼尼普尔语和英语,其中特别关注了多种低资源语言。数据集包含2,120个反馈事件(类型包括错误语言、错误意图、部分答案、缺失信息、有帮助回复和优秀回复)和771个修正事件(以结构化字段更新形式表示,如输入语言、意图、实体等)。该数据集展示了真实的法律援助交互、多语言自适应扩展、人类风格反馈事件、字段级修正事件、版本化适应历史以及用于评估和模型改进的仪表板就绪导出,特别注重通过自适应格式衡量低资源语言的改进效果。

创建时间:
2026-06-10
原始信息汇总

数据集概要

该数据集名为 NyayaSetu + ZamanatAI Adaptive Legal Dataset,是一个面向印度公民的多语言法律帮助助手数据集,专注于处理保释、案件状态、法律权利、担保书、FIR副本、开庭日期及免费法律援助等法律事务。

核心特性

  • 多语言覆盖:支持22种语言,包括印地语、马拉地语、孟加拉语、泰米尔语、泰卢固语、卡纳达语、古吉拉特语、旁遮普语、奥里亚语、阿萨姆语、孔卡尼语、马拉雅拉姆语、乌尔都语、尼泊尔语、信德语、迈蒂利语、桑塔利语、博多语、多格拉语、克什米尔语、曼尼普尔语和英语。其中明确追踪12种低资源语言。
  • 自适应学习循环:模拟用户从发送WhatsApp或网页消息开始,系统进行语言、意图、实体及文档类型预测,用户或审核员提供反馈,系统记录字段级修正,并基于修正前后置信度进行版本迭代。
  • 反馈与修正:包含2,120个反馈事件(如错误语言、错误意图、部分回答、信息缺失等类型)和771个修正事件(如语言、意图、实体等字段级更新)。
  • 应用场景:专为印度低资源语言的法律访问设计,涵盖逮捕、保释、FIR副本、开庭日期等现实法律场景。

数据集结构

每行数据包含以下字段:样本ID、训练/验证/测试划分、来源类型、输入文本、输入语言、语言名称、地区提示、法律领域、意图、输出文档类型、紧急程度、实体字段、证据清单、缺失信息标签、预期回复、安全声明、反馈与修正字段、适应历史、修正前置信度、修正后置信度、质量评分、PII脱敏标志、会话ID和时间戳。

文件列表

  • 推荐上传文件adaption_expert_legal_qa.csv(小型专家法律问答数据集,含密集法律推理、引用、证据清单、后续问题及自适应修正信号)
  • 备份文件adaption_legal_qa_premium.csv(大型高级备份)、adaption_upload_gold.csv(结构化上传备份)
  • 模型就绪导出文件adaptive_dataset.csvadaptive_dataset.jsonl

数据来源与用途

  • 数据来源:以真实的WhatsApp法律对话作为种子数据。
  • 用途:用于模型的持续学习、人类反馈循环、数据集演化及多语言自适应智能训练。
  • 公开发布平台
    • Hugging Face:https://huggingface.co/datasets/Ananya80/nyayasetu-legal-dialogues-multilingual
    • Kaggle:https://www.kaggle.com/datasets/ananyadaitkar/nyayasetu-legal-dialogues-multilingual
搜集汇总
数据集介绍
nyayasetu-legal-dialogues-multilingual 数据集图片
构建方式
在司法可及性领域,面向印度 underserved 社群的语言障碍问题,NyayaSetu 数据集通过模拟 WhatsApp 及网页端的法律求助对话,构建了一套多语言法律交互记录。其构建流程始于公民以印度本地语言发送求助信息,系统自动预测语言、法律意图、实体及所需文档类型,随后由用户或审核员对语言、意图、完整性与有用性提供反馈。反馈被记录为字段级修正事件,每条样本附带置信度前后对比与版本历史,最终输出涵盖训练、验证与测试划分的结构化数据集。该过程融合了真实法律援助对话、多语言自适应扩展及人工反馈机制,形成了闭环式的自适应学习循环。
特点
本数据集的核心特点在于其自适应学习架构与多语言覆盖的深度结合。它涵盖22种印度语言,包括12种低资源语言如奥里亚语、阿萨姆语、孔卡尼语等,并明确追踪各语言的低资源表现。数据集中包含2,120条反馈事件与771条修正事件,支持错误语言、错误意图、部分回答等六类反馈类型,以及字段级的结构化修正。每条样本均记录置信度前后变化与质量评分,使模型改进过程可量化、可追踪。此外,数据集的适应历史与仪表板就绪导出格式,为持续学习与模型评估提供了透明化的演进轨迹。
使用方法
该数据集的使用方法基于 Adaption 自适应数据平台进行上传与迭代优化。用户可直接将推荐的 `adaption_expert_legal_qa.csv` 文件上传至平台,该文件包含精炼的法律专家问答对,具备密集的法律推理、证据清单与自适应修正信号。备选的 `adaption_legal_qa_premium.csv` 与 `adaption_upload_gold.csv` 可分别用作扩展与结构化备份。完整的模型就绪导出文件 `adaptive_dataset.csv` 和 `adaptive_dataset.jsonl` 支持直接用于机器学习模型的训练与评估。在应用时,系统能够根据用户反馈动态调整语言识别与意图分类的置信度,实现对低资源语言法律查询的持续改进。
背景与挑战
背景概述
NyayaSetu法律对话多语言数据集由Ananya Daitkar团队创建,旨在为印度 underserved 公民提供多语言法律访问助手。该数据集于近期发布在HuggingFace和Kaggle平台,核心研究问题是如何通过 WhatsApp 风格的法律求助消息,实现意图识别、实体提取、反馈校正和文档生成等功能的自动化。数据集覆盖22种印度语言,特别关注低资源语言的法律文本处理,其自适应学习循环机制允许通过用户反馈持续改进模型性能。该数据集对推进多语言法律人工智能领域具有重要意义,为印度法律服务的数字化转型提供了基础数据支撑。
当前挑战
该数据集面临的挑战包括:第一,领域问题方面,法律文本的语义复杂性和多语言混合现象(如Hinglish)给准确的语言检测和意图分类带来困难,低资源语言的法律术语匮乏进一步加剧了模型泛化瓶颈;第二,构建过程中,需要从真实的WhatsApp交互中采集并标注敏感法律对话数据,同时确保隐私保护(PII脱敏)和标注质量一致性,反馈与校正事件的版本化管理也增加了数据维护的复杂度。
常用场景
经典使用场景
NyayaSetu 多语种法律对话数据集专为智能法律助手系统设计,其核心使用场景在于处理印度公民通过WhatsApp或网页提交的非结构化法律咨询。该数据集将日常化的法律求助信息转化为结构化的意图识别、实体抽取、证据清单、安全声明及文档生成记录,覆盖保释、案件状态查询、担保金、FIR副本、法庭日期和免费法律援助等高频法律议题。借助22种印度语言的丰富标注,数据集为多语种交互式法律问答系统提供了基础训练与评估素材,成为法律科技领域实现平民化司法接入的关键数据基石。
衍生相关工作
基于NyayaSetu的架构设计,衍生出多项具有开拓性的研究工作,包括面向低资源语言的跨域意图迁移学习、基于人类反馈驱动的法律对话纠错算法、以及融合证据清单与安全声明的法律文档自动生成模型。数据集特有的字段级修正事件和适应历史版本化机制,为持续学习、主动学习和在线模型评估等方向提供了实证研究平台。此外,其在多语种、多地域法律场景下的适配管道,也催生了关于法律知识图谱动态扩展与少数语言司法资源民主化的前沿讨论。
数据集最近研究
最新研究方向
该数据集聚焦于印度多语言法律对话的适配学习与持续优化,前沿研究方向包括构建自适应反馈循环系统,通过用户交互实时修正语言识别、意图解析及实体抽取错误,并基于置信度动态调整模型性能。当前研究热点围绕低资源印度语言的法律可及性,借助WhatsApp等平民化渠道收集真实对话并嵌入人类反馈机制,推动司法辅助系统在欠发达地区的落地。nyayasetu-legal-dialogues-multilingual不仅为多语言法律NLP提供了结构化标注基准,更开创了可量化、可追踪的模型演化范式,对弥合语言鸿沟、提升司法公正性具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务