遇见数据集

asteria-bhojpuri-assamese-civic-qa

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

Asteria是一个包含博杰普尔语和阿萨姆语政府计划问答对的数据集,专注于两种低资源的印度语言。该数据集由Asteria AI代理在AI Agents Hackathon 2026期间收集,旨在通过使用用户母语进行对话,帮助印度农村公民了解和获取政府福利计划。数据集覆盖两种主要语言:博杰普尔语(在比哈尔邦、北方邦、贾坎德邦使用,使用者超过5000万人)和阿萨姆语(在阿萨姆邦使用,使用者超过1500万人)。内容涵盖多个关键的政府计划领域,包括农业(如PM Kisan、Fasal Bima)、医疗(Ayushman Bharat)、住房(PM Awas Yojana)、能源(Ujjwala Yojana)、金融(Jan Dhan)和食品安全(Ration Card)。每个样本包含用户用博杰普尔语或阿萨姆语提出的问题、AI代理用同种语言给出的回答、语言名称、语言ISO代码、计划所属领域、用户意图(如申请计划、检查资格、获取文件等)、具体的政府计划名称,以及四个人工评估分数:事实准确性、语言质量、帮助性和整体质量,每个分数范围为0-10。数据集规模为小于1000个样本。该数据集适用于低资源语言处理、面向公民服务的AI代理开发、多语言问答系统以及政府信息可及性等研究与应用场景。

Asteria is a dataset containing question-answer pairs on government schemes in Bhojpuri and Assamese languages, focusing on two low-resource Indian languages. The dataset was collected by the Asteria AI agent during the AI Agents Hackathon 2026, aiming to help rural citizens in India understand and access government welfare schemes through conversations in their native languages. The dataset covers two main languages: Bhojpuri (bho, used in Bihar, Uttar Pradesh, Jharkhand, with over 50 million speakers) and Assamese (asm, used in Assam, with over 15 million speakers). The content spans multiple key government scheme domains, including agriculture (e.g., PM Kisan, Fasal Bima), healthcare (Ayushman Bharat), housing (PM Awas Yojana), energy (Ujjwala Yojana), finance (Jan Dhan), and food security (Ration Card). Each sample includes fields such as the users query in Bhojpuri or Assamese, the AI agents response in the same language, language name, language ISO code, domain of the scheme, user intent (e.g., applying for a scheme, checking eligibility, obtaining documents), specific government scheme name, and four human evaluation scores: factual accuracy, language quality, helpfulness, and overall quality, each on a scale of 0-10. The dataset size is less than 1000 samples (n<1K). It is suitable for research and applications in low-resource language processing, AI agent development for citizen services, multilingual question-answering systems, and government information accessibility.

创建时间:
2026-06-10
原始信息汇总

数据集概述

Asteria — Bhojpuri & Assamese Civic Q&A Dataset 是一个面向政务领域的双语问答数据集,特别针对 Bhojpuri(博杰普尔语)Assamese(阿萨姆语) 这两种低资源印度语言。

  • 语言:博杰普尔语 (bho)、阿萨姆语 (asm)
  • 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 规模:少于1000个样本 (n<1K)
  • 创建者:Asteria(为 AI Agents Hackathon 2026 构建的 AI Agent)

数据集内容

该数据集包含在博杰普尔语和阿萨姆语中提出的用户问题与 AI Agent 回复的配对,覆盖多个政府福利计划领域:

  • 农业:PM Kisan、Fasal Bima
  • 医疗保健:Ayushman Bharat
  • 住房:PM Awas Yojana
  • 能源:Ujjwala Yojana
  • 金融:Jan Dhan
  • 食品安全:Ration Card

数据字段

每条记录包含以下字段:

  • query:用户的博杰普尔语/阿萨姆语问题
  • response:AI Agent 的同语言回复
  • language:语言名称 (bhojpuri/assamese)
  • language_code:ISO 语言代码 (bho/asm)
  • domain:方案所属领域
  • intent:用户意图(如 APPLY_SCHEME、CHECK_ELIGIBILITY、GET_DOCUMENTS)
  • scheme:政府方案名称
  • eval_factual:事实准确性评分 (0-10)
  • eval_language:语言质量评分 (0-10)
  • eval_helpfulness:帮助度评分 (0-10)
  • eval_overall:总体质量评分 (0-10)

技术构建

  • 数据平台:Adaptive Data by Adaption(用于数据摄取、评估和管理)
  • AI 模型:Gemini 1.5 Flash(作为 AI agent 骨干)
  • 记忆系统:ChromaDB(用于 RAG 记忆,支持持续改进)
搜集汇总
数据集介绍
asteria-bhojpuri-assamese-civic-qa 数据集图片
构建方式
本数据集由Asteria智能体在AI Agents Hackathon 2026期间构建,专注于服务印度农村居民获取政府福利方案。数据通过智能体与用户以博杰普尔语和阿萨姆语进行对话的方式采集,覆盖农业、医疗、住房、能源、金融及食品安全六大民生领域。每条问答数据均经过结构化标注,包含查询、回复、语言代码、领域、用户意图及对应方案名称,并使用适应性数据平台进行摄入与管理,结合Gemini 1.5 Flash模型作为骨干与ChromaDB实现RAG记忆优化,最终经人工评估注入事实准确性、语言质量与有用性评分,形成高质量的多语言问答资源。
特点
该数据集的核心特色在于聚焦两种低资源印度语言——博杰普尔语与阿萨姆语,前者拥有超过五千万使用人口,后者亦有逾一千五百万使用者,且均缺乏成熟的自然语言处理资源。数据涵盖从PM Kisan到Jan Dhan等八项主流政府方案,标注维度详实,包含六类用户意图与四项评估指标,便于多维度分析与泛化应用。每对问答均经过事实准确性与语言质量的人工评分,确保高质量与可复用性,为低资源语言智能问答系统研发提供了稀缺且系统化的训练基准。
使用方法
数据集以CC BY 4.0许可发布,支持研究用途的免费访问与再分发。用户可直接加载JSON格式数据,利用'query'与'response'字段进行序列到序列模型训练,或提取'domain'、'intent'、'scheme'字段开展领域分类与意图识别任务。评估指标字段'eval_factual'、'eval_language'、'eval_helpfulness'和'eval_overall'可用于模型输出的自动评估与对比。推荐采用HuggingFace Datasets库加载数据,并配合Adapter或LoRA等技术对语言模型进行低资源场景下的微调优化。
背景与挑战
背景概述
在印度,数以亿计的农村居民依赖于各类政府福利计划,但语言障碍严重阻碍了他们获取信息。Bhojpuri和Assamese作为两种低资源语言,分别拥有超过5000万和1500万的使用者,却长期缺乏高质量的数字资源。Asteria — Bhojpuri & Assamese Civic Q&A数据集由Asteria团队于2026年AI Agents黑客松期间创建,旨在填补这一空白。该数据集包含覆盖农业、医疗、住房、能源、金融和食品安全六大领域的政府方案问答对,每个条目均标注了语言、领域、用户意图及多项质量评估分数。它不仅为低资源语言的自然语言处理研究提供了宝贵资源,更推动了面向印度农村居民的AI政务助手发展,对缩小数字鸿沟具有重要意义。
当前挑战
该数据集面临的核心挑战在于低资源语言的稀缺性与领域专业性。首先,Bhojpuri和Assamese缺乏大规模、标准化的语料库,导致模型训练和评估的基础薄弱,同时跨领域(如农业与医疗)的术语差异增加了语言理解的复杂性。其次,数据集构建过程中需确保问答对的事实准确性,涉及政府方案的动态政策更新,但来源有限且一致性难以保证。此外,语言质量评估依赖人工打分(0-10分制),在不同评估者间可能存在主观偏差。数据集规模较小(n<1K),这限制了模型的泛化能力,并加剧了过拟合风险,需要后续持续扩展以提升实用价值。
常用场景
经典使用场景
在低资源语言的自然语言处理研究中,asteria-bhojpuri-assamese-civic-qa数据集为构建面向印度农村居民的政务问答系统提供了核心支撑。该数据集涵盖了博杰普尔语和阿萨姆语两种少数民族语言,围绕政府福利计划如PM Kisan、Ayushman Bharat和PM Awas Yojana等关键领域,收集了用户查询与AI代理的高质量问答对。经典使用场景包括训练和评估能够识别用户意图、检索政务信息并生成多语言响应的对话模型,尤其适用于检验模型在低资源语言环境下的语义理解与事实性回答能力。
实际应用
在实际应用中,该数据集赋能了面向印度农村的AI代理,使其能够以博杰普尔语和阿萨姆语与用户进行自然对话,协助农民和低收入家庭办理农业补贴、医疗保障、住房建设、能源补贴和食品配给等政府福利申请。通过理解用户意图如APPLY_SCHEME或CHECK_ELIGIBILITY,系统可准确提供文档清单和申请指引,从而降低政务服务的语言和信息壁垒。这一应用显著提升了政务服务在农村地区的可及性,减少了因语言不通造成的政策执行障碍。
衍生相关工作
基于该数据集衍生出一系列重要工作,包括针对低资源语言对话系统的强化学习与检索增强生成(RAG)方法研究,例如结合ChromaDB构建持续改进的记忆机制。研究者还据此开发了多语言意图识别与方案映射模型,以及面向政务领域的多轮对话评估框架。此外,Adaptive Data平台在数据摄取、管理和评价方面的实践,为低资源语言数据集的高效构建与质量监控提供了可复现的技术路径,激励了后续针对更多印度低资源语言如迈蒂利语和多格拉语的类似数据集建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务