遇见数据集

AssameseQA

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

Assamese问答数据集(AssameseQA)是一个专门为阿萨姆语设计的抽取式问答数据集,旨在支持多语言Transformer模型(如mBERT、IndicBERT、MuRIL、XLM-RoBERTa)的训练与评估,并推动低资源语言的NLP研究。该数据集包含阿萨姆语的上下文、问题及对应的答案,内容涵盖历史、地理、文化、教育、科学、常识、公司政策、客户支持和信息文章等多个领域。数据集规模在1,000到10,000个样本之间,以CSV格式组织,包含训练集、测试集和完整数据集文件。每个样本包含以下字段:阿萨姆语上下文、阿萨姆语问题、正确答案、答案在上下文中的起始字符位置以及样本是否经过人工验证的标识。数据集由两部分构成:约50%为作者手动创建并验证的原始QA对;另外约50%改编自AI4Bharat IndicQA数据集的阿萨姆语部分,并经过了清洗、标准化和格式统一处理。该数据集适用于抽取式问答、检索增强生成、阿萨姆语对话AI、教育NLP及低资源语言研究,但不适用于医疗诊断、法律咨询、财务决策或安全关键型应用。数据集采用CC BY 4.0许可证发布。

Assamese Question Answering Dataset (AssameseQA) is an extractive question answering dataset specifically designed for the Assamese language, aiming to support the training and evaluation of multilingual Transformer models such as mBERT, IndicBERT, MuRIL, and XLM-RoBERTa, and promote NLP research on low-resource languages. This dataset includes Assamese contexts, questions, and corresponding answers, covering multiple domains including history, geography, culture, education, science, common sense, corporate policies, customer support, and informational articles. The dataset has a size ranging from 1,000 to 10,000 samples, is organized in CSV format, and contains training set, test set, and full dataset files. Each sample encompasses the following fields: Assamese context, Assamese question, correct answer, the starting character position of the answer within the context, and a flag indicating whether the sample has undergone manual verification. The dataset is composed of two parts: approximately 50% are original QA pairs manually created and verified by the authors; the remaining approximately 50% are adapted from the Assamese section of the AI4Bharat IndicQA dataset, and have undergone cleaning, standardization, and format unification processing. This dataset is applicable to extractive question answering, retrieval-augmented generation, Assamese conversational AI, educational NLP, and low-resource language research, but is not suitable for medical diagnosis, legal consultation, financial decision-making, or safety-critical applications. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-07-13
原始信息汇总

Assamese Question Answering Dataset (AssameseQA)

基本信息

  • 任务类型:抽取式问答(Extractive Question Answering)
  • 语言:阿萨姆语(Assamese,语言代码 as
  • 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 数据集规模:1,000 < n < 10,000 条样本
  • 数据格式:CSV 格式

数据集组成

  • 约 50% 人工创建:由作者手动编写并验证的阿萨姆语上下文和问答对,涵盖客户支持、公司知识库、阿萨姆历史、教育、技术、科学、常识、日常生活等主题。
  • 约 50% 改编自 AI4Bharat IndicQA:仅使用阿萨姆语部分,经过清洗、归一化、格式标准化后整合。

数据文件

仓库包含三个文件:

  • train.csv
  • test.csv
  • combined_dataset.csv

数据列说明

列名 说明
Context 阿萨姆语上下文或段落
Question 阿萨姆语问题
Answer 正确答案
Starting Point 答案在上下文中开始的字符位置
Verified 样本是否经过人工验证

示例

Context Question Answer Starting Point Verified
অসমৰ ৰাজধানী দিছপুৰ। অসমৰ ৰাজধানী কি? দিছপুৰ 10 Yes

适用场景

  • 微调 mBERT、IndicBERT、MuRIL、XLM-RoBERTa
  • 抽取式问答
  • 检索增强生成(RAG)
  • 阿萨姆语对话式 AI
  • 低资源语言 NLP 研究

不适用场景

  • 医疗诊断、法律咨询、财务决策、安全关键型应用

潜在局限

  • 主题偏向教育和客户支持领域
  • 方言多样性有限
  • 缺少对话式阿萨姆语
  • 高度技术领域样本较少

推荐使用方式

  • 抽取式问答系统
  • 检索系统
  • 多语言 NLP 研究
  • 阿萨姆语语言模型
  • 学术研究
  • 生产系统建议结合其他阿萨姆语语料库

引用信息

使用时请引用 AssameseQA 和 AI4Bharat IndicQA 两个数据集。

搜集汇总
数据集介绍
AssameseQA 数据集图片
构建方式
AssameseQA数据集的构建融合了手动创作与现有数据集的精炼适配。约50%的样本由作者原创撰写,覆盖阿萨姆历史、地理、文化、教育、科学、通用知识以及客服文档等多个领域,每一对问答均经过人工审核以确保质量。另一半数据源自AI4Bharat IndicQA数据集的阿萨姆语子集,经过清洗、标准化、字段统一及格式转换后,与手动部分合并,形成了统一的CSV格式。整个过程避免了机器翻译,保留了原生语言的真实性。
特点
该数据集专为抽取式问答任务设计,包含超过1000条样本,每一条均由上下文、问题、答案及答案起始字符位置构成,并标注了人工验证状态。其特色在于聚焦低资源语言阿萨姆语,支持多语言Transformer模型如mBERT、IndicBERT、MuRIL和XLM-RoBERTa的微调与评估。数据集覆盖主题广泛,从日常生活到专业技术,兼顾了通用性与领域多样性,为低资源NLP研究提供了宝贵资源。
使用方法
数据集以CSV格式提供训练集、测试集及合并文件,可直接用于抽取式问答模型的训练与评估。用户可加载文件,提取上下文、问题及答案字段,利用答案起始位置进行精确的跨度预测。建议结合多语言预训练模型进行微调,并应用于检索增强生成、阿萨姆语对话系统及学术研究。在部署至实际应用前,需针对具体场景评估模型表现,并可与其他阿萨姆语语料联合使用以增强鲁棒性。
背景与挑战
背景概述
AssameseQA数据集由Sankhyahrick Swami于2026年创建,专注于阿萨姆语这一低资源语言的抽取式问答任务。该数据集约50%为人工编写与校验的问答对,涵盖历史、地理、文化、教育、科学、客服等多个领域,其余50%源自AI4Bharat IndicQA数据集的阿萨姆语子集,经过清洗与标准化处理。数据集旨在支持mBERT、IndicBERT、MuRIL、XLM-RoBERTa等多语言Transformer模型的微调与评估,推动阿萨姆语自然语言处理的研究与发展,为低资源语言问答系统的构建提供了关键资源。
当前挑战
AssameseQA面临的挑战包括:在领域问题层面,阿萨姆语作为低资源语言,缺乏大规模、高质量的问答数据集,限制了多语言模型在该语言上的问答性能,且现有模型对阿萨姆语的理解能力明显弱于高资源语言;在数据集构建层面,人工标注部分需确保覆盖多样领域与自然语言表达,同时解决数据稀疏与方言变异问题,而源自IndicQA的子集需经过严格的清洗与格式统一,以避免噪声与不一致性,此外,字符级答案定位的精确标注也增加了构建难度。
常用场景
经典使用场景
AssameseQA数据集在自然语言处理领域中,主要被用于抽取式问答任务的模型训练与评估。研究者通常利用该数据集对多语言Transformer模型(如mBERT、IndicBERT、MuRIL和XLM-RoBERTa)进行微调,以检验其在阿萨姆语这一低资源语言上的语义理解和文本定位能力。数据集中的每个样本均包含上下文段落、提问语句以及源自上下文的标准答案及其起始字符位置信息,为模型学习从非结构化文本中精准抽取答案提供了结构化训练范例,尤其适用于基准测试和跨语言迁移学习效果的对比分析。
解决学术问题
该数据集直接回应了低资源语言在机器阅读理解领域的研究匮乏问题。阿萨姆语作为印度东北部的主要语言,长期以来缺乏高质量的抽取式问答语料,导致面向该语言的模型训练和评测难以开展。AssameseQA通过人工构建与外部资源标准化处理相结合的方式,首次提供了包含多领域上下文的问答数据集,使学术界能够系统地评估多语言模型在阿萨姆语上的抽取性能,并探索跨语言知识迁移、领域适应性以及数据增强策略在小语种NLP应用中的有效性,填补了这一关键研究空白。
衍生相关工作
AssameseQA的发布催生了一系列面向低资源语言的问答研究方向。相关经典工作包括:基于该数据集验证多语言预训练模型在阿萨姆语上的微调策略比较研究,探讨不同分词方法与模型架构对抽取精度的影响;探索领域自适应与对抗训练技术以缓解数据稀疏问题的工作;以及将该数据集作为评测基准,结合迁移学习与多任务学习范式,评估跨语言能力向未见过语种的泛化效果。此外,部分研究以此为基础,扩展构建了更大规模的阿萨姆语问答语料库,推动了该语言在信息检索与对话系统领域的持续进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务