遇见数据集

ai4bharat/IndicContextEval

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

IndicContextEval是一个用于评估音频大语言模型在8种印度语言中上下文利用能力的基准数据集。该数据集包含印地语、孟加拉语、泰卢固语、马拉地语、古吉拉特语、马拉雅拉姆语、奥里亚语和乌尔都语8种语言,总共有555名说话者,55.93小时的音频,16,884个话语,覆盖23个专业领域和两种语音风格(朗读和即兴)。数据集提供了从L0到L6的7个提示级别,每个级别逐步增加上下文信号,以测试模型在不同上下文条件下的表现。数据集特征包括音频、参考文本(带标签和不带标签)、语言、时长、任务名称、领域描述、位置、语音风格、代码混合、音频块描述、各级提示、音频路径、说话者ID、性别、年龄和文件名等。

IndicContextEval is a benchmark dataset for evaluating the context utilization capabilities of audio large language models across 8 Indian languages. It includes 8 specific Indian languages: Hindi, Bengali, Telugu, Marathi, Gujarati, Malayalam, Odia and Urdu, with a total of 555 speakers, 55.93 hours of audio content, and 16,884 utterances, spanning 23 professional domains and two speech styles: read speech and extemporaneous speech. The dataset provides 7 prompt levels ranging from L0 to L6, where each level gradually increases contextual signals to test the model's performance under varying contextual conditions. Its features cover audio, reference text (both labeled and unlabeled), language, duration, task name, domain description, location, speech style, code-switching, audio chunk description, prompts at each level, audio path, speaker ID, gender, age and file name, among other relevant attributes.

提供机构:
ai4bharat
搜集汇总
数据集介绍
ai4bharat/IndicContextEval 数据集图片
构建方式
IndicContextEval 是一个专为评估音频大语言模型在八种印度语言中上下文利用能力而设计的基准数据集。该数据集汇聚了来自555位发言人的16884条语音样本,总时长约55.93小时,涵盖23个专业领域和两种语音风格(朗读与即兴演讲)。数据构建过程中,研究者为每条样本设计了从L0到L6共七个层级的提示,每一级递增一种上下文信号(如语言指定、领域元数据、音频描述、实体列表等),并确保其他条件恒定,从而系统量化上下文信息对模型性能的影响。各语言子集按语言名称划分为独立的分片,便于跨语言研究。
特点
该数据集的核心特色在于其精细化的提示分级体系(L0–L6),通过逐级添加上下文信号(如领域信息、实体列表甚至无关领域的对抗性实体),实现了对模型上下文利用能力的细粒度诊断。数据覆盖八种印度语言(印地语、孟加拉语、泰卢固语等)和23个专业领域(如医学、工程、艺术等),并包含朗读与即席演讲两种风格,展现了高度的语言与领域多样性。每条样本均提供丰富的元数据(如说话人年龄、性别、语音风格、代码混合标记等),为深入分析模型行为提供了多维视角。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,直接使用`load_dataset`函数并指定目标语言分片(如`split='Hindi'`)即可获取包含嵌入音频的样本。每个样本中的音频字段已自动解码,同时提供多种格式的参考文本(含/无标签、无括号版本)及L0至L6共七个层级的提示文本,便于研究者设计对比实验。数据集以CC-BY-4.0许可发布,允许商业与学术使用,并推荐结合官方GitHub仓库的代码与资源进行复现与评估。
背景与挑战
背景概述
随着音频大型语言模型(Audio LLMs)的快速发展,如何有效评估其利用上下文信息提升语音识别与理解能力成为一个关键问题。在此背景下,Sakshi Joshi与AI4Bharat团队于2026年发布了IndicContextEval基准数据集,旨在针对8种印度语言(印地语、孟加拉语、泰卢固语、马拉地语、古吉拉特语、马拉雅拉姆语、奥里亚语和乌尔都语)评估模型对上下文的利用能力。该数据集包含555位发音人、约56小时音频、16884条语音样本,覆盖23个专业领域和两种语音风格(朗读与即兴发言),并设计了独特的L0至L6七级提示层次,逐步注入语言、领域元数据、音频描述及实体列表等上下文信号。IndicContextEval为多语言语音理解评估提供了系统化工具,填补了低资源语言在上下文感知评估方面的空白,对推动多语言语音AI公平性与鲁棒性研究具有重要影响力。
当前挑战
IndicContextEval所解决的领域核心挑战在于,现有语音评估基准多聚焦于无上下文的语音识别任务,难以衡量模型在真实场景中利用语言、领域或语义等多元上下文信号的能力,尤其是在资源匮乏的印度语言环境中。数据集构建过程中面临多重挑战:首先,需覆盖多样化的发音人群体(555人)和23个专业领域,确保语音样本在性别、年龄、口音和语音风格上的广泛代表性;其次,设计精细化的提示级别(L0至L6)来系统化地注入或移除单个上下文变量,同时保持其他条件恒定,这要求对每个样本进行严格的标注与对齐;此外,需要为每种语言提供原生文字转录和跨语言实体列表,并确保对抗性控制项(无关领域实体)不会引入噪声干扰,这对数据质量控制提出了极高要求。
常用场景
经典使用场景
IndicContextEval作为评估音频大语言模型语境利用能力的基准数据集,其经典使用场景聚焦于多层级提示(L0至L6)下的自动语音识别与理解任务。研究者可借助该数据集,系统性地剖析模型在接收逐步递增的语境线索(如语言指定、领域元数据、音频描述、实体列表乃至干扰性信息)时,如何影响转录与语义理解的准确性与鲁棒性。通过在不同印度语言(如印地语、孟加拉语、泰卢固语等)上执行标准化测试,该数据集为衡量模型在真实多语言、多领域环境下的语境融合能力提供了严谨的评测框架,尤其适用于对比不同架构的音频大语言模型在处理丰富语境信息时的表现差异。
解决学术问题
该数据集直面语音处理领域长期存在的一个核心学术难题:如何定量评估音频大语言模型对语境信息的有效利用,而非仅仅关注声学建模层面的词错误率。传统的语音识别基准通常仅提供孤立的音频-文本对,无法衡量模型在引入语言提示、领域知识、实体上下文等辅助信号时的性能增益或干扰抵御能力。IndicContextEval通过设计的七级提示谱系,使得研究者能够分离出不同语境维度对识别效果的独立贡献,从而深入理解模型的上下文推理机制。其意义在于填补了低资源印度语言中缺乏语境感知评测标准的空白,推动了多语言语音理解研究从单纯声学匹配向认知级语境整合的范式转型。
衍生相关工作
IndicContextEval的发布已催生出一系列衍生研究工作,包括基于该基准训练语境感知的端到端语音模型、开发针对低资源语言的提示工程策略,以及探索多层级语境信号与模型注意力机制之间的内在关联。例如,研究者利用其L0至L6的渐进式语境设计,提出了对比学习框架以增强模型对关键语境线索的敏感度;另一些工作则专注于跨语言迁移学习,借助该数据集验证在主流印度语言上预训练的语境模块能否零样本泛化至除八种目标语言之外的邻近语种。此外,该基准还被用于评估最近兴起的语音-文本多模态大模型在复合语境理解任务上的短板,从而引导后续模型架构向更深层次的语义融合方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务