遇见数据集

IndicContextEval

收藏
arXiv2026-06-17 更新2026-06-19 收录
官方服务:

资源简介:

IndicContextEval是由AI4Bharat和Sarvam AI联合创建的多语言语音基准数据集,旨在系统评估音频大语言模型在上下文利用方面的性能。该数据集包含56小时的自然语音,覆盖8种印度语言(印地语、孟加拉语等)和23个专业领域,数据来源于555名说话者的朗读和即兴演讲,并经过严格的质量控制和人工转录。数据集通过设计七级提示框架,逐步引入元数据、自然语言描述和实体列表等上下文信号,以分析模型对特定语境信息的依赖程度。其核心应用在于评测和提升音频大语言模型的上下文感知能力,解决传统语音识别系统在利用提示信息时可能存在的参数记忆而非真正语境理解的问题。

IndicContextEval is a multilingual speech benchmark dataset jointly created by AI4Bharat and Sarvam AI, which is designed to systematically evaluate the context utilization performance of audio large language models (LLMs). This dataset comprises 56 hours of natural speech, covering 8 Indian languages (Hindi, Bengali, etc.) and 23 professional domains. The data is sourced from read and impromptu speeches delivered by 555 speakers, and has undergone rigorous quality control and manual transcription. The dataset designs a seven-level prompt framework to gradually introduce contextual signals such as metadata, natural language descriptions and entity lists, so as to analyze the model's dependence on specific contextual information. Its core application lies in evaluating and enhancing the contextual awareness capability of audio LLMs, and addressing the issue that traditional speech recognition systems may rely on parameter memory rather than genuine contextual understanding when utilizing prompt information.

创建时间:
2026-06-17
原始信息汇总

IndicContextEval 数据集概述

基本信息

  • 全称: IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages
  • 发布机构: AI4Bharat, IIT Madras 与 Sarvam AI
  • 论文链接: https://arxiv.org/abs/2606.19157
  • 数据集地址: https://huggingface.co/datasets/AI4Bharat/IndicContextEval
  • 许可协议: CC BY 4.0
  • 收录会议: Interspeech 2026

数据集规模

  • 总时长: 56小时
  • 语种覆盖: 8种印度语言(包括 Hindi、Bengali、Telugu 等)
  • 说话人数: 555位
  • 专业领域: 23个专业领域

数据集用途

评估音频大语言模型(AudioLLMs)在语音识别任务中对上下文信息的利用能力,特别是区分模型是否真正利用提供的上下文提示,还是依赖预训练阶段学到的参数化知识。

提示层级框架(L0–L6)

数据集设计了7级提示,逐步引入上下文信息:

层级 添加的上下文
L0 无上下文(纯转录,无语言提示)
L1 指定目标语言(基线)
L2 + 结构化领域元数据
L3 + 自然语言音频描述
L4 + 英文脚本实体列表
L5 + 本地语种脚本实体列表
L6 + 无关领域实体列表(对抗性)

数据集构成

每个音频样本提供三种参考转录变体:

  • reference_text_with_tags: 本地语种 + 英文标签(原始)
  • reference_text_no_tags: 仅本地语种(用于计算WER)
  • reference_text_no_brackets: 本地语种 + 英文内联,无括号

评估指标

  • WER(词错误率): 经Indic NLP Library归一化,并对每个样本进行200%参考长度的截断处理(防止解码失控/重复循环主导平均分)
  • NEER(命名实体错误率): 参考命名实体中缺失或错误的比例

评估结果(截断WER%按提示层级)

层级 GPT-4o Gemini 3 Flash Gemma 3n Sarvam Audio
L0 29.83 24.30 51.21 20.39
L1 28.61 18.90 38.73 16.86
L2 28.37 19.28 52.20 16.78
L3 26.08 18.39 40.22 16.43
L4 27.97 19.88 46.37 16.80
L5 26.04 17.46 43.11 15.70
L6 28.47 19.67 47.95 16.69

独立ASR基线 IndicConformer (L1) 的 WER 为 18.81%,NEER 为 29.58%。

引用信息

bibtex @inproceedings{joshi2026indiccontexteval, title = {IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages}, author = {Joshi, Sakshi and Rathi, Dhruv Subhash and Singh, Sanskar and George, Eldho Ittan and Hari, R J and Bhogale, Kaushal and Khapra, Mitesh M.}, booktitle = {Proc. Interspeech}, year = {2026}, note = {arXiv:2606.19157} }

联系方式

  • 邮箱: sakshijcom@gmail.com
搜集汇总
数据集介绍
IndicContextEval 数据集图片
构建方式
IndicContextEval的构建旨在填补现有音频大语言模型(AudioLLM)上下文利用评估的空白,其数据收集策略兼具系统性与多样性。研究团队从555位母语者处采集了涵盖8种印度语言(印地语、孟加拉语、泰卢固语等)和23个专业领域(如医学、工程、数据科学)的自然语音,总计55.93小时。语音通过两种方式获取:一是围绕专业领域问题的即兴演讲(extempore speech),二是阅读经领域专家校对的、包含专业术语的句子。所有录音均经过多轮质量审核,确保声学质量与领域相关性,并由专业标注员进行逐字转写,保留代码混合片段,将英文命名实体音译为本地文字并附英文原文。
特点
该数据集的核心特点在于其精细且具有区分度的七级提示分类体系(L0至L6),能够系统解构不同上下文信号对转录行为的影响。L0为无上下文基线,L1仅指定语言,L2至L6依次引入结构化领域元数据、自然语言音频描述、英文实体列表、本地文字实体列表,以及来自无关领域的对抗性实体。这一设计使研究者能够精确归因每个上下文变量的贡献。实验揭示出模型间存在显著的上下文利用策略差异:部分模型(如GPT-4o Transcribe)展现出平衡利用能力,能从正确上下文中获益并抵御对抗性干扰;而另一些模型(如Gemma-3N)则对上下文过度敏感,甚至出现性能骤降。
使用方法
IndicContextEval为评估AudioLLM的上下文利用能力提供了标准化协议。评估时需遵循固定的提示结构:上下文块之后紧跟一致的转录指令,要求模型以本地文字输出,忽略犹豫词,并将英文词汇音译。核心指标包括词错误率(WER)和命名实体错误率(NEER),后者专门用于量化实体提示(L4-L6)的效能。通过比较相邻级别间的性能变化(如L5与L4之间的差异衡量文字匹配成本,L6与L1的差异揭示对抗性鲁棒性),研究者可以系统分析模型对特定上下文信号的真实依赖程度。数据集及配套评估工具已开源,支持后续研究复现与扩展。
背景与挑战
背景概述
随着多模态大语言模型的蓬勃发展,音频大语言模型(AudioLLMs)在语音识别领域展现出巨大潜力,这类模型能够依据文本提示(如领域描述或实体列表)进行条件式转录。然而,现有基准测试多聚焦于固定提示条件下的评估,缺乏对模型是否真正利用上下文信号进行判断的系统性方案。为填补这一空白,印度理工学院马德拉斯分校的AI4Bharat团队与Sarvam AI于2025年联合发布了IndicContextEval基准。该数据集汇聚了555名讲者的56小时自然语音,覆盖8种印度语言和23个专业领域,并设计了七级渐进式提示框架(L0至L6),通过引入元数据、自然语言描述、英文及本土文字实体列表乃至对抗性提示,系统评估模型的上下文利用能力。这一开创性工作为理解AudioLLMs的语境推理行为提供了关键工具,对推动多语言、跨领域语音识别研究具有里程碑意义。
当前挑战
IndicContextEval所聚焦的核心挑战在于AudioLLMs的上下文利用机制。首先,现有模型在是否真正利用提示进行转录上表现迥异——部分模型如GPT-4o Transcribe展现出稳健的语境推理能力,能选择性利用正确提示而抵御对抗性干扰;相反,Gemma-3N对实体提示存在盲目依赖,对抗性场景下词错误率飙升9.22%。其次,上下文形式对性能影响显著:自然语言描述(L3)一致优于结构化元数据(L2),而本土文字实体列表(L5)相较英文列表(L4)可带来高达11个点的词错误率改善,揭示出脚本不匹配代价的巨大挑战。此外,数据集构建中需确保555名讲者涵盖多样背景与录音条件,且需对8种语言进行严格的多阶段人工质检与领域术语标注,这要求精细的跨语言协调与高昂的人力成本。
常用场景
经典使用场景
IndicContextEval的核心使用场景在于评估音频大语言模型(AudioLLMs)在多语言、多领域环境下对上下文信息的利用能力。该基准通过设计7级渐进式提示框架(L0–L6),系统性地引入语言标识、领域元数据、自然语言描述、实体列表(英语与原生文字)乃至对抗性错误实体等不同层级的上下文信号,从而精准衡量模型在转录过程中是否真正依赖所提供的外部语境,抑或仅仅依赖预训练阶段的参数记忆。这种精细化的评估方法使其成为检验AudioLLMs上下文鲁棒性、脚本适应能力及对抗性稳定性的标杆性工具。
解决学术问题
IndicContextEval旨在解决现有语音识别基准无法评估模型上下文真实利用程度的学术难题。传统基准如CommonVoice或FLEURS仅在固定提示条件下测试转录性能,而ContextASR或ProfASR虽侧重上下文场景,但多依赖合成语音或单一语言。该数据集通过汇聚8种印度语言、23个专业领域的自然语音,并引入对抗性提示与实体脚本差异分析,首次实现了对AudioLLMs上下文利用行为的因果归因。其意义在于揭示了模型在上下文利用上的四种截然不同的行为模式——平衡利用、敏感利用、不稳定利用与上下文盲,为后续研究提供了可量化的评估标准,推动了多语言语音AI的透明化与可控性发展。
衍生相关工作
IndicContextEval的发布直接推动了多语言上下文语音识别领域的系列衍生工作。该基准的对抗性提示设计与脚本差异分析方法,启发了后续研究如基于检索的偏置短语选择(BR-ASR)、强化学习的唤醒词检索机制,以及轻量级提示偏置方法等。同时,其揭示的模型行为差异促使学界深入探索上下文注入机制的改进,例如通过分离音频编码与语言模型接口来增强上下文整合的稳定性。此外,该数据集也为零样本领域适应、跨语言实体识别及多脚本转录优化等方向提供了标准化评测平台,形成了从基准测试到模型改进的完整研究闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务