DoWhatISay (DOWIS)
收藏资源简介:
DOWIS是由卡尔斯鲁厄理工学院等机构联合构建的首个多语言平行语音-文本指令数据集,包含9类语音处理任务在11种语言的990条提示数据,总时长达3小时17分钟。该数据集通过专业研究人员设计基础提示及四种风格变体(正式/非正式/详细/简洁),并由母语者进行多语言翻译和真实场景录音,支持语音大模型的跨模态、跨语言评估。其创新性地将指令与任务输入解耦,可灵活适配现有评测基准,主要应用于语音识别、语音翻译等任务的现实场景性能测试,揭示了文本提示与语音提示间的显著性能差异问题。
DOWIS is the first multilingual parallel speech-text instruction dataset jointly constructed by Karlsruhe Institute of Technology and other institutions. It consists of 990 prompt samples across 11 languages for 9 categories of speech processing tasks, with a total duration of 3 hours and 17 minutes. Professional researchers designed basic prompts and four style variants (formal/informal/detailed/concise) for the dataset, and native speakers conducted multilingual translation and real-scenario audio recording, which enables cross-modal and cross-language evaluation for speech large language models. The dataset innovatively decouples instructions from task inputs, allowing flexible adaptation to existing evaluation benchmarks. It is mainly applied to real-scenario performance testing of tasks such as speech recognition and speech translation, and reveals the significant performance gap between text prompts and speech prompts.
DOWIS 数据集概述
数据集基本信息
- 数据集名称:Do What I Say (DOWIS)
- 核心定位:一个多语言的人类录制口语和书面指令提示数据集,旨在实现对语音大语言模型在口语指令条件下的现实评估。
- 访问地址:https://huggingface.co/datasets/maikezu/dowis
- 相关论文:https://arxiv.org/abs/2603.09881
数据集规模与构成
- 涵盖语言:12种语言,包括阿尔巴尼亚语 (sq)、捷克语 (cs)、德语 (de)、英语 (en)、西班牙语 (es)、法语 (fr)、匈牙利语 (hu)、意大利语 (it)、荷兰语 (nl)、葡萄牙语 (pt)、俄语 (ru)、瑞典语 (sv)。
- 涵盖任务:11项任务,包括音频章节划分 (ACHAP)、自动语音识别 (ASR)、机器翻译 (MT)、语音到语音翻译 (S2ST)、口语问答 (SQA)、语音摘要 (SSUM)、语音翻译 (ST)、文本摘要 (TSUM)、文本到语音 (TTS)、唇语识别 (LIPREAD) 和口语理解 (SLU)。
- 提示设计:每个任务-语言对提供10个提示变体,涵盖五种风格(基础、正式、非正式、详细、简短)。
- 提示模态:文本提示和音频提示(包含女性和男性音频)。
数据集目的与特点
- 核心目标:解决语音大语言模型通常使用文本提示进行评估,而不能反映用户通过语音交互的现实场景的问题。
- 设计特点:可与任何现有基准配对,用于对语音大语言模型进行现实评估。
- 研究发现:基于DOWIS的基准测试表明,文本提示的表现持续优于口语提示,尤其在低资源和跨语言设置中。仅在具有语音输出的任务中,口语提示能缩小差距。
相关资源
- 代码仓库:包含针对
phi_multimodal和qwen_omni模型的推理与评估代码。 - 模型输出:在代码仓库的
outputs文件夹中发布。 - 评估输出:评估结果包含摘要统计、每种提示类型的结果、每种模态的结果以及整体结果。
引用信息
如需使用本工作,请引用提供的BibTex条目。




