遇见数据集

PolySpeech-100

收藏
github2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

PolySpeech-100是一个大规模基准测试数据集,用于评估超过100种语言和方言的语音理解能力。该数据集包含压缩的Parquet文件,存储音频和文本数据,总大小约为430 GB,并托管在Hugging Face平台上。

PolySpeech-100 is a large-scale benchmark dataset designed for evaluating speech understanding capabilities across over 100 languages and dialects. It contains compressed Parquet files that store both audio and text data, with a total size of approximately 430 GB, and is hosted on the Hugging Face platform.

创建时间:
2026-05-23
原始信息汇总

PolySpeech-100 Benchmark 数据集概述

PolySpeech-100 是一个大规模语音理解基准数据集,覆盖 100 多种语言和方言。

核心特征

  • 数据集规模:约 430 GB。
  • 数据格式:采用 Parquet 格式存储音频和文本数据,可通过脚本下载并还原为原始 .wav.txt 文件。
  • 托管平台:Hugging Face,数据集标识为 youngseng/PolySpeech-100-v1
  • 论文与演示
    • 论文地址:https://arxiv.org/abs/2606.01016
    • 演示页面:https://youngseng.github.io/PolySpeech-100/
    • 排行榜页面:https://youngseng.github.io/PolySpeech-100/benchmark.html

排行榜简介

排行榜展示了不同模型在 PolySpeech-100 上的性能表现,从整体得分、高资源语言(High-Res)、中文方言(CN-Dialect)、低资源语言(Low-Res)四个维度评估。当前排名靠前的模型包括:

  • Gemini-3-flash (闭源):整体得分最高(85.30)。
  • GPT-Audio-mini (闭源):整体得分 56.63。
  • Whisper-v3 + Qwen2.5 (流水线):整体得分 53.86。
  • Fun-Audio-Chat (开源端到端):整体得分 52.88。

数据准备

提供 prepare_dataset.py 脚本自动从 Hugging Face 下载数据集并还原文件。支持按语言选择性下载(推荐先下载英语)或下载完整数据集。

  • 示例:下载英语:python prepare_dataset.py --lang eng_Latn --output_dir ./Restored-PolySpeech
  • 下载全部:python prepare_dataset.py --lang all --output_dir ./Restored-PolySpeech

推理与评估

  1. 推理:提供基于不同模型的推理脚本示例(如 Qwen2.5-Omni 和 Covo-Audio),需用户自行配置环境和下载预训练权重。支持零样本、噪声环境、思维链(CoT)、多示例(few-shot)等多种评估模式。
  2. 评估:通过 python evaluate.py 脚本计算准确率并生成摘要报告。

引用

若该基准数据对研究有帮助,请引用以下论文:

@misc{yang2026polyspeech100largescalebenchmarkspeech, title={PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects}, author={Sicheng Yang and Shulan Ruan and Shiwei Wu and Yu Liu and Lu Fan and Zhi Li and You He}, year={2026}, eprint={2606.01016}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.01016}, }

搜集汇总
数据集介绍
PolySpeech-100 数据集图片
构建方式
PolySpeech-100 数据集是一个大规模、多语言的语音理解基准测试集,其构建基于对超过100种语言及方言的语音数据的系统化收集与整理。数据源自多个公开语料库,经过统一的格式转换和质量筛选,最终以压缩的 Parquet 文件形式存储在 Hugging Face 平台上。整个数据集体量约为 430 GB,包含原始的 .wav 音频文件和对应的 .txt 文本标注,确保了数据的完整性和可复现性。为了方便用户按需获取,我们提供了一个统一的 Python 脚本,支持按特定语言(如英语 eng_Latn)选择性下载与还原,有效节省了传输带宽与存储空间。
特点
该数据集的核心特点在于其极致的语言覆盖广度与评估维度的多样性。它覆盖了全球 100 多种语言与方言,并特别设计了高资源语言(High-Res)、中国方言(CN-Dialect)与低资源语言(Low-Res)三个子集,以全面评测模型在不同语言条件下的泛化能力。此外,基准测试还引入了噪声环境评估(如 High Noise)与少样本学习(3-shot)及思维链(Chain-of-Thought)等复杂任务场景,从而系统性地衡量语音理解模型的鲁棒性与推理能力。多维度、多层次的评价体系使其成为语音领域最全面的基准之一。
使用方法
使用 PolySpeech-100 数据集时,首先需要克隆 GitHub 仓库并创建 Python 3.10 的 Conda 环境,安装 pandas、librosa、transformers 等核心依赖。接着,通过执行 `prepare_dataset.py` 脚本并指定目标语言(如 `--lang eng_Latn`)来从 Hugging Face 下载并还原所需数据。下载完成后,即可针对不同模型类型运行推理脚本:对于语音到文本任务(如 Qwen2.5-Omni),使用 `inference_qwen2_5_omni.py` 并可通过 `--shots`、`--cot` 或 `--augment` 参数配置零样本、少样本或噪声测试;对于语音到语音任务(如 Covo-Audio),则需在其官方仓库内调用相应的推理脚本。最后,运行 `evaluate.py` 计算准确率并生成总结报告。
背景与挑战
背景概述
随着全球化进程的加速与多语言交互需求的激增,语音理解系统在真实世界场景中面临着语种多样性与方言复杂性的严峻考验。目前主流的语音基准测试集多聚焦于高资源语种,对低资源语言、方言及高噪声环境下的评测覆盖严重不足。为此,Sicheng Yang、Shulan Ruan等研究人员于2026年发布了PolySpeech-100数据集,旨在构建一个涵盖超过100种语言与方言的大规模语音理解评测基准。该数据集源自公开语料库的精心筛选与整合,以约430GB的海量音频数据为核心,为评估模型在多样化声学条件下的鲁棒性提供了标准化平台。PolySpeech-100的推出不仅填补了多语言语音评测的空白,更通过发布开源工具与排行榜,推动了跨语言语音识别与理解技术的迭代发展。
当前挑战
PolySpeech-100所解决的领域核心挑战在于,现有语音评测框架难以兼顾高资源与低资源语言的性能均衡,尤其在方言识别、高噪声环境及低资源场景下,模型表现往往急剧退化。构建过程中,团队面临了数据量庞大(~430GB)带来的分布式存储与高效加载难题,为此设计基于Parquet的压缩方案与分语言下载机制。此外,不同语言标注格式的异构性、方言样本的稀缺性以及噪声增强策略的标准化,均为数据整合与评测一致性带来了额外复杂性。如何确保评测指标既能反映整体能力,又能精细刻画模型在高噪声、方言或低资源子集上的差异,亦是该基准持续完善的重要挑战。
常用场景
经典使用场景
PolySpeech-100数据集最经典的使用场景是多语言与方言的语音理解模型评估。该基准测试涵盖了超过100种语言及方言,并特别设计了高噪声环境、高资源语言与低资源语言等多个维度,用以系统性地测试语音理解系统在多样且复杂声学条件下的鲁棒性与泛化能力。通过统一的评估脚本与标准化数据划分,研究者能够公平地对比不同架构的端到端模型与流水线系统的性能表现。
衍生相关工作
围绕PolySpeech-100,已衍生出多项具有代表性的研究工作。例如,基于Qwen2.5-Omni的端到端语音理解模型在Chain-of-Thought推理与少样本学习设置下展现了卓越的跨语言能力;Covo-Audio等语音到语音架构则专注于挖掘低资源语言与方言的翻译能力。此外,该基准的公开排行榜持续激励社区开发适配于多语言环境的噪声抑制模块、语种识别增强技术以及高效的低资源语言预训练策略。
数据集最近研究
最新研究方向
当前,随着多语言全球通信需求的激增,语音理解技术正面临从少数主流语言向超大规模语言与方言泛化的关键挑战。PolySpeech-100数据集应运而生,它以覆盖100余种语言及方言的庞大规模,为构建和评估通用语音理解模型提供了前所未有的标准化测试平台。该基准不仅囊括了高资源语言与低资源语言,还特别纳入了中文方言与高噪声场景,精准聚焦于现实应用中模型对复杂声学环境与语言多样性的鲁棒性。前沿研究围绕闭源大模型(如Gemini-3-flash)与开源端到端系统的性能鸿沟展开,尤其在跨语言零样本学习、链式思维推理增强及噪声鲁棒性提升等方向催生了激烈竞争。该数据集的发布深刻推动了多语言语音基础模型的公平对比与可复现性研究,为打破语言壁垒、实现普惠智能语音交互奠定了坚实的评测基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务