PolySpeech-100
收藏资源简介:
PolySpeech-100是一个大规模基准测试数据集,用于评估超过100种语言和方言的语音理解能力。该数据集包含压缩的Parquet文件,存储音频和文本数据,总大小约为430 GB,并托管在Hugging Face平台上。
PolySpeech-100 is a large-scale benchmark dataset designed for evaluating speech understanding capabilities across over 100 languages and dialects. It contains compressed Parquet files that store both audio and text data, with a total size of approximately 430 GB, and is hosted on the Hugging Face platform.
PolySpeech-100 Benchmark 数据集概述
PolySpeech-100 是一个大规模语音理解基准数据集,覆盖 100 多种语言和方言。
核心特征
- 数据集规模:约 430 GB。
- 数据格式:采用 Parquet 格式存储音频和文本数据,可通过脚本下载并还原为原始
.wav和.txt文件。 - 托管平台:Hugging Face,数据集标识为
youngseng/PolySpeech-100-v1。 - 论文与演示:
- 论文地址:https://arxiv.org/abs/2606.01016
- 演示页面:https://youngseng.github.io/PolySpeech-100/
- 排行榜页面:https://youngseng.github.io/PolySpeech-100/benchmark.html
排行榜简介
排行榜展示了不同模型在 PolySpeech-100 上的性能表现,从整体得分、高资源语言(High-Res)、中文方言(CN-Dialect)、低资源语言(Low-Res)四个维度评估。当前排名靠前的模型包括:
- Gemini-3-flash (闭源):整体得分最高(85.30)。
- GPT-Audio-mini (闭源):整体得分 56.63。
- Whisper-v3 + Qwen2.5 (流水线):整体得分 53.86。
- Fun-Audio-Chat (开源端到端):整体得分 52.88。
数据准备
提供 prepare_dataset.py 脚本自动从 Hugging Face 下载数据集并还原文件。支持按语言选择性下载(推荐先下载英语)或下载完整数据集。
- 示例:下载英语:
python prepare_dataset.py --lang eng_Latn --output_dir ./Restored-PolySpeech - 下载全部:
python prepare_dataset.py --lang all --output_dir ./Restored-PolySpeech
推理与评估
- 推理:提供基于不同模型的推理脚本示例(如 Qwen2.5-Omni 和 Covo-Audio),需用户自行配置环境和下载预训练权重。支持零样本、噪声环境、思维链(CoT)、多示例(few-shot)等多种评估模式。
- 评估:通过
python evaluate.py脚本计算准确率并生成摘要报告。
引用
若该基准数据对研究有帮助,请引用以下论文:
@misc{yang2026polyspeech100largescalebenchmarkspeech, title={PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects}, author={Sicheng Yang and Shulan Ruan and Shiwei Wu and Yu Liu and Lu Fan and Zhi Li and You He}, year={2026}, eprint={2606.01016}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.01016}, }




