遇见数据集

sWuggy

收藏
Hugging Face2026-05-29 更新2026-05-30 收录
官方服务:

资源简介:

sWuggy是一个口语词汇判别基准数据集,用于评估口语语言模型。每个数据项包含一个真实单词和一个音位匹配的伪单词对,这些单词对已合成为音频形式。数据集的目的是通过要求模型为每对音频分配分数(如对数概率或伪对数似然),并计算真实单词得分高于匹配伪单词的配对比例,来评估模型的词汇判别能力。数据集包含两个主要部分:inftrain/集合是主要的评估材料,涵盖英语(en)和法语(fr)两种语言,每种语言下又按不同规模划分为testset_1、testset_2、testset_4、testset_8、testset_16、testset_32和testset_64等多个测试集;zrc2021/集合是ZeroSpeech 2021挑战赛中使用的sWuggy分割,仅包含英语,分为开发集(dev)和测试集(test)。数据以WebDataset tar分片格式存储,音频文件格式为.ogg(inftrain)和.wav(zrc2021),并附带CSV/TXT格式的元数据文件,包括每项的黄金标签(gold.csv)、词汇频率信息(frequencies/*.csv)以及文件映射(*_filesmap.txt)。该数据集严格用于模型评估,禁止作为训练数据使用。

sWuggy is a spoken word discrimination benchmark dataset for evaluating spoken language models. Each data item consists of a real word and a phonemically matched pseudoword pair, synthesized into audio. The dataset aims to assess models lexical discrimination ability by requiring them to assign scores (typically log probabilities or pseudo-log-likelihoods) to each audio pair and calculating the proportion of pairs where the real word scores higher than the matched pseudoword. The dataset includes two main parts: the inftrain/ set is the primary evaluation material, covering English (en) and French (fr), with each language subdivided into multiple test sets of varying sizes (testset_1, testset_2, testset_4, testset_8, testset_16, testset_32, testset_64); the zrc2021/ set is the sWuggy split used in the ZeroSpeech 2021 challenge, containing only English and divided into development (dev) and test sets. Data is stored in WebDataset tar shards, with audio file formats as .ogg (inftrain) and .wav (zrc2021), accompanied by CSV/TXT metadata files including gold labels (gold.csv), lexical frequency information (frequencies/*.csv), and file mappings (*_filesmap.txt). The dataset is strictly for model evaluation and prohibited from being used as training data.

创建时间:
2026-05-28
原始信息汇总

数据集概述:sWuggy

sWuggy 是一个口语词汇判别基准(spoken lexical-discrimination benchmark)。数据集中每一项都是一个由真实单词(real word)和一个经过音位匹配的伪词(pseudo-word)组成的音频对。模型需要判断真实单词的概率是否高于其匹配的伪词。

主要用途

  • 用于评估口语语言模型(spoken language models)。
  • 仅限评估用途,不得用于训练。使用这些数据进行训练会污染基准测试结果。

数据集结构

数据集分为两个顶级集合:

  1. inftrain/ (主评估材料)
    • 按语言(英语 en、法语 fr)和测试集(testset_1testset_64)划分。
    • 包含音频文件(WebDataset tar shards)和元数据文件(CSV)。
  2. zrc2021/ (ZeroSpeech 2021 sWuggy 数据集)
    • 仅包含英语,分为开发集(dev)和测试集(test)。

数据格式

  • 音频以 WebDataset tar shards 形式打包。
  • inftrain/ 中的音频格式为 .oggzrc2021/ 中的音频格式为 .wav
  • 元数据文件以 CSVTXT 格式存储,位于音频目录旁。

元数据文件

  • gold.csv / *.gold.csv:包含每个项目的真实标签(gold labels)。
  • frequencies/testset_N.csv:包含每个项目的词汇频率信息。
  • *_filesmap.txt(仅 zrc2021):包含项目标识符与音频文件的映射。

访问数据

使用 datasets 库流式加载音频: python from datasets import load_dataset

加载英语 inftrain 的 testset_1

ds = load_dataset( "webdataset", data_files={"test": "hf://datasets/coml/sWuggy/inftrain/en/audio/testset_1-*.tar"}, split="test", streaming=True, )

直接读取元数据(无需下载音频): python import polars as pl

gold = pl.read_csv("hf://datasets/coml/sWuggy/inftrain/en/gold.csv") freqs = pl.read_csv("hf://datasets/coml/sWuggy/inftrain/en/frequencies/testset_1.csv")

下载特定文件: python from huggingface_hub import hf_hub_download

path = hf_hub_download( repo_id="coml/sWuggy", repo_type="dataset", filename="inftrain/en/gold.csv", )

评估方法

  • 对于每个单词/伪词对,模型需输出一个分数(通常是对数概率或伪对数似然值)。
  • 准确率为真实单词得分高于其匹配伪词的概率。

许可证

  • 基于 Academic Free License v3.0(afl-3.0) 发布。
搜集汇总
数据集介绍
sWuggy 数据集图片
构建方式
sWuggy是一项专为口语语言模型设计的词汇辨别基准测试,其构建基于真实词汇与经过音位规则匹配的伪词配对。每一对音频均通过语音合成技术生成,从而确保测试材料在声学特征上的可控性与一致性。数据集涵盖英语与法语两种语言,音频文件以WebDataset格式打包为tar分片,并附有每项测试所需的元数据文件,包括黄金标签与词汇频率信息。此外,数据集中还整合了ZeroSpeech 2021挑战赛的sWuggy子集,进一步丰富了基准的适用场景。
特点
sWuggy的核心特点在于其评估逻辑的简洁性与针对性:模型需通过对每对音频分配的概率值来判断真实词是否高于伪词,从而衡量其词汇辨别能力。数据集设计了多个测试子集(testset_1至testset_64),每个子集包含不同数量的合成语音样本,便于研究者分析模型性能随样本量的变化趋势。所有音频均以无损格式存储,确保了音频质量的完整性。同时,数据集明确声明仅供评估使用,禁止用于训练,以维护基准的公正性与长期有效性。
使用方法
使用sWuggy数据集时,研究者可通过HuggingFace Datasets库的webdataset加载器以流式方式获取音频,避免一次性下载全部数据。元数据文件(如gold.csv)可直接通过hf://协议读取,便于与音频数据按文件主键进行关联。评估流程要求模型为每个音频项计算得分(如对数概率),并比较同一对中真实词与伪词的得分高低,最终以准确率作为评价指标。此外,HuggingFace Hub提供了文件级下载与快照功能,方便用户灵活管理数据存储。
背景与挑战
背景概述
sWuggy是一项面向口语语言模型的词汇辨别基准测试,由计算语言学社群(如ZeroSpeech系列工作)的研究人员创建,旨在评估模型在语音层面区分真实词与音位匹配伪词的能力。该数据集诞生于对无文本监督口语理解模型的评估需求日益增长的背景下,其核心研究问题在于衡量模型对语音单元中词汇性(lexicality)的敏感性。通过合成音频对(含英语和法语)构成评测体系,sWuggy为口语语言处理领域提供了一项受控、可重复的定量评估工具,对推动低资源语言建模及语音表征学习的研究具有重要影响。
当前挑战
sWuggy所解决的领域核心挑战在于,口语语言模型常缺乏对语音中词汇真伪的判别能力,而传统评测多依赖文本转录,无法直接评估语音层面的词汇知识。构建过程中,研究人员需克服伪词生成与真实词在音位概率上精确匹配的难题,以确保评测焦点落在词汇性判别而非语音统计差异上。此外,合成音频的多样性与自然度控制、跨语言(英、法)测试集的平衡、以及大规模音频数据的高效组织与开源分发(如WebDataset分片)也给工程实现带来了显著挑战。
常用场景
经典使用场景
在语音语言模型的研究疆域中,sWuggy作为一项精巧的词汇判别基准,其经典使用场景聚焦于评估模型对真实词汇与音位规则匹配的伪词汇的区分能力。数据集以成对的音频片段为核心,每个配对包含一个真实词与一个经由音位规则合成的伪词,模型需通过赋予真实词更高的概率得分来展示其语音理解深度。这种设计不仅检验了模型对语音信号的敏感度,更深刻揭示了其内在的词汇表征能力,为衡量模型从连续语音流中抽取语言知识的水准提供了严谨而富有洞察力的工具。
解决学术问题
sWuggy精巧地回应了语音语言模型领域一个历久弥新的学术问题:模型能否像人类听者一样,在听到词汇的瞬间便识别出其真实性,而非仅仅依赖声学特征的简单匹配?该数据集通过构建音位匹配的伪词对照,迫使模型必须调用深层的词汇知识,而非停留在浅层声学模式识别层面。这一设计有效规避了模型利用语音统计规律进行取巧的可能,从而更纯粹地评估模型对语言本体的理解程度,其意义在于推动了从信号处理到语言认知的研究范式转换,为构建真正具备语言能力的自监督语音模型铺设了坚实的评估基石。
衍生相关工作
sWuggy的诞生并非孤立的评价活动,而是深深植根于零资源语音处理的探索脉络之中,特别是与ZeroSpeech系列的历届挑战赛形成了紧密的相互映照。该数据集直接衍生自ZeroSpeech 2021挑战赛的sWuggy任务,其独特的词汇判别范式已成为评估低资源语音模型语言能力的重要标尺。在此基准的启示下,众多学者围绕如何提升模型对伪词的敏锐度展开了深入研究,催生了包括对比预测编码、自监督特征学习等在内的诸多前沿算法优化。sWuggy的约束性设计,即严格禁止将其用作训练数据,也引发了社区对模型泛化能力与评价体系纯洁性的广泛讨论,对于推动语音评估方法论的科学化与标准化产生了持续而深远的影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务