遇见数据集

ggfox00000/stt-tedx-test-fr

收藏
Hugging Face2026-04-28 更新2026-05-03 收录
官方服务:

资源简介:

mTEDx French — test split是一个用于自动语音识别(ASR)任务的法语TEDx演讲测试数据集。数据集提供了两种配置:utterance(短句级别)和long_form(长格式)。utterance配置包含2007个短句(3-10秒),适合短句级别的语音识别评估;long_form配置包含10个完整的TEDx演讲(8-13分钟),适合长格式语音识别评估。数据集来源于facebook/mtedx,遵循CC-BY-NC-ND-4.0许可证,非商业用途,不允许修改和重新分发。

license: CC-BY-NC-ND-4.0 task_categories: - 自动语音识别(Automatic Speech Recognition, ASR) language: - 法语(fr) size_categories: - 1K<n<10K pretty_name: mTEDx 法语版 — 测试拆分(分句配置与长文本配置) tags: - mTEDx - TEDx - Facebook - 法语 - ASR - 语音 - 长文本 - 公开演讲 annotations_creators: - 专家标注 source_datasets: - 扩展|mTEDx(extended|mtedx) dataset_info: - config_name: utterance features: - name: id dtype: string - name: talk_id dtype: string - name: cue_idx dtype: int32 - name: start_sec dtype: float64 - name: end_sec dtype: float64 - name: duration_sec dtype: float64 - name: transcript dtype: string - name: audio dtype: audio: sampling_rate: 16000 splits: - name: test num_examples: 2007 - config_name: long_form features: - name: talk_id dtype: string - name: audio dtype: audio: sampling_rate: 16000 - name: transcript dtype: string - name: duration_total_sec dtype: float64 - name: n_segments dtype: int32 - name: segments list: - name: start dtype: float64 - name: end dtype: float64 - name: text dtype: string splits: - name: test num_examples: 10 configs: - config_name: utterance default: true data_files: - split: test path: data/test-*.parquet - config_name: long_form data_files: - split: test path: data/long_form/test-*.parquet # mTEDx 法语版 — 测试集镜像(源自`facebook/mtedx`) 本仓库为**公开镜像**,复刻自mTEDx法语版的`test`拆分(Salesky 等人,2021,Facebook 人工智能实验室),为法语TEDx演讲语料库。 > 本仓库提供**两种配置**,可根据评测需求选择: > > - **`utterance`**(历史默认配置):包含2007条短句(时长3-10秒),通过TED的**VTT字幕提示词**切割而来。适用于分句级词错误率(Word Error Rate, WER)评测,可与FLEURS、MLS、CoVoST-2、VoxPopuli等数据集对标。 > - **`long_form`**:包含10条数据,对应10条**完整演讲**(单条时长8-13分钟,总时长约1.69小时)。适用于**真实场景下**的Whisper模型评测:支持分块解码、时序漂移、分块间一致性等测试场景。 ## 配置项 ### `utterance` — VTT字幕切割(分句级) - 2007条分句(时长3-10秒,16kHz单声道FLAC格式) - 通过TED字幕的VTT时间码切割得到。 - 若演讲开头(<15秒)存在“译者/校对者:”类文本,则自动过滤。 - 数据字段:`id`、`start_sec`、`end_sec`、`duration_sec`、`talk_id`、`cue_idx`、`audio`、`transcript` - 词错误率评测参考文本为`transcript`字段。 python from datasets import load_dataset ds = load_dataset("ggfox00000/stt-tedx-test-fr", "utterance", split="test") ### `long_form` — 完整演讲 - 10条数据,对应10条**完整TEDx演讲**(单条时长8-13分钟,16kHz单声道FLAC格式) - 音频直接从上游源文件重采样得到,未进行二次切割。 - `segments`字段为源自上游`txt/segments`与`txt/test.fr`的**官方mTEDx标准分割**(Salesky 等人),相比`utterance`配置使用的TED VTT字幕,分割更为严谨。 - 数据字段:`talk_id`、`audio`、`transcript`、`duration_total_sec`、`n_segments`、`segments`(为`{start, end, text}`结构的列表) - 使用场景:长文本Whisper模型评测(分块解码模式、`return_timestamps`参数)、长文本与分句配置的性能对比、分块间一致性评估。 python from datasets import load_dataset ds = load_dataset("ggfox00000/stt-tedx-test-fr", "long_form", split="test") sample = ds[0] print(sample["talk_id"], sample["duration_total_sec"], sample["n_segments"]) print(sample["audio"]["sampling_rate"], sample["audio"]["array"].shape) print("first segment:", sample["segments"][0]) ## 预处理流程 ### `utterance` 配置 - 源音频:每条演讲对应1条立体声FLAC文件(上游源为44.1kHz或48kHz) - 通过VTT提示词**切割**音频(`audio[start:end]`) - 通过`numpy.mean(axis=1)`与`soxr.resample(quality="HQ")`将48kHz立体声重采样为16kHz单声道。 - 最终编码为单声道PCM_16格式的FLAC文件。 ### `long_form` 配置 - 源音频:每条演讲对应1条立体声FLAC文件(上游源为44.1kHz或48kHz,时长8-13分钟) - **未进行任何时序切割**,完整保留原始演讲音频。 - 通过numpy均值与soxr HQ算法将立体声转换为单声道,并将采样率从44.1kHz/48kHz重采样至16kHz。 - 最终编码为单声道PCM_16格式的FLAC文件。 - `segments`字段解析自: - 上游源的`txt/segments`文件(每行格式为`<seg_id> <talk_id> <start> <end>`) - 上游源的`txt/test.fr`文件(每行对应一个片段,顺序与`segments`列表一致) ## 源数据来源 - 上游数据集:`facebook/mtedx`(https://www.openslr.org/100/) - 相关论文:Salesky 等人,2021,《面向语音识别与机器翻译的多语言TEDx语料库》(发表于Interspeech 2021) - 原始源数据:公开TEDx演讲(https://www.ted.com) ## 许可证 **CC-BY-NC-ND-4.0**(继承自上游mTEDx数据集——仅可用于非商业用途,仅允许重采样与编码类技术修改,不得进行其他修改后再分发) ## 引用格式 bibtex @inproceedings{salesky2021mtedx, title = {{The Multilingual TEDx Corpus for Speech Recognition and Translation}}, author = {Salesky, Elizabeth and others}, booktitle = {Proceedings of Interspeech 2021}, year = {2021}, }

提供机构:
ggfox00000
二维码
社区交流群
二维码
科研交流群
商业服务