NeuroBench/mswc_fscil_subset
收藏资源简介:
这是一个针对Few-shot Class-incremental Learning任务的Multilingual Spoken Word Corpus数据集的子集。包含15种语言,分为5种基础语言(英语、德语、加泰罗尼亚语、法语、基尼亚鲁旺达语)和10种增量学习语言(波斯语、西班牙语、俄语、威尔士语、意大利语、巴斯克语、波兰语、世界语、葡萄牙语、荷兰语)。每种基础语言有20个类别,训练、验证和测试的样本数量分别为500、100、100。每种增量学习语言有10个类别,每个类别有200个样本,其中一小部分用于少量样本训练,100个用于测试。模型最初有100个基础类别的单词的知识库,到所有增量学习会话结束时扩展到200个单词。
This is a subset of the Multilingual Spoken Word Corpus dataset for the Few-shot Class-incremental Learning task. It includes 15 languages, divided into 5 base languages (English, German, Catalan, French, Kinyarwanda) and 10 incrementally learned languages (Persian, Spanish, Russian, Welsh, Italian, Basque, Polish, Esparanto, Portuguese, Dutch). Each of the 5 base languages has 20 classes with 500/100/100 samples for train/val/test splits. Each of the 10 incremental languages has 10 classes, each with 200 samples, with a small number (e.g., 5) chosen for few-shot training and 100 for testing. The model starts with a knowledge base of 100 words from the base classes, expanding to 200 words by the end of all incremental sessions.
多语言口语单词数据集子集
数据集概述
该数据集是多语言口语单词语料库的一个子集,专门为少样本类增量学习(Few-shot Class-incremental Learning, FSCIL)任务构建。
语言选择
- 基础语言:5种(英语、德语、加泰罗尼亚语、法语、基尼亚卢旺达语)
- 增量学习语言:10种(波斯语、西班牙语、俄语、威尔士语、意大利语、巴斯克语、波兰语、世界语、葡萄牙语、荷兰语)
任务描述
FSCIL任务首先使用5种基础语言的大量训练数据训练模型,然后在后续的增量学习阶段,模型必须从每种增量语言中学习新单词,每个单词只有少量训练样本,同时保留所有先前学习过的单词知识。
数据划分
- 基础语言:每种语言包含20个类别,每个类别有500/100/100个样本用于训练/验证/测试。
- 增量学习语言:每种语言包含10个类别,每个类别有200个可用样本。其中,少量样本(例如5个)用于少样本训练,100个样本用于测试。
模型知识扩展
模型首先拥有100个基础类别单词的知识库,经过所有增量学习阶段后,扩展到200个单词。
数据格式
默认情况下,NeuroBench工具将安装48kHz的opus格式数据。16kHz的wav格式音频文件也可从本仓库下载。




