Praha-Labs/kafka-duplex-stage1-trainclean460
收藏官方服务:
资源简介:
该数据集仓库包含为Kafka-Duplex在LibriSpeech train-clean-460上构建的第一阶段JSONL清单文件。具体文件包括train.stage1.jsonl、val.stage1.jsonl、stage1_trainclean460.json和build.log。数据集规模为:训练示例259804个,验证示例5302个。构建中使用的语音编解码器为mock,块大小为200毫秒,每块包含10个语音标记。
This dataset repository contains the built Stage 1 JSONL manifests for Kafka-Duplex on LibriSpeech train-clean-460. The files include train.stage1.jsonl, val.stage1.jsonl, stage1_trainclean460.json, and build.log. The dataset counts are: 259804 train examples and 5302 val examples. The speech codec used in this build is mock, with a chunk size of 200ms and 10 speech tokens per chunk.
提供机构:
Praha-Labs


