遇见数据集

Praha-Labs/kafka-duplex-stage1-trainclean460

收藏
Hugging Face2026-05-16 更新2026-05-31 收录
官方服务:

资源简介:

该数据集仓库包含为Kafka-Duplex在LibriSpeech train-clean-460上构建的第一阶段JSONL清单文件。具体文件包括train.stage1.jsonl、val.stage1.jsonl、stage1_trainclean460.json和build.log。数据集规模为:训练示例259804个,验证示例5302个。构建中使用的语音编解码器为mock,块大小为200毫秒,每块包含10个语音标记。

This dataset repository contains the built Stage 1 JSONL manifests for Kafka-Duplex on LibriSpeech train-clean-460. The files include train.stage1.jsonl, val.stage1.jsonl, stage1_trainclean460.json, and build.log. The dataset counts are: 259804 train examples and 5302 val examples. The speech codec used in this build is mock, with a chunk size of 200ms and 10 speech tokens per chunk.

提供机构:
Praha-Labs
二维码
社区交流群
二维码
科研交流群
商业服务