遇见数据集

Steveeeeeeen/yodas-granary-it-neucodec-10s-20s

收藏
Hugging Face2026-05-13 更新2026-05-31 收录
官方服务:

资源简介:

Granary Italian VoxPopuli NeuCodec是一个用于NeuTTS微调的数据集,基于NeuCodec编码的意大利语语音数据。源数据来自espnet/yodas-granary数据集中的Italian配置,经过流式处理并保存为Parquet分片。数据行包含文本、编码、持续时间、源数据集信息等列,并应用了文本过滤(仅限意大利语,标签为<it>)以及时长(10-20秒)、字符数(8-260字符)、字符每秒速率(3-32字符/秒)等筛选条件,最大训练样本数为500,000。

Granary Italian VoxPopuli NeuCodec is a dataset of NeuCodec-tokenized rows for NeuTTS fine-tuning. The source rows were streamed from espnet/yodas-granary / Italian and uploaded as resumable Parquet shards. It includes columns such as text, codes, duration, source metadata, with text filtering enabled for Italian language (tag: <it>), and constraints on duration (10-20 seconds), text characters (8-260 characters), characters per second (3-32 chars/sec), and a maximum of 500,000 training samples.

提供机构:
Steveeeeeeen
二维码
社区交流群
二维码
科研交流群
商业服务