登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
tokenizers
tokenizers
收藏
kaggle
2024-08-21 更新
2024-10-26 收录
文本预处理
语音转文本
数据链接:
https://www.kaggle.com/datasets/sachinmohanty/tokenizers
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
BPE_Tokenizer for xttsv2
BPE分词器,适用于xttsv2数据集
应用场景:
创建时间:
2024-08-21
相关数据集
omarelsayeed/good_chats_dataset_pre_tokenization
自然语言处理
文本预处理
--- dataset_info: features: - name: Chat_ID dtype: string - name: text dtype: string splits: - name: train num_bytes: 97515949 num_examples: 33735 download_size: 30316154
Hugging Face
2024-02-23 更新
15
0
whucedar/datasets_stt_1
语音识别
语音转文本
该数据集包含音频和句子两个主要特征。音频特征的采样率为16000Hz,句子特征为字符串类型。数据集分为训练集和测试集,训练集包含1007个样本,测试集包含431个样本。数据集的下载大小为572702091字节,总大小为580331887.528字节。数据文件路径分别为训练集的data/train-*和测试集的data/test-*。
Hugging Face
2024-07-10 更新
9
0
xtts_14_11
语音合成
语音转文本
test to speech model built on 14/11/2024 Yash & Dhruveel
kaggle
2024-11-14 更新
6
0
GGarri/PoCcustomdata
语音识别
语音转文本
该数据集包含音频和对应的转录文本,音频的采样率为16000Hz。数据集分为训练集、测试集和验证集,分别包含1460、418和209个样本。训练集的大小约为1.2GB,测试集约为349MB,验证集约为181MB。总下载大小约为1.11GB,数据集总大小约为1.73GB。
Hugging Face
2024-07-02 更新
11
0
livinNector/ta-oscar-tokenizer-clean
自然语言处理
文本预处理
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 9037331867 num_examples: 556772 download_size: 2891190241 dataset_size: 9037331867 --- #
Hugging Face
2023-04-12 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广