登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
semeru/galeras-causal4se-3k-levenshtein
semeru/galeras-causal4se-3k-levenshtein
收藏
Hugging Face
2024-04-01 更新
2024-04-19 收录
文本处理
字符串相似度
数据链接:
https://hf-mirror.com/datasets/semeru/galeras-causal4se-3k-levenshtein
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
semeru
原始信息汇总
数据集概述
许可证信息
许可证类型
: Apache-2.0
相关数据集
BOE_with_BERTIN_for_tokenize_2045
自然语言处理
文本处理
该数据集包含三个主要特征:'boe_text_cleaned'、'tweet_text_cleaned'和'text',均为字符串类型。数据集被划分为训练集、验证集和测试集,分别包含2867、392和389个样本。数据集的下载大小为44398934字节,总大小为100456413字节。
Hugging Face
2024-12-16 更新
16
0
Ahmadsameh8/QalbPreprocessedAndMergedwithPunct
机器学习
文本处理
--- dataset_info: features: - name: correct dtype: string - name: incorrect dtype: string splits: - name: train num_bytes: 19474726 num_examples: 18350 - name: validation
Hugging Face
2024-04-30 更新
9
0
jkeisling/projectgutenberg-kokoro_v1-mimi
文本处理
语音识别
该数据集包含四个字段:整数序列的codes、规范化文本的text_normalized、音素序列的phonemes和说话者ID的speaker_id。数据集提供了一个训练集,包含300万个示例,总大小约为16GB。数据集适用于需要处理文本和音频数据的NLP和语音处理任务。
Hugging Face
2025-02-02 更新
8
0
kienlc1/final_T5_train_data_splitted
机器学习
文本处理
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 606403423 num_examples: 371985 download_size: 290860117 dataset_size: 606403423 configs:
Hugging Face
2024-06-06 更新
10
0
hafizalfaza/dataset_fe683849-1c0a-4747-b311-0167ce059585
图像处理
文本处理
该数据集包含图像和文本两种类型的数据,主要用于训练目的。训练集包含18个样本,总大小为28644165字节。数据集的下载大小为28646685字节,与数据集大小相近。数据集的配置文件指定了默认配置,数据文件路径为data/train-*。
Hugging Face
2024-06-30 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广