官方服务:
资源简介:
Source: 2 Timothy (Korean)
来源:《提摩太后书》(韩语版)
应用场景:
相关数据集
defunct-datasets/amazon_reviews_multi
多语言亚马逊评论数据集包含英语、日语、德语、法语、中文和西班牙语的亚马逊产品评论,收集于2015年11月1日至2019年11月1日之间。每条记录包含评论文本、评论标题、星级评分、匿名评论者ID、匿名产品ID和产品类别。数据集在每种语言中平衡了星级评分,每个星级评分占评论的20%。每种语言的训练集、开发集和测试集分别包含200,000、5,000和5,000条评论。评论的最大长度为2,000字符,最
Hugging Face2023-11-02 更新1500
patrikgerard/combined_uk_ru_dataset_v3
该数据集包含多个特征,包括唯一标识符(unique_id)、输入(input)、分类(classification)和原始数据集(original_dataset)。数据集分为训练集和测试集,训练集包含16417个样本,测试集包含1824个样本。数据集的总下载大小为8831638字节,总数据集大小为18666794字节。
Hugging Face2024-07-12 更新150
CHINAYWX/g
该数据集包含中文和英文文本对,主要用于机器翻译或双语文本处理任务。数据集包含一个训练集分割,共有1,010,000个样本,每个样本包含一个中文文本和一个对应的英文文本。数据集总大小为352,412,149字节,下载大小为170,935,526字节。
Hugging Face2024-09-25 更新130
wanhin/clean_wanhin_rulev2
--- dataset_info: features: - name: vi dtype: string - name: en dtype: string splits: - name: train num_bytes: 21013980 num_examples: 59730 download_size: 7357026 dataset
Hugging Face2024-06-01 更新170
bot-yaya/UPRPRC_BLOCKWISE
该数据集是一个多语言文本数据集,包含阿拉伯语、中文、德语、英语、世界语、西班牙语、法语、希伯来语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、瑞典语、泰语、越南语和中文(MD5加密版本)等语言的文本。此外,数据集还包含了段落数、低质量段落数、去重段落数、文件名、时间戳、是否待查文件、是否跨文件重复、是否重复、是否重复文件等元数据信息。数据集分为训练集,其大小为61374874324字节,
Hugging Face2025-11-04 更新150



