官方服务:
资源简介:
:unav
应用场景:
相关数据集
MinQan/amazon_reviews_multi_VN
该数据集名为多语言亚马逊评论语料库,主要用于多语言文本分类任务。数据集包含英语、日语、德语、法语、中文和西班牙语的亚马逊产品评论,收集时间跨度为2015年11月1日至2019年11月1日。每条记录包含评论文本、评论标题、星级评分、匿名评论者ID、匿名产品ID和产品类别。数据集在每种语言中的星级评分分布是平衡的,每个星级评分占每种语言评论的20%。每种语言的训练集、开发集和测试集分别包含200,00
Hugging Face2024-06-04 更新2200
wanhin/clean_wanhin_rulev2
--- dataset_info: features: - name: vi dtype: string - name: en dtype: string splits: - name: train num_bytes: 21013980 num_examples: 59730 download_size: 7357026 dataset
Hugging Face2024-06-01 更新170
bot-yaya/UPRPRC_BLOCKWISE
该数据集是一个多语言文本数据集,包含阿拉伯语、中文、德语、英语、世界语、西班牙语、法语、希伯来语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、瑞典语、泰语、越南语和中文(MD5加密版本)等语言的文本。此外,数据集还包含了段落数、低质量段落数、去重段落数、文件名、时间戳、是否待查文件、是否跨文件重复、是否重复、是否重复文件等元数据信息。数据集分为训练集,其大小为61374874324字节,
Hugging Face2025-11-04 更新150
TDT3 Multilanguage Text Version 2.0
Introduction Topic Detection and Tracking (TDT) refers to automatic techniques for finding topically related material in streams of data such as newswire and broadcast news. The TDT3 corpus was create
DataONE2023-06-15 更新380
patrikgerard/combined_uk_ru_dataset_v3
该数据集包含多个特征,包括唯一标识符(unique_id)、输入(input)、分类(classification)和原始数据集(original_dataset)。数据集分为训练集和测试集,训练集包含16417个样本,测试集包含1824个样本。数据集的总下载大小为8831638字节,总数据集大小为18666794字节。
Hugging Face2024-07-12 更新150



