官方服务:
资源简介:
Source: John the Evangelist
来源:福音书作者约翰(John the Evangelist)
应用场景:
相关数据集
MinQan/amazon_reviews_multi_VN
该数据集名为多语言亚马逊评论语料库,主要用于多语言文本分类任务。数据集包含英语、日语、德语、法语、中文和西班牙语的亚马逊产品评论,收集时间跨度为2015年11月1日至2019年11月1日。每条记录包含评论文本、评论标题、星级评分、匿名评论者ID、匿名产品ID和产品类别。数据集在每种语言中的星级评分分布是平衡的,每个星级评分占每种语言评论的20%。每种语言的训练集、开发集和测试集分别包含200,00
Hugging Face2024-06-04 更新2200
community-datasets/euronews
Europeana Newspapers数据集是一个多语言命名实体识别(NER)数据集,包含德语、法语和荷兰语的文本数据。数据集由专家生成注释,语言由众包生成。数据集支持的任务是命名实体识别,数据字段包括id、tokens和ner_tags,其中ner_tags用于标记命名实体。数据集的结构包括多个配置,每个配置对应不同的语言和数据集来源,每个配置包含训练集的数据实例、数据字段和数据分割信息。
Hugging Face2024-06-24 更新190
patrikgerard/combined_uk_ru_dataset_v3
该数据集包含多个特征,包括唯一标识符(unique_id)、输入(input)、分类(classification)和原始数据集(original_dataset)。数据集分为训练集和测试集,训练集包含16417个样本,测试集包含1824个样本。数据集的总下载大小为8831638字节,总数据集大小为18666794字节。
Hugging Face2024-07-12 更新150
defunct-datasets/amazon_reviews_multi
多语言亚马逊评论数据集包含英语、日语、德语、法语、中文和西班牙语的亚马逊产品评论,收集于2015年11月1日至2019年11月1日之间。每条记录包含评论文本、评论标题、星级评分、匿名评论者ID、匿名产品ID和产品类别。数据集在每种语言中平衡了星级评分,每个星级评分占评论的20%。每种语言的训练集、开发集和测试集分别包含200,000、5,000和5,000条评论。评论的最大长度为2,000字符,最
Hugging Face2023-11-02 更新1500
wanhin/clean_wanhin_rulev2
--- dataset_info: features: - name: vi dtype: string - name: en dtype: string splits: - name: train num_bytes: 21013980 num_examples: 59730 download_size: 7357026 dataset
Hugging Face2024-06-01 更新170



