登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Languages
Languages
收藏
kaggle
2024-04-17 更新
2024-04-26 收录
语言识别
多语言文本处理
数据链接:
https://www.kaggle.com/datasets/devbachani/languages
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
1000 train files and 450 test files for each language
针对每种语言,提供1000个训练文件和450个测试文件。
应用场景:
创建时间:
2024-04-17
相关数据集
defunct-datasets/amazon_reviews_multi
多语言文本处理
情感分析
多语言亚马逊评论数据集包含英语、日语、德语、法语、中文和西班牙语的亚马逊产品评论,收集于2015年11月1日至2019年11月1日之间。每条记录包含评论文本、评论标题、星级评分、匿名评论者ID、匿名产品ID和产品类别。数据集在每种语言中平衡了星级评分,每个星级评分占评论的20%。每种语言的训练集、开发集和测试集分别包含200,000、5,000和5,000条评论。评论的最大长度为2,000字符,最
Hugging Face
2023-11-02 更新
150
0
wanhin/clean_wanhin_rulev2
多语言文本处理
--- dataset_info: features: - name: vi dtype: string - name: en dtype: string splits: - name: train num_bytes: 21013980 num_examples: 59730 download_size: 7357026 dataset
Hugging Face
2024-06-01 更新
17
0
bot-yaya/UPRPRC_BLOCKWISE
多语言文本处理
质量控制
该数据集是一个多语言文本数据集,包含阿拉伯语、中文、德语、英语、世界语、西班牙语、法语、希伯来语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、瑞典语、泰语、越南语和中文(MD5加密版本)等语言的文本。此外,数据集还包含了段落数、低质量段落数、去重段落数、文件名、时间戳、是否待查文件、是否跨文件重复、是否重复、是否重复文件等元数据信息。数据集分为训练集,其大小为61374874324字节,
Hugging Face
2025-11-04 更新
15
0
community-datasets/euronews
多语言文本处理
实体识别
Europeana Newspapers数据集是一个多语言命名实体识别(NER)数据集,包含德语、法语和荷兰语的文本数据。数据集由专家生成注释,语言由众包生成。数据集支持的任务是命名实体识别,数据字段包括id、tokens和ner_tags,其中ner_tags用于标记命名实体。数据集的结构包括多个配置,每个配置对应不同的语言和数据集来源,每个配置包含训练集的数据实例、数据字段和数据分割信息。
Hugging Face
2024-06-24 更新
19
0
patrikgerard/combined_uk_ru_dataset_v3
多语言文本处理
机器学习
该数据集包含多个特征,包括唯一标识符(unique_id)、输入(input)、分类(classification)和原始数据集(original_dataset)。数据集分为训练集和测试集,训练集包含16417个样本,测试集包含1824个样本。数据集的总下载大小为8831638字节,总数据集大小为18666794字节。
Hugging Face
2024-07-12 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广