登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Multilingual Spam Data
Multilingual Spam Data
收藏
kaggle
2021-03-24 更新
2024-03-07 收录
多语言
垃圾邮件
数据链接:
https://www.kaggle.com/datasets/rajnathpatel/multilingual-spam-data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Multilingual Spam Data for English, Hindi, German, and French
面向英语、印地语、德语与法语的多语言垃圾邮件数据集
应用场景:
创建时间:
2021-03-24
相关数据集
facebook/covost2
语音翻译
多语言
CoVoST 2 是一个大规模的多语言语音翻译语料库,涵盖了从21种语言到英语以及从英语到15种语言的翻译。该数据集使用Mozilla的开源Common Voice数据库创建,包含了2,900小时的语音数据。数据集设计用于语音到文本的翻译任务,常用的评估指标是BLEU分数。数据集包含多种语言的音频文件、转录文本和翻译文本。
Hugging Face
2024-01-18 更新
413
0
Babelscape/multinerd
实体识别
多语言
MultiNERD数据集是首个语言无关的方法,用于自动创建多语言、多类型和细粒度的命名实体识别(NER)和实体消歧注释。该数据集覆盖10种语言(中文、荷兰语、英语、法语、德语、意大利语、波兰语、葡萄牙语、俄语和西班牙语),15个NER类别(人物、地点、组织、动物、生物实体、天体、疾病、事件、食物、仪器、媒体、植物、神话实体、时间和交通工具),以及2种文本类型(维基百科和维基新闻)。数据集结构包括t
Hugging Face
2023-04-20 更新
22
0
clips/beir-nl-dbpedia-entity
信息检索
多语言
BEIR-NL是一个荷兰语版本的BEIR基准测试,涵盖了从生物医学、金融文本到一般网络内容的各种领域。数据集包含多个任务,如事实核查、问答、生物医学信息检索、论点检索、重复问题检索、引用预测和实体检索。数据集结构包括corpus、queries和qrels文件,分别用于存储文档、查询和查询文档相关性判断。数据集的创建目的是为了促进荷兰语信息检索模型的发展,通过自动翻译BEIR数据集来实现。然而,数
Hugging Face
2025-02-10 更新
15
0
parallel-sentences
自然语言处理
多语言
# Parallel Sentences for 50+ languages > [!NOTE] > This repository contains raw datasets, all of which have also been formatted for easy training in the [Parallel Sentences Datasets](https://huggingf
魔搭社区
2025-11-06 更新
25
0
pei39/Taxi1500-RawData-test
多语言
文本分类
该数据集包含多个配置,每个配置对应一种特定的语言或脚本,数据文件按分割(如taxi1500)和路径组织。
Hugging Face
2024-06-03 更新
18
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广