登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
christinacdl/Multilingual_Clickbait_Dataset
christinacdl/Multilingual_Clickbait_Dataset
收藏
Hugging Face
2024-02-19 更新
2024-03-04 收录
点击诱饵
多语言
数据链接:
https://hf-mirror.com/datasets/christinacdl/Multilingual_Clickbait_Dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: apache-2.0 ---
应用场景:
提供机构:
christinacdl
原始信息汇总
数据集许可证
许可证类型:Apache 2.0
相关数据集
xmmmu
多语言
视觉问答
该数据集支持多种语言的视觉问答和多选题任务,包括阿拉伯语、法语、印地语、印尼语、日语和葡萄牙语。每个语言配置包含大约300个示例,数据集大小在1K到10K之间。数据集的许可证为MIT。
Hugging Face
2024-10-28 更新
75
0
agentlans/openchat_sharegpt4_dataset
文本生成
多语言
这是一个经过处理的 sharegpt_clean.json 版本数据集,名为 openchat/openchat_sharegpt4_dataset。数据集支持多种语言,包括英语、中文、韩语、西班牙语、法语、日语、德语、葡萄牙语、俄语、意大利语、印尼语、越南语、荷兰语、波兰语、土耳其语、捷克语、希伯来语和乌克兰语。处理步骤包括纠正对话顺序、添加语言字段、去重、删除URL、电子邮件和电话号码等个人信
Hugging Face
2025-12-16 更新
28
0
ocisd4/common_voice
语音数据
多语言
该数据集包含多种语言版本(如德语、英语、西班牙语等),每个版本的数据集包含音频和消息两个主要特征。音频的采样率为16000Hz,消息包含内容和角色两个字段。数据集分为训练集,每个训练集的大小和示例数量有所不同。
Hugging Face
2024-11-17 更新
16
0
wecover/OPUS
翻译
多语言
该数据集主要来源于OPUS平台,包含了多个语料库,如UNPC、GlobalVoices、TED2020、News-Commentary、WikiMatrix、Tatoeba、Europarl和OpenSubtitles。每个语料库的每个语言对随机抽取了25,000个样本,数据未经修改。数据集涵盖了多种语言,包括但不限于非洲语、阿拉伯语、中文、英语、法语、德语、日语等。
Hugging Face
2024-05-23 更新
66
0
Tagengo
多语言
自然语言处理
Tagengo数据集是由Lightblue KK创建的一个高质量多语言聊天数据集,包含超过70,000个提示-响应对,涵盖74种语言。该数据集由人类生成的提示和合成响应组成,用于训练和评估多语言大型语言模型。创建过程中,数据集通过严格的筛选和清洗,确保了数据的质量和多样性。Tagengo数据集主要应用于提升大型语言模型在多语言环境下的聊天能力,解决现有模型在非英语语言上的性能不足问题。
arXiv
2024-05-21 更新
27
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广