登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Jigsaw-Multilingual-Avg-Blender
Jigsaw-Multilingual-Avg-Blender
收藏
kaggle
2020-06-18 更新
2024-03-08 收录
多语言处理
混合数据
数据链接:
https://www.kaggle.com/datasets/yeayates21/jigsawmultilingualrobertaavgblender
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Jigsaw Multilingual Average Blender
Jigsaw多语言平均混合器(Jigsaw Multilingual Average Blender)
应用场景:
创建时间:
2020-04-28
相关数据集
jhu-clsp/seamless-align-expressive
语音翻译
多语言处理
Seamless-Align-Expressive数据集是一个用于翻译和音频到音频任务的多语言数据集,支持德语、英语、西班牙语、法语、意大利语和中文。数据集基于Meta AI发布的表达性语音到语音(S2S)数据,包含5种语言对的数据,压缩后约为228GB。数据集未进行分割,且数据可能包含个人身份信息、敏感内容或互联网上公开的有毒内容。数据集的创建过程中使用了SONAR Expressive编码器来
Hugging Face
2024-02-22 更新
50
0
WenWW/KD_multilingual_dataset
多语言处理
文本数据
该数据集包含多种语言的文本数据,每种语言的数据集都有不同的字节大小和样本数量。数据集的特征包括文本内容(text)和唯一标识符(id)。数据集涵盖了德语(de)、法语(fr)、西班牙语(es)、意大利语(it)、波兰语(pl)、罗马尼亚语(ro)、荷兰语(nl)、希腊语(el)、匈牙利语(hu)、葡萄牙语(pt)、捷克语(cs)、瑞典语(sv)、保加利亚语(bg)、丹麦语(da)、芬兰语(fi)、
Hugging Face
2024-12-04 更新
18
0
PartiallyTyped/answerable_tydiqa_5fbde19f5f4ac461c405a962adddaeb6
问答系统
多语言处理
该数据集包含多个特征,包括问题、语言、答案的起始位置和文本、上下文以及序列ID。数据集被划分为训练集和验证集,训练集包含29868个示例,验证集包含3712个示例。
Hugging Face
2022-10-30 更新
9
0
britllm/TransWebEdu
多语言处理
教育科技
TransWebEdu是一个预训练规模的多语言平行语料库,支持十种语言:阿拉伯语、威尔士语、德语、英语、西班牙语、法语、印度尼西亚语、意大利语、俄语和斯瓦希里语。它专门用于从零开始预训练TransWebLLM模型,聚焦于多语言网络教育内容。
Hugging Face
2025-04-22 更新
21
0
sproos/wikipedia-title-text-pairs
多语言处理
自然语言处理
--- dataset_info: - config_name: ab features: - name: title dtype: string - name: text dtype: string splits: - name: train num_bytes: 1644341 num_examples: 1576 download_si
Hugging Face
2024-01-03 更新
15
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广