登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MT_dataset
MT_dataset
收藏
NIAID Data Ecosystem
2026-03-13 收录
机器翻译
数据链接:
https://figshare.com/articles/dataset/MT_dataset/20122796
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
All datasets for training MT models.
应用场景:
创建时间:
2022-06-23
相关数据集
homersimpson/opensubtitles_fr
机器翻译
语言数据
该数据集包含电影相关的元数据和翻译信息,具体包括电影的ID、年份、IMDb ID、字幕ID及其对应的语言(加泰罗尼亚语和法语)。数据集分为训练集、验证集和测试集,分别包含240000、30000和30000个示例。数据集的总下载大小为26004408字节,总大小为36369003字节。
Hugging Face
2023-12-05 更新
16
0
NeutrinoPit/OpenSubtitles2024-en-ar-batch42
机器翻译
自然语言处理
该数据集是一个包含英文和阿拉伯文字符串的数据集,用于训练模型。它包含一个训练集,共有100万条示例,数据集总大小为104,563,267字节。
Hugging Face
2025-03-04 更新
8
0
MaroneAI/French-Wolof_Translation-Dataset
机器翻译
自然语言处理
这个数据集包含了从法语到沃洛夫语的翻译对,数据经过精心收集和清洗,包括去除重复项和纠正不一致之处,确保数据集可靠且可以直接用于自动翻译模型的训练。数据适用于法语到沃洛夫语模型的微调训练、翻译模型的评估以及非洲语言的自然语言处理研究。
Hugging Face
2025-10-08 更新
8
0
BeebekBhz/ne-en
自然语言处理
机器翻译
该数据集包含训练集、验证集和测试集三个部分,每个部分都包含了字符串类型的特征ne和en。训练集包含119,204个示例,大小为13,048,099字节;验证集和测试集各包含14,901个示例,大小分别为1,618,473字节和1,643,572字节。数据集总大小为16,310,144字节,下载大小为8,892,629字节。
Hugging Face
2025-03-05 更新
9
0
NeutrinoPit/OpenSubtitles2024-en-ar-batch53
机器翻译
自然语言处理
该数据集包含两种语言的文本数据:英语(en)和阿拉伯语(ar)。它包含一个训练集,共有100万个示例,文件大小为约100MB。数据集的具体内容未在README中描述,但可以推断它是一个用于语言处理的文本数据集。
Hugging Face
2025-03-04 更新
8
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广