登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
BAAI-MTP
BAAI-MTP
收藏
智源
2023-10-18 更新
2025-04-26 收录
机器翻译
双语文本
数据链接:
https://data.baai.ac.cn/datadetail/BAAI-MTP
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
MTP由总计3亿条中英文关联文本对构成
应用场景:
提供机构:
智源研究院
创建时间:
2023-09-14
搜集汇总
数据集介绍
背景与挑战
背景概述
BAAI-MTP(Massive Text Pairs)是一个大规模中英文关联文本对数据集,由北京智源人工智能研究院构建并开源。该数据集包含总计3亿条文本对,其中中文记录1亿条,英文记录2亿条,是目前开源的最大规模中英文关联文本对数据集,主要用于训练中英文语义向量模型。数据集以JSON格式存储,每条记录包含查询语句(query)、正样本列表(pos)和负样本列表(neg)。
以上内容由遇见数据集搜集并总结生成
相关数据集
TRAD Chinese-French Parallel Text -- Broadcast News
机器翻译
平行语料库
Introduction TRAD Chinese-French Parallel Text -- Broadcast News was developed by ELDA as part of the <a href="http://www.elra.info/en/projects/archi
DataCite Commons
2021-07-01 更新
26
0
emuchogu/swahili-english-translation
机器翻译
自然语言处理
该数据集包含1,115,700个训练示例,每个示例包含三个字符串类型的特征:prompt、input和output。数据集总大小为238,795,332字节,下载大小为70,521,389字节。数据集的默认配置指定了训练数据文件的路径。
Hugging Face
2024-10-18 更新
12
0
Udith-Sandaruwan/sinhala-english-qa
自然语言处理
机器翻译
该数据集包含问题和答案对,每个问题和答案均为字符串类型。数据集分为一个训练集,包含7,587,051个样本,总大小为5,407,440,945字节。数据集的配置名为default,数据文件路径为data/train-*。
Hugging Face
2024-09-28 更新
7
0
Parikshith/grow-1-monolingual-ha-en-comet-wmt21
机器翻译
翻译质量评估
--- dataset_info: features: - name: src dtype: string - name: mt dtype: string - name: score dtype: float64 splits: - name: small num_bytes: 24923873 num_examples: 1000
Hugging Face
2023-12-02 更新
17
0
michsethowusu/dyula-tswana_sentence-pairs
自然语言处理
机器翻译
Dyula-Tswana句子对数据集包含非洲语言的句子对和它们之间的相似度评分。该数据集每行有三个字段:相似度评分、Dyula语言句子和Tswana语言句子。该数据集适用于训练和评估用于翻译、句子相似度以及跨语言转移学习的机器学习模型。
Hugging Face
2025-04-02 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广