登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Bilingual Corpus of Arabic-English Parallel Tweets
Bilingual Corpus of Arabic-English Parallel Tweets
收藏
OpenXLab
2026-04-18 收录
机器翻译
社交媒体双语处理
数据链接:
https://openxlab.org.cn/datasets/OpenDataLab/Bilingual_Corpus_of_etc
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
英语-阿拉伯语平行推文的双语语料库和定期发布英语-阿拉伯语推文的 Twitter 帐户列表。
应用场景:
提供机构:
OpenDataLab
创建时间:
2022-05-23
相关数据集
Napizia/Good-Sicilian-in-NLLB
机器翻译
自然语言处理
该数据集名为Good Sicilian in the NLLB,主要关注西西里语的翻译质量。数据集由Project Napizia提供,旨在帮助语言模型学习符合西西里文学传统的语言。数据集包含从NLLB数据集中筛选出的高质量西西里语翻译对,并通过Napizia的翻译模型进行评分。数据集还提供了50,000对最佳翻译对的CSV文件。数据集来源于Meta AI发布的元数据,并经过Allen AI的处理
Hugging Face
2025-08-16 更新
15
0
Stanley8712/telugu2-mistralformat
机器翻译
泰卢固语
--- dataset_info: features: - name: idx dtype: int64 - name: src dtype: string - name: tgt dtype: string - name: text dtype: string splits: - name: train num_bytes: 4
Hugging Face
2023-11-30 更新
6
0
Booster Dataset
立体视觉匹配
镜面与透明表面处理
我们提出了一种新颖的高分辨率且具有挑战性的立体数据集,将室内场景与密集且准确的地面真相差异进行注释。我们的数据集特有的是几个镜面和透明表面的存在,即最先进的立体声网络故障的主要原因。我们的采集管道利用了一种新颖的深时空立体声框架,该框架可以轻松,准确地以亚像素精度进行标记。我们总共发布了在64个不同场景中收集的419个样本,并用密集的地面真相差异进行注释。每个样本包括高分辨率对 (12 mpx)
OpenXLab
4
0
michsethowusu/kinyarwanda-tsonga_sentence-pairs
自然语言处理
机器翻译
该数据集包含非洲语言句子对及其相似度评分,适用于机器翻译、句子对齐或其他自然语言处理任务。数据集基于NLLBv1构建,包含332,229行,每行有三个字段:相似度评分、基尼亚鲁旺达语句子和宗加语句子。可用于训练和评估机器学习模型,进行翻译、句子相似度计算和跨语言迁移学习等任务。
Hugging Face
2025-03-30 更新
13
0
Parikshith/grow-1-monolingual-1m-ha-en-scored
机器翻译
质量评估
--- dataset_info: features: - name: src dtype: string - name: mt dtype: string - name: score_wmt20-comet-qe-da dtype: float64 - name: score_wmt21-comet-qe-da dtype: float64
Hugging Face
2023-12-04 更新
5
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广