breakend/nllb-multi-domain
收藏资源简介:
NLLB Multi Domain数据集是一个多语言、多领域的机器翻译数据集,包含了新闻、非正式口语和健康领域的专业翻译句子。该数据集旨在评估机器翻译的跨领域性能和研究领域适应性。每个领域大约有3000个句子。数据集支持多种语言,包括英语、俄语、Central Aymara、Bhojpuri、Dyula、Friulian和Wolof等。数据集的创建基于FLORES数据集,并扩展了FLORES-101。数据集的结构包括数据实例、数据字段和数据分割等。数据集的创建信息可以参考相关论文,并且数据集遵循Creative Commons Attribution Share Alike 4.0许可证。
The NLLB Multi Domain Dataset is a multilingual, multi-domain machine translation dataset consisting of professionally translated sentences across three domains: news, informal spoken language, and healthcare. It is designed to evaluate the cross-domain performance of machine translation and study domain adaptation. Each domain contains approximately 3,000 sentence pairs. The dataset supports a wide range of languages, including English, Russian, Central Aymara, Bhojpuri, Dyula, Friulian, Wolof, and others. Developed based on the FLORES dataset, it extends the FLORES-101 benchmark. The dataset structure includes data instances, data fields, and data splits, among other components. Relevant papers can be referred to for information on its creation, and the dataset is released under the Creative Commons Attribution Share Alike 4.0 license.
数据集概述
数据集名称
- 名称: NLLB Multi-Domain
数据集描述
数据集摘要
- 摘要: NLLB Multi Domain包含专业翻译的句子,涵盖新闻、非脚本非正式演讲和健康领域,旨在评估机器翻译的领域外性能和研究领域适应性。每个领域约有3000个句子。
支持的任务和排行榜
- 任务: 多语言机器翻译
- 排行榜: 参考Dynabench leaderboard了解FLORES-101在WMT2021大型多语言机器翻译任务中的模型评估详情。
语言
- 语言列表:
- Central Aymara (ayr_Latn)
- Bhojpuri (bho_Deva)
- Dyula (dyu_Latn)
- Friulian (fur_Latn)
- Russian (rus_Cyrl)
- Wolof (wol_Latn)
数据集结构
数据实例
- 格式: 原始数据集中的文本,未经进一步预处理或标记化。
数据字段
id: 数据条目的行号,从1开始。sentence: 特定语言的完整句子。domain: 句子的领域。
数据集创建
- 创建信息: 请参考原始文章No Language Left Behind: Scaling Human-Centered Machine Translation了解数据集创建的详细信息。
附加信息
许可证信息
- 许可证: 创意共享署名-相同方式共享4.0国际许可。
引用信息
- 引用: 请在使用此语料库时引用作者。




