facebook/flores
收藏资源简介:
FLORES-200是一个用于机器翻译的基准数据集,特别是英语与低资源语言之间的翻译。该数据集扩展了FLORES-101的语言覆盖范围,包含了200种语言的平行句子。由于新语言的标准化程度较低,翻译和验证过程更为复杂,涉及从西班牙语、法语、俄语和现代标准阿拉伯语等语言的翻译。数据集包含842篇不同的网络文章,总计3001个句子,分为开发集、开发测试集和测试集(隐藏)。平均每个句子约为21个单词。数据集的结构包括数据实例、数据字段和数据分割,数据实例展示了具体的句子和相关信息。
FLORES-200 is a benchmark dataset for machine translation, particularly focused on translation between English and low-resource languages. This dataset expands the language coverage of FLORES-101, containing parallel sentences across 200 languages. Due to the relatively low standardization of the newly included languages, the translation and validation procedures are more complex, involving translations from languages such as Spanish, French, Russian, and Modern Standard Arabic. The dataset comprises 842 distinct web articles, totaling 3001 sentences, and is divided into a development set, a development test set, and a hidden test set. Each sentence contains an average of approximately 21 words. The structure of the dataset includes data instances, data fields, and data splits, with data instances displaying specific sentences and associated information.
数据集概述
数据集名称
- 名称: Flores 200
- 别名: flores200
数据集描述
- 目的: 用于机器翻译,特别是英语与低资源语言之间的翻译。
- 特点: 覆盖200种语言,包括多种语言的翻译,如从西班牙语、法语、俄语和现代标准阿拉伯语翻译。
- 内容: 包含从842个不同的网络文章中提取的3001个句子,分为dev、devtest和test(隐藏)三个部分。
语言信息
- 语言数量: 200种
- 语言示例: ace_Arab, ace_Latn, acm_Arab, acq_Arab, aeb_Arab, afr_Latn, ajp_Arab, aka_Latn, amh_Ethi, apc_Arab, arb_Arab, ars_Arab, ary_Arab, arz_Arab, asm_Beng, ast_Latn, awa_Deva, ayr_Latn, azb_Arab, azj_Latn, bak_Cyrl, bam_Latn, ban_Latn, bel_Cyrl, bem_Latn, ben_Beng, bho_Deva, bjn_Arab, bjn_Latn, bod_Tibt, bos_Latn, bug_Latn, bul_Cyrl, cat_Latn, ceb_Latn, ces_Latn, cjk_Latn, ckb_Arab, crh_Latn, cym_Latn, dan_Latn, deu_Latn, dik_Latn, dyu_Latn, dzo_Tibt, ell_Grek, eng_Latn, epo_Latn, est_Latn, eus_Latn, ewe_Latn, fao_Latn, pes_Arab, fij_Latn, fin_Latn, fon_Latn, fra_Latn, fur_Latn, fuv_Latn, gla_Latn, gle_Latn, glg_Latn, grn_Latn, guj_Gujr, hat_Latn, hau_Latn, heb_Hebr, hin_Deva, hne_Deva, hrv_Latn, hun_Latn, hye_Armn, ibo_Latn, ilo_Latn, ind_Latn, isl_Latn, ita_Latn, jav_Latn, jpn_Jpan, kab_Latn, kac_Latn, kam_Latn, kan_Knda, kas_Arab, kas_Deva, kat_Geor, knc_Arab, knc_Latn, kaz_Cyrl, kbp_Latn, kea_Latn, khm_Khmr, kik_Latn, kin_Latn, kir_Cyrl, kmb_Latn, kon_Latn, kor_Hang, kmr_Latn, lao_Laoo, lvs_Latn, lij_Latn, lim_Latn, lin_Latn, lit_Latn, lmo_Latn, ltg_Latn, ltz_Latn, lua_Latn, lug_Latn, luo_Latn, lus_Latn, mag_Deva, mai_Deva, mal_Mlym, mar_Deva, min_Latn, mkd_Cyrl, plt_Latn, mlt_Latn, mni_Beng, khk_Cyrl, mos_Latn, mri_Latn, zsm_Latn, mya_Mymr, nld_Latn, nno_Latn, nob_Latn, npi_Deva, nso_Latn, nus_Latn, nya_Latn, oci_Latn, gaz_Latn, ory_Orya, pag_Latn, pan_Guru, pap_Latn, pol_Latn, por_Latn, prs_Arab, pbt_Arab, quy_Latn, ron_Latn, run_Latn, rus_Cyrl, sag_Latn, san_Deva, sat_Beng, scn_Latn, shn_Mymr, sin_Sinh, slk_Latn, slv_Latn, smo_Latn, sna_Latn, snd_Arab, som_Latn, sot_Latn, spa_Latn, als_Latn, srd_Latn, srp_Cyrl, ssw_Latn, sun_Latn, swe_Latn, swh_Latn, szl_Latn, tam_Taml, tat_Cyrl, tel_Telu, tgk_Cyrl, tgl_Latn, tha_Thai, tir_Ethi, taq_Latn, taq_Tfng, tpi_Latn, tsn_Latn, tso_Latn, tuk_Latn, tum_Latn, tur_Latn, twi_Latn, tzm_Tfng, uig_Arab, ukr_Cyrl, umb_Latn, urd_Arab, uzn_Latn, vec_Latn, vie_Latn, war_Latn, wol_Latn, xho_Latn, ydd_Hebr, yor_Latn, yue_Hant, zho_Hans, zho_Hant, zul_Latn
数据集结构
- 数据实例: 每个实例包含id, sentence, URL, domain, topic, has_image, has_hyperlink等字段。
- 数据字段:
id: 数据条目的行号,从1开始。sentence: 特定语言的完整句子。URL: 提取句子的英文文章的URL。domain: 句子的领域。topic: 句子的主题。has_image: 原始文章是否包含图像。has_hyperlink: 句子是否包含超链接。
数据集创建
- 创建方法: 参考原始文章《No Language Left Behind: Scaling Human-Centered Machine Translation》。
许可证信息
- 许可证: Creative Commons Attribution-ShareAlike 4.0 International License
引用信息
bibtex @article{nllb2022, author = {NLLB Team, Marta R. Costa-jussà, James Cross, Onur Çelebi, Maha Elbayad, Kenneth Heafield, Kevin Heffernan, Elahe Kalbassi, Janice Lam, Daniel Licht, Jean Maillard, Anna Sun, Skyler Wang, Guillaume Wenzek, Al Youngblood, Bapi Akula, Loic Barrault, Gabriel Mejia Gonzalez, Prangthip Hansanti, John Hoffman, Semarley Jarrett, Kaushik Ram Sadagopan, Dirk Rowe, Shannon Spruit, Chau Tran, Pierre Andrews, Necip Fazil Ayan, Shruti Bhosale, Sergey Edunov, Angela Fan, Cynthia Gao, Vedanuj Goswami, Francisco Guzmán, Philipp Koehn, Alexandre Mourachko, Christophe Ropers, Safiyyah Saleem, Holger Schwenk, Jeff Wang}, title = {No Language Left Behind: Scaling Human-Centered Machine Translation}, year = {2022} }




