该数据集名为Good Sicilian in the NLLB,主要关注西西里语的翻译质量。数据集由Project Napizia提供,旨在帮助语言模型学习符合西西里文学传统的语言。数据集包含从NLLB数据集中筛选出的高质量西西里语翻译对,并通过Napizia的翻译模型进行评分。数据集还提供了50,000对最佳翻译对的CSV文件。数据集来源于Meta AI发布的元数据,并经过Allen AI的处理
Introduction GALE Phase 4 Arabic Weblog Parallel Sentences was developed by the Linguistic Data Consortium (LDC). Along with other corpora, the parallel text in this release comprised