Growl-ia/trans
收藏资源简介:
Growl-ia/trans 是一个多语言翻译数据集包,包含模型生成的双语句对和COMETKiwi质量分数。该数据集目前包括:所有发布模型变体中的2601724个评分示例、182个语言对、源自OPUS的源语料库(如OpenSubtitles、TED2020、GlobalVoices、News-Commentary、WikiMatrix),以及语言覆盖范围(ar、de、en、es、fr、hi、it、ja、ko、pt、ru、th、vi、zh)。数据集主要用于基于分数的合成翻译数据过滤、多语言机器翻译质量估计研究、构建课程或置信度感知的翻译训练集,以及比较不同机器翻译系统生成的并行数据。
Growl-ia/trans is a multilingual translation dataset package that contains model-generated bilingual sentence pairs and COMETKiwi quality scores. The repository currently includes: 2601724 scored examples across all released model variants, 182 language pairs, OPUS-derived source corpora (OpenSubtitles, TED2020, GlobalVoices, News-Commentary, WikiMatrix), and language coverage (ar, de, en, es, fr, hi, it, ja, ko, pt, ru, th, vi, zh). It is intended for filtering synthetic translation data with score-based cutoffs, studying multilingual MT quality-estimation behavior, building curriculum or confidence-aware translation training sets, and comparing generated parallel data from different MT systems.



