遇见数据集

tg-nlp-toolkit-fr-ewe-v0.3

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

该数据集是法语-埃维语(ewe)平行语料库,版本0.3,专为低资源机器翻译场景构建。数据集由两部分组成:一是1913年埃维语圣经(BFBS)与1910年法语Segond圣经(公共领域,CC0-1.0),二是2023年从NLLB(allenai/OPUS)中过滤的法语-埃维语数据(ODC-By许可)。整体以CC0-1.0发布,但需保留NLLB部分的归属要求。数据集包含四个分割:训练集(52,512对)、开发集(6,564对)、测试集(6,564对)以及参考集(241对,经过双重人工验证)。参考集由两名母语埃维语者独立验证,97%一致性,并经过仲裁,确保100%正确。字段包括:id、source(bible或nllb)、fr、ewe(参考集),其他分割为source、fr、ewe。数据总量为65,640对。该数据集适用于法语-埃维语机器翻译模型的训练与评估,尤其是低资源场景。

This dataset is a French-Ewe parallel corpus, version 0.3, built for low-resource machine translation. It consists of two parts: the 1913 Ewe Bible (BFBS) and the 1910 French Segond Bible (public domain, CC0-1.0), and French-Ewe data filtered from NLLB (allenai/OPUS) in 2023 (ODC-By license). The whole is released under CC0-1.0, but attribution requirements for the NLLB portion must be retained. The dataset contains four splits: train (52,512 pairs), dev (6,564 pairs), test (6,564 pairs), and ref (241 pairs, double human-verified). The reference set was independently verified by two native Ewe speakers with 97% agreement and adjudicated to ensure 100% correctness. Fields include: id, source (bible or nllb), fr, ewe (for ref set), others have source, fr, ewe. Total 65,640 pairs. This dataset is suitable for training and evaluating French-Ewe machine translation models, especially in low-resource scenarios.

创建时间:
2026-08-15
原始信息汇总

数据集概述:法语-埃维语平行语料库 v0.3

基本信息

  • 数据集名称:Corpus parallèle français - éwé v0.3
  • 许可证:CC0-1.0(公共领域),其中NLLB组件需保留ODC-By归属声明
  • 语言对:法语(fr)与埃维语(ee)
  • 类型:机器翻译平行语料库,面向低资源场景
  • 标签:翻译、机器翻译、低资源语言、埃维语、法语、非洲、多哥

数据构成

该语料库由两个组件构成:

组件 来源 年份 许可证
埃维语圣经(BFBS)与Segond 1910法语圣经 圣经文本 1913/1910 公共领域(CC0-1.0)
NLLB fr-ee过滤后数据 OPUS/allenai 2023 ODC-By(需归属)

数据集统计(v0.3)

数据划分 总对数 圣经来源 NLLB来源
训练集(train) 52,512 12,812 39,700
开发集(dev) 6,564 1,601 4,963
测试集(test) 6,564 1,601 4,963
参考集(reference) 241(100%人工验证) 124 117
总计 65,640 16,014 49,626

参考集(reference)说明

  • 包含241对经双重独立验证的翻译,由两名埃维语母语者验证
  • 验证者间一致率达97%,并经过最终仲裁
  • 仅保留两位验证者均认可的语对
  • 完整验证记录见GitHub仓库(https://github.com/cherif-tg/tg_nlp_toolkit)中的 data/processed/v0.3/ 目录
  • 该参考集是评估法语-埃维语翻译系统的可靠基准

数据质量说明

  • Bible组件:约66%的语对正确(基于100对抽样验证)
  • NLLB过滤版v3:约72%正确(基于100对抽样验证,已剔除外语数据)
  • 残余噪声主要来自网络挖掘导致的近似对齐问题
  • 该数据集为探索性训练语料,适合训练用,评估建议使用参考集

模型表现

参考集(241对)上的官方成绩

翻译方向 模型 chrF++ BLEU
法语→埃维语 NLLB基线 37.22 11.17
法语→埃维语 LoRA v1(单向) 47.39 22.20
法语→埃维语 LoRA v2(双向) 47.95 22.42
埃维语→法语 NLLB基线 38.14 14.92
埃维语→法语 LoRA v1(单向) 37.52 15.15
埃维语→法语 LoRA v2(双向) 52.24 31.83

自动对齐测试集(6,564对)成绩

翻译方向 模型 chrF++ BLEU
法语→埃维语 NLLB基线 34.96 11.38
法语→埃维语 + LoRA微调 41.83 18.71
埃维语→法语 NLLB基线 33.76 13.53
埃维语→法语 + LoRA微调 33.35 13.69

与Google Translate对比(参考集)

  • 法语→埃维语:LoRA v2(47.95 chrF++)优于Google(38.62)
  • 埃维语→法语:LoRA v2(52.24 chrF++)优于Google(49.86)

已发布模型

  • v2(推荐):https://huggingface.co/cheriftenga/nllb-200-distilled-600M-ewe-lora-v2
  • v1:https://huggingface.co/cheriftenga/nllb-200-distilled-600M-ewe-lora

数据结构与使用

  • 数据列:id, source(bible或nllb), fr, ewe(reference划分);source, fr, ewe(其他划分)
  • 数据格式:TSV文件(train.tsv、dev.tsv、test.tsv、test-reference-final.tsv)
  • 可通过HuggingFace datasets库或pandas直接读取

数据特性与注意事项

  • 语体:圣经文本(Bible组件)与网络挖掘的混合语体(NLLB组件涵盖宗教、日常生活、新闻等)
  • 拼写:混合了1913年历史埃维语拼写与现代埃维语拼写,各语对保留其来源的拼写变体
  • 方言:参考集的主要验证者为洛美沿海埃维语使用者
  • 附加资源:Riebstein词典(8,574条法语-埃维语词条,公共领域)在GitHub仓库中单独提供

数据管线与作者

  • 完整处理流程:https://github.com/cherif-tg/tg_nlp_toolkit
  • 作者:TENGA Cherif Abdel Azize,多哥洛美理工学院毕业设计项目
搜集汇总
数据集介绍
tg-nlp-toolkit-fr-ewe-v0.3 数据集图片
构建方式
该数据集是一个法语-埃维语平行语料库,专为低资源机器翻译场景设计,融合了两种来源:1913年出版的埃维语圣经(BFBS)与1910年的French Segond译本,以及2023年经NLLB项目过滤的fr-ee语料(来源于OPUS/allenai)。数据整合了圣经版本(处于公共领域)与NLLB过滤部分(基于ODC-By许可),并经过精细的清理与对齐流程。特别地,该数据集包含一个名为'reference'的测试分割,由241对经双重独立验证的平行句对组成,验证过程由两位母语埃维语者执行,达到97%的一致性,并辅以最终仲裁,确保每一对均通过严格的质量把控。此外,训练、开发与测试分割分别包含52,512、6,564和6,564对句对,总计65,640对,覆盖了宗教文本、日常对话和新闻等多种语域。
特点
该数据集的核心特点在于其诚实标注的质量评估与针对低资源语言的精心设计。数据集明确报告了训练分割的噪音水平,如圣经部分约66%的正确率,NLLB过滤部分约72%,这些数字基于母语者抽检得出,为使用者提供了透明的质量预期。不同于常见的自动构建语料,该数据集特别构建了一个高质量的参考测试集(241对),用于可靠的性能评估,其上模型的表现能显著优于自动对齐的测试分割。此外,数据涵盖历史与现代两种埃维语拼写变体,并保留了来源标记,便于研究语言变迁。该语料库已在法语到埃维语及反向翻译任务上验证了微调效果,例如通过LoRA技术实现双向翻译能力的显著提升,在参考集上取得了chrF++高达52.24的成绩,超越了Google Translate。
使用方法
该数据集专为机器翻译模型的训练与评估而设计,推荐使用Hugging Face的datasets库直接加载,简单快捷,也可以通过pandas读取TSV文件进行自定义处理。对于评估任务,务必采用'reference'分割以获取可靠分数,而'train'、'dev'与'test'分割则适用于常规训练与内部对比。数据集已与NLLB模型配合使用,示例中展示了基于LoRA微调的流程,且相关的微调模型权重(如v2双向版本)已发布于Hugging Face,便于直接复现或迁移。此外,附带的GitHub仓库提供了完整的数据处理流水线和详细的数据说明书,支持进一步的数据筛选和个性化应用。
背景与挑战
背景概述
该数据集由多哥洛美理工学院的TENGA Cherif Abdel Azize在其毕业设计项目中创建,发布于2023年,聚焦于法语与埃维语(一种西非低资源语言)之间的机器翻译。其核心研究问题在于,面对极低资源环境下平行语料匮乏的困境,如何构建一个可靠且可评估的翻译基准。数据集整合了1913年出版的埃维语圣经(公有领域)与经过过滤的NLLB语料,总计65,640对平行句对,并特别设计了包含241对经双重人工验证的参考测试集。该数据集的出现填补了埃维语机器翻译资源的空白,为低资源语言翻译研究提供了宝贵的实践案例,其方法论对同类语言的资源建设具有示范意义。
当前挑战
该领域面临的核心挑战是低资源语言的平行语料稀缺及质量不可控问题。在构建过程中,团队遭遇了多重困难:首先,从网络挖掘的NLLB语料存在大量近似对齐问题,导致约28%的句对存在噪声;其次,历史圣经文本与现代埃维语在拼写和词汇上存在显著差异,需处理跨时代的语言变体问题;再者,缺乏可靠的自动评估标准,迫使团队采用人工双重验证策略,耗费大量人力。此外,数据许可复杂性(NLLB部分需ODC-By归属)也是一大挑战,需在法律合规与技术实现间取得平衡。这些挑战共同凸显了低资源翻译数据集建设的高昂成本与严谨性要求。
常用场景
经典使用场景
该数据集作为法语-埃维语低资源机器翻译研究的基石,为跨语言神经翻译模型的训练与评估提供了精心构建的平行语料。其核心价值在于,通过整合历史圣经译本与现代网络挖掘数据,并辅以严格人工校验的参考测试集,为科研人员提供了一个兼具规模与质量的双语资源库。经典的使用场景聚焦于在资源匮乏条件下,利用此语料微调预训练的多语言模型(如NLLB),以提升模型对埃维语这一非洲本土语言的翻译性能。数据集的train/dev/test划分及独立的reference子集,确保了模型开发与性能评估的标准化流程,使其成为该语言对翻译技术探索不可或缺的基准数据平台。
衍生相关工作
围绕该数据集已催生了一系列可复现的基准工作与模型,最显著的是基于NLLB-200模型的LoRA微调版本。其中,v2模型通过双向训练策略显著改善了埃维语到法语的翻译质量,其chrF++分数超越了Google Translate,树立了该语言对上的新性能标杆。数据集的参考评测集还激励了更多关于低资源语言评估协议的研究,例如不同校验者间一致性对测试集构建的影响。此外,数据集的构建管道(涵盖清洗、过滤、组装与验证)被封装为开源工具包,促进了相似低资源语料库建设方法的交流与复用。这些衍生工作共同构成了一个活跃的研究生态,推动埃维语乃至更广泛非洲语言的NLP技术持续演进。
数据集最近研究
最新研究方向
该数据集聚焦于低资源语言对法语-埃维语的机器翻译研究,通过构建包含圣经文本与NLLB网络挖掘语料的平行语料库,并采用人工双重验证的参考测试集以提升评估可靠性。前沿研究方向包括利用LoRA等参数高效微调技术增强NLLB模型在低资源场景下的翻译性能,尤其通过双向训练策略显著改善埃维语到法语的翻译质量,超越Google Translate基准。该工作强调对数据质量的诚实评估与变体处理,为非洲语言机器翻译的资源建设与评价体系提供了可复现的范式,对推动低资源语言技术发展具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务