遇见数据集

afriscience_mt

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

AfriScience-MT是一个用于科学机器翻译的平行语料库,旨在通过文本翻译促进非洲科学的去殖民化。该数据集的核心由英语与六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)之间的对齐句子对构成,这些语言在超过15个国家被超过2亿人使用。语料内容源自230篇科学论文,覆盖农业、生物化学、生物学、化学、计算机科学、工程学、地理学、健康、土著知识、社会学和统计学等11个科学领域,共计7,605个英语源句子。每个句子均被翻译成所有六种目标语言,并在句子和文档级别进行对齐。数据在领域内的文档级别进行分割,确保每个分割(训练集:5,792句/177篇论文;开发集:843句/25篇论文;测试集:970句/28篇论文)都包含所有领域的文档,且同一论文内的句子不会泄露到不同分割中。除了平行语料库(corpus 配置),该版本还发布了支撑其伴随论文的所有模型预测结果(predictions 配置,包含1,982,558行逐句输出)和按运行汇总的评估指标(metrics 配置),以及共同开发的双语科学术语表(glossary 配置,包含六种语言共1,879个术语对)。数据集的构建采用两阶段流程:首先由领域专家科学传播者撰写每篇论文的通俗摘要,然后由职业翻译在首席翻译审阅下将其翻译成目标语言,并在此过程中共同开发科学术语表以填补标准化术语的空白。该数据集适用于低资源机器翻译、科学文本翻译模型训练与评估,以及跨语言科学知识传播的研究。

AfriScience-MT is a parallel corpus for scientific machine translation, aiming to promote the decolonization of African science through text translation. Its core consists of aligned sentence pairs between English and six African languages—Amharic, Hausa, Luganda, Northern Sotho, Yoruba, and Zulu—spoken by over 200 million people across more than 15 countries. The corpus content is derived from 230 scientific papers covering 11 scientific disciplines including agriculture, biochemistry, biology, chemistry, computer science, engineering, geography, health, indigenous knowledge, sociology, and statistics, with a total of 7,605 English source sentences. Each sentence has been translated into all six target languages, with alignment performed at both the sentence and document levels. The data is split at the in-domain document level, ensuring that each split (training set: 5,792 sentences / 177 papers; development set: 843 sentences / 25 papers; test set: 970 sentences / 28 papers) contains documents from all disciplines, and sentences from the same paper are not leaked across different splits. In addition to the parallel corpus (corpus configuration), this release also includes all model prediction results supporting its accompanying paper (predictions configuration, containing 1,982,558 line-by-line sentence outputs), run-wise aggregated evaluation metrics (metrics configuration), and a co-developed bilingual scientific glossary (glossary configuration, with 1,879 term pairs across the six languages). The dataset is constructed via a two-stage pipeline: first, domain expert science communicators write popularized abstracts for each paper, then professional translators translate these into target languages under the review of a lead translator, during which the scientific glossary is co-developed to fill gaps in standardized terminology. This dataset is applicable to low-resource machine translation, training and evaluation of scientific text translation models, and research on cross-lingual dissemination of scientific knowledge.

创建时间:
2026-06-09
原始信息汇总

数据集概述:AfriScience-MT

AfriScience-MT 是一个面向科学文本翻译的平行语料库,覆盖英语和六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语和祖鲁语),涵盖 11 个科学领域。该数据集与专业科学传播者和翻译人员共同开发,旨在推动非洲地区科学文本的机器翻译研究。

  • 许可证:Apache 2.0
  • 规模:1,000 到 10,000 条句子(数据集中包含 7,605 条英文源句)
  • 任务类别:翻译
  • 标签:机器翻译、非洲语言、科学翻译、低资源语言、平行语料库
  • 论文:AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation
  • 源代码afriscience-mt CLI

数据集配置

数据集包含四个配置:

  • corpus(默认配置):平行科学语料库,包含 230 篇论文、7,605 条英文源句,每条句子都被翻译成六种目标语言。数据集按文档级别划分到训练、开发、测试集,确保每个划分包含所有领域的文档,且同一篇论文的句子不会泄露到其他划分。字段包括:paper_id(论文ID)、domain(领域)、sentence_id(句内位置)、lang_pair(语言对)、source_lang(源语言ISO 639-3代码)、target_lang(目标语言ISO 639-3代码)、source(源句)、target(目标句)。划分情况:训练集 5,792 句/177 篇、开发集 843 句/25 篇、测试集 970 句/28 篇。
  • predictions:包含论文中评估的每个系统的逐句模型输出。系统包括四种 seq2seq 模型(M2M100-418M/1.2B、NLLB-600M/1.3B)、七个开放权重大语言模型(Llama3-8B、Gemma2-9B-IT、AfriqueLlama-8B 等)和四个闭源模型(GPT-4o、Gemini-1.5-Flash 等),涉及零样本、上下文学习和文档级配置。单划分:outputs,1,982,558 行。字段包括:model_shortexperiment_typeprompt_strategylora_ranktemp_settingdatasetlang_pairsource_langtarget_langsplitsentence_idsourcereferencepredictionis_ablation
  • metrics:每次运行的聚合指标,每行对应一个(模型、配置、语言对)。字段与 predictions 相同的连接键,外加 bleuchrfssa_comet(论文主指标)、num_samplesval_bleuval_chrfval_ssa_comet。单划分:summary
  • glossary:开发过程中建立的双语科学词汇表,每行一个(英语术语,目标语言翻译)对,覆盖所有六种目标语言。字段:target_langengtarget。单划分:terms。各语言词条数量:阿姆哈拉语 333、豪萨语 130、卢干达语 181、北索托语 263、约鲁巴语 587、祖鲁语 385。

语言覆盖

语言代码 语言名称 语系 主要使用区域
eng 英语 日耳曼语系
amh 阿姆哈拉语 亚非语系 东非
hau 豪萨语 亚非语系 西非
lug 卢干达语 尼日尔-刚果语系 东非
nso 北索托语(佩迪语) 尼日尔-刚果语系 南部非洲
yor 约鲁巴语 尼日尔-刚果语系 西非
zul 祖鲁语 尼日尔-刚果语系 南部非洲

这六种语言的总使用人口超过 2 亿,遍布 15 个国家。

语料库构建流程

语料库构建分为两个阶段:

  1. 领域专家科学传播者首先为每篇论文生成 250-350 词的通俗摘要,保留主要贡献和科技术语。
  2. 专业翻译人员将摘要、原文摘要、术语和定义翻译成每种目标语言,并由每种语言的主翻译人员进行审校。在此过程中,协同开发双语科学词汇表,以填补标准化术语缺失的空白。

完整的预处理细节(包括未翻译句子移除、单词语过滤、句子级别去重、文档级别保留、词汇表标准化)见论文附录。

搜集汇总
数据集介绍
afriscience_mt 数据集图片
构建方式
AfriScience-MT语料库的构建遵循严谨的两阶段流程。首先,由领域专家科学传播者对每篇学术论文撰写250至350词的中立摘要,精准保留核心贡献与科学术语。随后,专业翻译人员在首席译审的严格把关下,将摘要、原文、专业术语及定义逐句译为六种非洲目标语言。翻译过程中,团队同步编写双语科学词汇表,以填补标准化术语缺失造成的语义鸿沟。最终,来自11个科学领域的230篇论文、共计7,605句英文源句在句子与文档层面完成对齐,形成高质量的平行语料。
特点
该数据集最显著的特点在于其穷尽式的实验可复现性与细粒度元数据覆盖。除平行语料外,AfriScience-MT完整公开了论文中所有模型的逐句预测结果与每次运行的聚合评估指标,研究者无需重新执行实验即可直接复现或扩展基准。此外,数据集创新性地提供了首个包含预定义训练、开发与测试集划分的科学机器翻译基准,并配套发布了跨六个目标语言的科学术语表,其中尤以约鲁巴语(587条)和祖鲁语(385条)的收词最为丰富,对应了标准化术语最为紧缺的语言区域。
使用方法
数据集通过HuggingFace Datasets库提供四种便捷配置。默认的'corpus'配置可加载训练、开发与测试三个子集,每条数据包含论文标识、学科领域、句级位置与语言对等完整字段。'predictions'与'metrics'配置分别存储模型输出和聚合分数,通过'lang_pair'、'sentence_id'等键可与测试集进行精确合并,用于误差分析。'glossary'配置则提供六种语言的双语科学词汇表,适合术语标准化研究。用户还可借助'afriscience-mt'命令行工具实现数据预处理与实验复现流程的自动化。
背景与挑战
背景概述
AfriScience-MT是2026年由Idris Abdulmumin等来自多个非洲与国际机构的研究人员联合构建的并行科学机器翻译语料库,旨在通过文本翻译推动非洲科学的去殖民化。该数据集覆盖英语与阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语和祖鲁语六种非洲语言,跨越农业、生物化学、生物学、化学等11个科学领域,共包含230篇论文的7,605句英文源句。团队与科学传播专家及专业翻译合作,在翻译过程中同步开发了双语科学术语表,填补了标准术语的空白。该数据集不仅提供了训练、开发与测试划分,还公开了所有模型预测和运行指标,使得基准测试可完全复现,对低资源非洲语言机器翻译研究产生了重要影响。
当前挑战
AfriScience-MT所应对的核心领域挑战是非洲语言在科学翻译中的严重资源匮乏。由于这些语言缺乏标准化的科学术语体系和充足的平行语料,传统机器翻译模型难以有效处理非洲语言的科学文本翻译。构建过程中面临的主要挑战包括:为六种语言各自创建涵盖11个领域的双语科学术语表,特别是在约鲁巴语和祖鲁语等标准术语极度稀缺的语言中;确保跨语言翻译的科学术语一致性和准确性,需由专业科学传播者首先撰写论文的通俗摘要,再由翻译人员逐句校对;以及实现文档级句子划分以避免跨分割泄露,同时处理未翻译句子、词级过滤和句子去重等问题。
常用场景
经典使用场景
AfriScience-MT最经典的使用场景是作为低资源语言机器翻译的基准测试集,尤其聚焦于将英语科学文本翻译为六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语和祖鲁语)。该数据集覆盖农业、生物化学、生物学、化学、计算机科学等11个科学领域,包含230篇论文中精心对齐的句级与文档级平行语料。研究者通常利用其标准化的训练、验证和测试划分,评估各类机器翻译模型在跨领域科学文本上的表现,特别是针对缺乏大规模双语资源的非洲语言翻译能力。
解决学术问题
该数据集直接回应了非洲科学文本翻译中长期存在的资源匮乏与术语标准化缺失问题。它通过构建高质量双语科学术语表、并设计基于领域专家撰写摘要和专业翻译的两阶段建模范式,为低资源科学机器翻译提供了可靠的评估基准。AfriScience-MT有效缓解了非洲语言在科学计算领域的代表性不足问题,推动了翻译模型在跨领域、多语言场景下的鲁棒性研究,其发布的完整模型预测与指标数据更促进了可复现实验与公平比较的学术规范建立。
衍生相关工作
围绕AfriScience-MT衍生了一系列经典工作,主要包括对15种以上机器翻译系统的系统对比分析,涵盖M2M100、NLLB等序列到序列模型,以及Llama3、Gemma2、AfriqueLlama等大语言模型在零样本、上下文学习和文档级翻译等设置下的性能评估。此外,其发布的完整预测与指标数据支持后续研究者进行模型消融实验、温度参数探索以及跨语言对泛化能力分析。该数据集还催生了针对低资源科学翻译的术语规范化与领域适应研究,并启发了类似非洲语言科学语料库的构建方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务