遇见数据集

afriscience_mt

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

AfriScience-MT是一个用于英语与六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)之间的平行科学机器翻译语料库,由领域专家科学传播者和专业翻译人员共同开发,涵盖农业、生物化学、生物学、化学、计算机科学、工程学、地理学、健康、本土知识、社会学和统计学等11个科学领域。该数据集旨在通过文本翻译促进非洲科学的去殖民化。数据集核心包含230篇学术论文的7,605个英语源语句子,每个句子均被翻译成所有六种目标非洲语言,并在句子和文档级别进行对齐。数据分割在领域内按文档级别进行,确保每个分割都包含来自所有领域的文档,且同一论文内的句子不会泄露到不同分割中。除了平行语料库(corpus配置)外,数据集还发布了伴随论文中评估的所有模型的每句预测输出(predictions配置)、每次运行的聚合指标(metrics配置)以及在翻译过程中共同开发的双语科学术语表(glossary配置),以便无需重新运行实验即可复现和扩展基准测试。这六种目标语言在15个国家拥有超过2亿使用者。语料库的构建采用两阶段流程:首先由领域专家科学传播者为每篇论文生成250-350字的通俗摘要,保留关键贡献和科学术语;然后由专业翻译人员在每种语言的首席翻译审核下,将摘要、摘要、术语和定义翻译成每种目标语言,并在翻译过程中共同开发双语科学术语表,以填补标准化术语缺失的空白。

AfriScience-MT is a parallel scientific machine translation corpus for English and six African languages (Amharic, Hausa, Luganda, Northern Sotho, Yoruba, Zulu), developed collaboratively by domain expert science communicators and professional translators, covering 11 scientific fields including agriculture, biochemistry, biology, chemistry, computer science, engineering, geography, health, indigenous knowledge, sociology, and statistics. The dataset aims to decolonize African science through text translation. The core dataset contains 7,605 English source sentences from 230 academic papers, each translated into all six target African languages and aligned at both sentence and document levels. Data splits are performed at the document level within domains, ensuring each split contains documents from all fields and sentences from the same paper do not leak into different splits. In addition to the parallel corpus (corpus configuration), the dataset releases per-sentence prediction outputs for all models evaluated in the accompanying paper (predictions configuration), aggregated metrics per run (metrics configuration), and a bilingual scientific glossary co-developed during translation (glossary configuration) to facilitate reproducibility and benchmark extension without re-running experiments. These six target languages are spoken by over 200 million people across 15 countries. The corpus construction follows a two-stage process: first, domain expert science communicators generate plain-language summaries of 250-350 words per paper, preserving key contributions and scientific terms; then, professional translators, under the review of lead translators for each language, translate the summaries, abstracts, terms, and definitions into each target language, co-developing a bilingual scientific glossary during translation to fill gaps in standardized terminology.

提供机构:
Masakhane NLP
创建时间:
2026-06-10
原始信息汇总

数据集概述

AfriScience-MT 是一个面向科学领域的平行机器翻译语料库,专注于 英语 + 六种非洲语言 的翻译任务。该数据集由专业科学传播者和翻译人员共同开发,覆盖 11 个科学领域

  • 目标语言:阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语。
  • 科学领域:农业、生物化学、生物学、化学、计算机科学、工程、地理、健康、本土知识、社会学、统计学。
  • 数据规模:230 篇论文,共 7,605 句英语源句,每句均被翻译为六种非洲目标语言。
  • 许可协议:Apache-2.0。
  • 代码仓库:https://github.com/masakhane-io/afriscience_mt
  • 论文AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation

数据集配置

该数据集提供四种配置:

1. corpus(默认)

  • 内容:平行科学语料库,句子级和文档级对齐。
  • 数据分割(按文档划分,确保领域内无句子泄漏):
    • train:5,792 句 / 177 篇论文
    • dev:843 句 / 25 篇论文
    • test:970 句 / 28 篇论文
  • 字段
字段 类型 描述
paper_id string 源论文标识符
domain string 科学领域(共11个)
sentence_id int 句子在论文中的位置(从0开始)
lang_pair string 语言对,如 eng-amh
source_lang string 源语言(ISO 639-3代码)
target_lang string 目标语言(ISO 639-3代码)
source string 源句子(英语)
target string 目标翻译(非洲语言)

2. predictions

  • 内容:论文中评估的所有模型的逐句输出。
  • 评估模型:包括4个序列到序列模型(M2M100-418M/1.2B, NLLB-600M/1.3B)、7个开源LLM(Llama3-8B, Gemma2-9B-IT, AfriqueLlama-8B, AfriqueQwen-8B, Tiny-Aya-Earth, Tiny-Aya-Global, TranslateGemma-12B)和4个闭源模型(GPT-4o, Gemini-1.5-Flash, GPT-5.4, Gemini-3.1-Flash-Lite)。
  • 评估配置:零样本、上下文学习、文档级配置。
  • 数据分割outputs 分割,共 1,982,558 行。
  • 字段:包括 model_short, experiment_type, prompt_strategy, lora_rank, temp_setting, dataset, lang_pair, source_lang, target_lang, split, sentence_id, source, reference, prediction, is_ablation

3. metrics

  • 内容:每次运行的聚合指标。
  • 数据分割summary 分割。
  • 字段:与 predictions 相同的连接键,另加 bleu, chrf, ssa_comet(论文主要指标), num_samples, val_bleu, val_chrf, val_ssa_comet

4. glossary

  • 内容:翻译过程中共同开发的双语科技术语表。
  • 数据分割terms 分割。
  • 各语言词条数量:阿姆哈拉语 333 · 豪萨语 130 · 卢干达语 181 · 北索托语 263 · 约鲁巴语 587 · 祖鲁语 385。
  • 字段target_lang(ISO 639-3代码), eng(英语科技术语), target(目标语言翻译)。

语言信息

代码 语言 语系 区域
eng 英语 日耳曼语系
amh 阿姆哈拉语 亚非语系 东非
hau 豪萨语 亚非语系 西非
lug 卢干达语 尼日尔-刚果语系 东非
nso 北索托语(佩迪语) 尼日尔-刚果语系 南非
yor 约鲁巴语 尼日尔-刚果语系 西非
zul 祖鲁语 尼日尔-刚果语系 南非

这些目标语言在15个国家拥有超过2亿使用者。

数据集构建

采用两阶段流程:

  1. 领域专家科学传播者生成每篇论文的 250-350 字摘要(保留关键贡献和科技术语)。
  2. 专业翻译人员在逐语言主翻译审阅下,将摘要、论文文摘、术语和定义翻译成每种目标语言。

翻译过程中共同开发双语科技术语表,以填补标准化术语缺失的空白。

引用

bibtex @misc{abdulmumin2026afriscience, title = {AfriScience-MT: Towards Decolonizing Science in Africa through Text Translation}, author = {Idris Abdulmumin and Tajuddeen Gwadabe and Shamsuddeen Hassan Muhammad and David Ifeoluwa Adelani and Nomonde Khalo and Ibrahim Said Ahmad and Abiodun Modupe and Anina Mumm and Sibusiso Biyela and Michelle Rabie and Johanna Havemann and Marek Rei and Jade Abbott and Vukosi Marivate}, year = {2026}, eprint = {2605.29741}, archivePrefix = {arXiv}, primaryClass = {cs.CL}, url = {https://arxiv.org/abs/2605.29741} }

搜集汇总
数据集介绍
afriscience_mt 数据集图片
构建方式
AfriScience-MT数据集采用两阶段协同构建策略,首先由领域专家科学传播者针对每篇学术论文撰写250至350词的核心摘要,精准保留关键贡献与专业术语;随后由专业译者在逐语言主译审校机制下,将摘要、论文摘要、术语及定义翻译至各目标语言。翻译过程中同步构建双语科学术语表,以填补标准化术语缺失的空白。最终经过未翻译句剔除、单字过滤、句级去重、文档级对齐及术语规范化等精细化预处理流程,形成高质量平行语料库。
特点
该数据集涵盖英语与六种非洲低资源语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)的11个科学领域,包含230篇论文的7,605个英文源句及对应六语翻译,在句级与文档级均实现严格对齐。除了平行语料外,还完整公开了论文中所有模型预测结果、逐项运行指标及双语术语表,支持完全复现与扩展,是首个面向非洲科学文本的机器翻译基准资源。
使用方法
通过HuggingFace datasets库可加载四种配置:corpus(平行语料)、predictions(模型输出)、metrics(聚合指标)、glossary(术语表)。加载示例:corpus = load_dataset('masakhane/afriscience_mt', 'corpus')。predictions配置包含1,982,558行数据,涵盖15种模型在零样本、上下文学习及文档级等多种实验配置下的输出。用户可通过lang_pair和sentence_id字段将预测结果与测试集原文及参考译文进行关联,或利用metrics配置直接查询特定模型在某语言对上的评估分数。
背景与挑战
背景概述
机器翻译作为自然语言处理领域的核心任务,在促进跨语言知识传播中扮演着关键角色。非洲大陆拥有超过2000种语言,但绝大多数语言在机器翻译研究中长期处于低资源状态,科学文本的跨语言翻译更是鲜有涉及。由Idris Abdulmumin等学者联合Masakhane开源社区于2026年发布的AfriScience-MT数据集,聚焦英语与六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)之间的科学文本翻译。该数据集涵盖11个科学领域(如农业、生物化学、计算机科学、土著知识等),包含230篇论文的7605句平行语料,并配套发布了模型预测与评估指标,为非洲语言的科学翻译研究提供了首个标准化基准,有力推动了非殖民化科学在非洲的进展。
当前挑战
该数据集面临的核心挑战源自其低资源特性:六种目标语言均缺乏大规模高质量平行语料,尤其缺乏标准化科学术语,翻译过程中需联合领域专家与专业译者共同构建双语科学词汇表,极大增加了数据构建的复杂性与成本。此外,科学文本的翻译需严格保留专业术语的准确性、概念的完整性以及句法结构的严谨性,传统机器翻译模型在零样本或少样本条件下表现欠佳,现有主流模型(如M2M100、NLLB、Llama等)在AfriScience-MT测试集上的性能差异显著,亟需开发针对低资源科学翻译的鲁棒性模型与评估范式。构建过程中还面临文档级对齐、跨领域术语一致性维护及句子级去重等技术挑战,最终数据集仅达1K-10K规模,进一步限制了深度学习的应用空间。
常用场景
经典使用场景
AfriScience-MT数据集专为低资源非洲语言的科学文本机器翻译而设计,涵盖英语与阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语和祖鲁语六种语言。该数据集从11个科学领域(如农业、生物化学、计算机科学、健康等)精选230篇论文,构建了7605句高质量的平行语料库。其经典使用场景在于评估和微调多语言神经机器翻译模型,尤其是在科学术语密集的学术文本上,通过句子级和文档级对齐的数据,研究者可以系统性地探索跨领域翻译的鲁棒性与准确性。
衍生相关工作
AfriScience-MT的发布催生了一系列衍生工作,最显著的是其作为基准数据集被纳入非洲多语言机器翻译平台Masakhane的生态系统中。研究者基于该数据集开展了模型鲁棒性研究,比较了大型语言模型(如GPT-4o、Gemini)与传统序列到序到模型在低资源科学翻译上的表现。数据集附带的预测和指标仓库(含近200万条模型输出)已被用作复现实验的标准化资源,并激励了后续关于提示策略优化、文档级翻译一致性以及科学术语规范化的工作,进一步丰富了低资源NLP领域的方法论。
数据集最近研究
最新研究方向
当前,AfriScience-MT数据集的核心研究方向聚焦于通过科学文本的跨语言迁移,推动非洲大陆本土语言的科学知识去殖民化进程。该语料库横跨11个科学领域,涵盖英语与六种非洲语言,联合科学家与专业译者构建了双语科学术语表,填补了低资源语言在农业、土著知识等前沿学科中的术语空白。研究重点包括评估大语言模型与序列到序列模型在零样本、语境学习及文档级翻译上的性能差异,揭示出即使如GPT-5.4、Gemini-3.1等尖端模型在专业领域仍面临术语对齐与语义保真的挑战。其发布的全套预测与指标数据不仅为机器翻译基准提供了可复现的基石,更引发了对人工智能如何系统性地服务于全球南方科学传播的深层探讨,对塑造包容性的科技生态具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务