遇见数据集

masakhane/afriscience_mt

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

AfriScience-MT 是一个平行科学机器翻译语料库,专为英语和六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)设计,由专家科学传播者和专业翻译共同开发,涵盖11个科学领域(农业、生物化学、生物学、化学、计算机科学、工程学、地理学、健康、本土知识、社会学、统计学)。该数据集包含230篇论文的7,605个英语源句子,每个句子都翻译成六种非洲语言,并在句子和文档级别对齐。此外,数据集还发布了伴随论文中的所有模型预测和每轮评估指标,支持基准的复现和扩展,无需重新运行实验。构建过程包括两个阶段:领域专家首先生成每篇论文的通俗摘要,然后由专业翻译进行翻译,并共同开发双语科学术语表以填补标准化术语的空白。数据集旨在通过文本翻译促进非洲科学的去殖民化。

A parallel scientific machine-translation corpus for English + six African languages (Amharic, Hausa, Luganda, Northern Sotho, Yorùbá, isiZulu), co-developed with expert science communicators and professional translators across 11 scientific domains (Agriculture, Biochemistry, Biology, Chemistry, Computer Science, Engineering, Geography, Health, Indigenous Knowledge, Sociology, Statistics). Alongside the corpus we release every model prediction and per-run metric behind the accompanying paper, so the benchmark can be reproduced and extended without re-running any experiments. The corpus includes 230 papers and 7,605 English source sentences, each translated into the six African target languages and aligned at both the sentence and document level. Construction involves a two-stage process: domain experts produce lay summaries, and translators render them into target languages while co-developing bilingual scientific glossaries. The dataset aims towards decolonizing science in Africa through text translation.

提供机构:
masakhane
搜集汇总
数据集介绍
masakhane/afriscience_mt 数据集图片
构建方式
AfriScience-MT数据集的构建遵循严谨的两阶段流程。首先,由各科学领域的专家科学传播者撰写每篇论文的250至350字通俗摘要,旨在保留关键贡献与专业术语。随后,由专业翻译人员将这些摘要、原文摘要、术语及定义翻译至六种非洲目标语言,并经过各语言主译者的审核。在翻译过程中,同步构建双语科学术语表,以填补标准化术语缺失的空白。所有预处理细节,包括去除未翻译句子、单单词过滤、句子级去重、文档级保留以及术语表规范化,均已在论文附录中详尽记录。
特点
该数据集的核心特色在于其多维度、高覆盖度的设计。它涵盖了英语与六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)之间的平行科学翻译语料,横跨11个科学领域。数据集不仅提供230篇论文、7605句的平行语料,还附带所有模型预测结果及每次运行的评估指标,便于基准测试的复现与扩展。此外,数据集中包含了合作开发的科学术语表,其中约鲁巴语(587条)和祖鲁语(385条)的术语数量最多,对应了标准化科学术语最为匮乏的语言。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的`datasets`库直接加载。数据集提供四种配置:`corpus`(默认的平行语料)、`predictions`(模型逐句输出)、`metrics`(逐次运行的聚合指标)以及`glossary`(双语科学术语表)。用户可轻松将语料与模型预测结果通过`lang_pair`和`sentence_id`字段进行关联,或按模型、实验类型等条件筛选指标数据。例如,可快速提取NLLB-1.3B模型在微调设置下对AfriScience-MT测试集的评估得分,或查看特定语言对的术语表。
背景与挑战
背景概述
AfriScience-MT数据集由Masakhane社区于2026年创建,汇聚了Idris Abdulmumin、Tajuddeen Gwadabe等来自非洲多国的研究力量,旨在通过机器翻译推动非洲科学文本的去殖民化进程。该数据集聚焦英语与六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语)之间的科学翻译,覆盖农业、生物化学、健康等11个科学领域,共包含7605句英文源句及其对应的六种非洲语言译句。作为低资源非洲语言机器翻译领域的里程碑式资源,AfriScience-MT不仅提供了平行语料库,还公开了模型预测与评估指标,为可复现研究奠定了基础,其影响力显著体现在对非洲本土语言在科学传播中地位的提升。
当前挑战
AfriScience-MT面临的核心挑战是解决低资源非洲语言在科学文本翻译中的领域问题,包括专业术语缺失、语言形态复杂度高(如祖鲁语的黏着特性)以及科学语体的准确传递。在构建过程中,团队遭遇了多重挑战:首先,230篇科学论文的摘要与知识总结需由领域专家撰写,确保关键贡献保留且语言通俗,随后由专业译者翻译,并经过逐语言主译者的审校,这一两阶段流程协调成本高昂。其次,翻译时需为每对语言创建双语科学词汇表,以弥补约鲁巴语(587词)和祖鲁语(385词)等语言在标准化科技术语上的巨大缺口,词汇表构建依赖人工协作且耗时。此外,句子级去重、文档级对齐以及未翻译句子的过滤等预处理步骤,需在低资源环境下平衡数据质量与规模,增加了数据集发布的复杂性。
常用场景
经典使用场景
AfriScience-MT数据集的核心用途在于构建和评测面向非洲低资源语言的科学文本机器翻译系统。该数据集精心收录了涵盖农业、生物化学、计算机科学等11个科学领域的230篇论文,提供了英文与阿姆哈拉语、豪萨语等六种非洲语言之间的平行语料。研究人员常基于该语料库微调或评估M2M100、NLLB等序列到序列模型,以及Llama、Gemma等大语言模型在零样本、上下文学习等配置下的翻译表现。数据集的句子级与文档级对齐设计使其既能用于传统的单句翻译实验,亦能支持文档级翻译策略的探索。
解决学术问题
该数据集直面非洲语言在科学翻译领域的资源匮乏困境,系统性地填补了低资源机器翻译研究中平行语料严重不足的空白。学术界长期受限于非洲语言缺乏标准化科技术语、专家翻译语料稀缺等瓶颈,导致相关模型在科学文本上表现欠佳。AfriScience-MT通过构建高质量专家翻译语料和双语科学术语表,为研究者提供了标准化的基准测试平台,使得评估不同模型架构、迁移学习策略和微调方法在非洲语言科学翻译上的性能成为可能,极大推动了低资源机器翻译研究的发展。
衍生相关工作
围绕AfriScience-MT衍生出一系列开创性工作。研究团队首次大规模系统性地评估了包括LLaMA、Gemma、TranslateGemma在内的多种公开及闭源大模型在非洲语言科学翻译中的表现,并开源了所有模型预测结果和评估指标,使得相关基准测试具备完全的可复现性。数据集构建过程中发展的双语科技术语表催生了针对非洲本土语言术语标准化的后续研究,而其所倡导的去殖民化科学翻译理念则激发了更多团队关注低资源语言的机器翻译公平性问题,推动了Masakhane等社区在非洲语言自然语言处理领域的系列研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务