遇见数据集

dsfsi/afriscience_mt

收藏
Hugging Face2026-06-09 更新2026-06-14 收录
官方服务:

资源简介:

AfriScience-MT是一个用于科学机器翻译的平行语料库,支持英语和六种非洲语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语),涵盖农业、生物化学、生物学、化学、计算机科学、工程学、地理学、健康、本土知识、社会学和统计学等11个科学领域。该数据集由领域专家科学传播者和专业翻译共同开发,包含230篇论文的7,605个英语源句子,每个句子都翻译成六种非洲语言,并在句子和文档级别对齐。此外,数据集还发布了相关论文中的所有模型预测和每轮评估指标,以及共同开发的双语科学术语表,以便复现和扩展基准测试。数据集包括四个配置:语料库(默认)、预测结果、指标和术语表,分别提供训练、开发和测试分割的数据。

AfriScience-MT is a parallel corpus for scientific machine translation, supporting English and six African languages: Amharic, Hausa, Luganda, Northern Sotho, Yoruba, and Zulu. It covers 11 scientific domains including Agriculture, Biochemistry, Biology, Chemistry, Computer Science, Engineering, Geography, Healthcare, Indigenous Knowledge, Sociology, and Statistics. This dataset was co-developed by domain experts, science communicators and professional translators, containing 7,605 English source sentences from 230 academic papers, each translated into the six aforementioned African languages, with alignment at both sentence and document levels. In addition, the dataset also releases all model predictions and per-round evaluation metrics from the associated papers, as well as the co-developed bilingual scientific terminology glossary, to facilitate benchmark reproduction and expansion. The dataset includes four configurations: Corpus (default), Predictions, Metrics, and Terminology Glossary, which respectively provide training, development and test split data.

提供机构:
dsfsi
搜集汇总
数据集介绍
dsfsi/afriscience_mt 数据集图片
构建方式
AfriScience-MT语料库的构建遵循严谨的两阶段流程。首先,由领域专家科学传播者对每篇论文撰写250至350词的通俗摘要,保留关键贡献与科学术语;随后,由专业翻译人员在首席译员的评审下,将摘要、原文摘要、术语及其定义翻译至六种非洲目标语言。在此过程中,翻译团队同步协作编制双语科学术语表,以填补标准化术语缺失的空白。语料库涵盖农业、生物化学等11个科学领域,包含230篇论文的7605句英文源句,每一句均与六种非洲语言译文实现句子级与文档级对齐,并基于文档层级划分训练、开发与测试集,确保领域分布均衡且无跨论文句子泄露。
特点
该数据集的核心特色在于其全面性与可复现性。它不仅是英—非多语平行科学翻译语料库,还公开了每项模型预测结果与每次运行的评估指标,研究者无需重跑实验即可复现基准评测。数据集提供了四种配置:平行语料库、逐句模型输出、聚合指标与双语术语表,便于深入分析。其术语表针对约鲁巴语、祖鲁语等标准化科学术语稀缺的语言进行了重点扩充,分别收录587条与385条术语。覆盖六种非洲语言,总使用人口逾2亿,地域横跨15个国家,显著提升了低资源语言的科学翻译研究基础。
使用方法
研究者可通过HuggingFace Datasets库轻松加载该数据集。使用`load_dataset('dsfsi/afriscience_mt', 'corpus')`可获取默认的平行语料库,包含训练、开发与测试子集。`predictions`配置提供所有评测模型的逐句输出,包含M2M100、NLLB、各类大语言模型等的零样本、上下文学习与文档级配置结果。`metrics`配置提供每次运行的聚合BLEU、chrF与SSA-COMET得分,`glossary`配置则提供双语科学术语表。这些配置可通过`sentence_id`与`lang_pair`字段进行关联,支持灵活的Pandas合并操作,便于研究者针对特定模型、语言对或实验配置进行深入分析。
背景与挑战
背景概述
AfriScience-MT数据集由Idris Abdulmumin、Shamsuddeen Hassan Muhammad等学者于2026年联合构建,旨在推动非洲科学文献的翻译去殖民化进程。该数据集覆盖英语与六种非洲低资源语言(阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语、祖鲁语),涉及11个科学领域,包含230篇论文的7605个英文句子及其对应翻译。通过专家科学传播者与专业翻译者的协作,数据集不仅提供了高质量的平行语料,还附带了双语科学术语表、模型预测及评估指标,为低资源机器翻译研究提供了重要基准。其发布显著促进了非洲语言的科学传播,填补了该领域的数据空白,对自然语言处理与非洲语言技术发展具有里程碑意义。
当前挑战
该数据集面临多重挑战:首先,所解决的领域问题在于低资源非洲语言在科学翻译中的严重匮乏,现有机器翻译系统因训练数据稀缺而性能低下,尤其在处理科学术语和文化特异性表述时存在显著偏差。其次,构建过程中需克服翻译质量控制的难题,包括确保跨15个国家、6种语言的翻译一致性,以及为缺乏标准化术语的语言(如约鲁巴语、祖鲁语)创建领域专用词汇表。此外,数据集的规模限制(7605句)与领域多样性(11个科学领域)要求精细的句子对齐和文档级分割,以防止数据泄露,这对预处理流程提出了严格的技术要求。
常用场景
经典使用场景
AfriScience-MT数据集的核心用途在于构建和评估面向低资源非洲语言的科学文本机器翻译系统。该数据集精心汇集了涵盖农业、生物化学、计算机科学等11个科学领域的230篇英文论文,并由领域专家与专业译者协同,将7,605个英文句子精准翻译为阿姆哈拉语、豪萨语、卢干达语、北索托语、约鲁巴语及祖鲁语六种非洲语言。研究者可基于其提供的句子级与文档级对齐的平行语料,训练或微调序列到序列模型及大语言模型,并在统一的测试集上评测模型在科学术语翻译、长句处理及跨领域泛化等方面的表现。数据集同时公开了多种模型在不同配置下的完整预测结果与评价指标,为可复现的基准研究奠定了坚实基础。
解决学术问题
该数据集直面非洲科学话语体系中被长期忽视的结构性困境——本土语言在学术传播中的缺位。在传统机器翻译研究中,低资源语言的科学文本翻译因缺乏高质量平行语料而进展缓慢,导致非洲本土语言使用者难以获取前沿科学知识,形成了知识生产与传播的殖民性断层。AfriScience-MT的构建巧妙填补了这一空白,不仅提供了稀缺的跨领域科学平行语料,更通过设计文档级划分策略避免了数据泄露,保障了评估的严谨性。其发布推动了低资源神经机器翻译的研究范式转型,促使学界从单纯追求通用翻译性能转向关注特定领域、特定语言群体的语言权利与知识公平,对促进科学知识的去殖民化传播具有里程碑式的学术意义。
衍生相关工作
围绕AfriScience-MT数据集,一系列具有启示性的衍生工作已然展开。论文中系统评估了M2M100、NLLB等多语言序列到序列模型,以及Llama3、Gemma2、AfriqueLlama等大语言模型在零样本、上下文学习和文档级翻译等多种配置下的表现,形成了覆盖15种模型、超过198万行预测记录的可复现基准。这些实验结果不仅揭示了不同架构模型在处理非洲语言科学文本时的优劣差异,更催生了针对低资源语言微调策略的深入探讨,例如LoRA适配器在提升翻译流畅性与术语一致性方面的有效性。此外,数据集的术语表构建方法已被后续研究借鉴,用于其他非洲语言的领域术语标准化工作,而文档级划分策略也成为评估跨句子翻译一致性时的重要参考,持续激发着关于科学翻译中语境建模与知识保留的创新探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务