遇见数据集

HiTZ/ALIA_scientic_articles

收藏
Hugging Face2026-06-26 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含一个高质量、真实(非合成)的平行语料库,专注于科学和学术领域,涵盖巴斯克语(eu)、西班牙语(es)和英语(en)。与合成生成的数据集不同,该语料库基于真实、人工创作的三语摘要构建,这些摘要提取自巴斯克大学(UPV/EHU)的机构数字存储库ADDI(Archivo Digital de Docencia e Investigación)。它专门设计用于支持机器翻译系统和大型语言模型(LLM)在专业科学文本上的训练、微调和评估。数据来源包括ADDI存储库中的多个学术集合,文档类型涵盖博士论文、硕士论文、学士论文以及学术期刊和文章。每个平行记录都附有丰富的元数据(如出版日期、提交日期、URI、语言、许可证、标题和部门),以方便针对性过滤。数据集包含3,294个完美对齐的三语文档(即3,294组巴斯克语、西班牙语和英语元组)。巴斯克语的平均单词数低于西班牙语和英语,这反映了巴斯克语的黏着语形态特征。

This dataset contains a high-quality, real (non-synthetic) parallel corpus in the scientific and academic domain, covering Basque (eu), Spanish (es), and English (en). Unlike synthetically generated datasets, this corpus is built from genuine, human-authored trilingual abstracts extracted from ADDI (Archivo Digital de Docencia e Investigación), the institutional digital repository of the University of the Basque Country (UPV/EHU). It is specifically designed to support the training, fine-tuning, and evaluation of Machine Translation systems and Large Language Models (LLMs) for specialized scientific text. The raw documents were scraped and curated from multiple academic collections within the ADDI repository, including Doctoral Theses, Masters Theses, Bachelors Theses, and Academic Journals and Journal Articles. Each parallel record is accompanied by rich metadata (e.g., Publication Date, Submission Date, URI, Language, License, Title, Department) to facilitate targeted filtering. The dataset consists of 3,294 perfectly aligned trilingual documents (yielding 3,294 tuples of Basque, Spanish, and English). The lower average word count in Basque compared to Spanish and English reflects the agglutinative morphological nature of the Basque language.

提供机构:
HiTZ
搜集汇总
数据集介绍
HiTZ/ALIA_scientic_articles 数据集图片
构建方式
ALIA_scientic_articles数据集构建于巴斯克大学(UPV/EHU)的机构数字存储库ADDI(Archivo Digital de Docencia e Investigación)之上,从中提取了来自博士论文、硕士论文、学士论文及学术期刊等领域的真实三语摘要。每一条记录均为人类撰写的非合成文本,涵盖巴斯克语、西班牙语和英语三个语种。数据集包含3,294份完美对齐的三语文档,并通过丰富的元数据(如发表日期、URI、许可证、标题及院系)加以标注,为精准过滤与细粒度检索提供支撑,同时作者与导师姓名已被匿名化处理以保护隐私。
特点
该数据集的最大特色在于其真实性与高质量,专注于科学学术领域,区别于广泛存在的合成平行语料。其三语对齐结构(巴斯克语、西班牙语、英语)为跨语言机器翻译与大规模语言模型在专业文本上的训练与评测提供了宝贵资源。值得注意的是,巴斯克语的平均词数低于西班牙语与英语,但字符数相近,这反映了其作为黏着语的形态学特性,也为语言学研究提供了独特视角。数据集采用CC-BY-SA许可证发布,遵循原始科学文章的授权方式,确保了法律合规与开放性。
使用方法
数据集在HuggingFace平台上以三个配置(en_es、en_eu、es_eu)提供,每个配置均包含训练集、验证集和测试集,格式为CSV文件。用户可通过HuggingFace Datasets库轻松加载,例如使用load_dataset函数指定相应配置名即可获取平行语料对。该数据集适用于机器翻译模型的微调与评估,也可作为大规模语言模型在学术文本领域进行持续预训练或下游任务(如摘要生成、术语对齐)的基准资源。建议在使用时引用ALIA项目及关联的翻译模型,以促进学术规范与可复现性。
背景与挑战
背景概述
该数据集由巴斯克大学(UPV/EHU)的ALIA/HiTZ团队创建,发布于2024年,专注于科学和学术领域的多语言平行语料,涵盖巴斯克语、西班牙语和英语三种语言。其核心研究问题在于为机器翻译系统和大型语言模型提供高质量、非合成的真实学术文本资源,以提升低资源语言(如巴斯克语)在专业领域中的处理能力。数据源来自ADDI机构数字仓储,包含博士论文、硕士论文、学士论文及学术期刊等3,294份严格对齐的三语摘要,并附有丰富的元数据(如发表日期、部门、许可证等),显著推动了多语言科学文本翻译的研究进程。该数据集在巴斯克语机器翻译和跨语言自然语言处理领域具有重要影响力,为评估和优化专业领域翻译模型提供了可靠的基准。
当前挑战
首先,该数据集解决的领域挑战是科学文本的机器翻译,如多语言术语一致性、学术风格保留以及低资源语言(巴斯克语)的语法结构处理(其黏着性特征导致词长与字符数不成比例)。其次,构建过程中面临双重难题:数据采集需从ADDI仓储中精准筛选并爬取三种语言对齐的摘要,确保元数据完整且版权合规(CC-BY-SA);数据对齐需验证3,294份文档的措辞与结构匹配,防止因语料源异构(如不同论文模板)导致的错位。此外,隐私保护要求匿名化作者和导师信息,而巴斯克语的低资源特性又可能限制平行语料的规模与多样性,进一步增加模型训练的难度。
常用场景
经典使用场景
在自然语言处理与机器翻译领域,ALIA_scientic_articles数据集因其独特的科学学术语料特性而备受青睐。该数据集涵盖巴斯克语、西班牙语和英语三种语言,收录了博士论文、硕士论文、学士论文及学术期刊等多种文献类型的摘要,构成了高质量、真实且平行的语料库。研究者通常将其用于训练和评估面向专业科学文本的机器翻译系统及大型语言模型,尤其适合多语言翻译场景下的模型微调与性能基准测试。其非合成性与丰富的元数据(如出版日期、所属院系等)进一步支持了跨语言、跨学科的学术文本分析任务。
解决学术问题
该数据集有效回应了低资源语言(如巴斯克语)在学术领域机器翻译研究中数据匮乏的困境。长期以来,科学文本的多语言平行语料稀缺,限制了神经机器翻译模型在专业术语与复杂句式上的泛化能力。ALIA_scientic_articles通过提供人工撰写且对齐的三语摘要,使研究者能够探索巴斯克语与主流语言(英语、西班牙语)之间的翻译规律,推动低资源语言的翻译质量提升。此外,该数据集促进了学术文本自动翻译的鲁棒性研究,为跨语言学术交流与知识传播提供了数据基础,具有显著的文化与技术意义。
衍生相关工作
围绕该数据集,学界已衍生出多项经典工作。一方面,研究者基于其平行语料开发了面向巴斯克语的神经机器翻译模型,如利用Transformer架构进行微调,显著提升了巴斯克语-西班牙语翻译的BLEU分数。另一方面,该数据集被用于评测大型语言模型(如GPT类模型)在低资源科学文本翻译中的表现,揭示模型在多语言、专业化场景下的能力边界。此外,结合元数据中的院系与日期信息,有工作探索了领域自适应翻译方法,通过迁移学习提升跨学科翻译效果。这些研究不仅丰富了机器翻译的理论框架,也为低资源语言的自然语言处理技术落地提供了实证参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务