遇见数据集

ALIA_DocMT_Evaluation

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

该数据集是一个多语言平行语料库,主要用于文档级机器翻译模型的评估和多语言自然语言处理研究。数据集包含7个子集,涵盖巴斯克语(eu)、西班牙语(es)和英语(en)之间的平行文本。数据来源多样,包括杂志文章(aldizkariak)、新闻文本(berria)、巴斯克官方公报(bopv)、平行语料(eusparallel)、指令文本(instructions)、议会记录(parliament)和播客文本(podcast)。数据集总样本量超过1000个,每个子集都包含测试分割。数据特征因子集而异,通常包含文本ID、源语言文本(巴斯克语)以及对应的西班牙语和/或英语翻译。部分子集还包含元数据信息,如发布日期、URL、标题、演讲者、政党等。该数据集在CC-BY-SA 4.0许可下发布,由ALIA/HiTZ团队整理,资金来源于欧盟NextGenerationEU计划。

This dataset is a multilingual parallel corpus primarily used for evaluating document-level machine translation models and multilingual natural language processing research. It contains 7 subsets covering parallel texts between Basque (eu), Spanish (es), and English (en). The data sources are diverse, including magazine articles (aldizkariak), news texts (berria), the Basque Official Gazette (bopv), parallel corpora (eusparallel), instruction texts (instructions), parliamentary records (parliament), and podcast texts (podcast). The total sample size exceeds 1000, with each subset including test splits. Data features vary by subset, typically containing text IDs, source language texts (Basque), and corresponding Spanish and/or English translations. Some subsets also include metadata such as publication date, URL, title, speaker, political party, etc. The dataset is released under the CC-BY-SA 4.0 license, curated by the ALIA/HiTZ team, with funding from the EU NextGenerationEU program.

提供机构:
HiTZ zentroa
创建时间:
2026-06-25
原始信息汇总

数据集概述

ALIA_DocMT_Evaluation 是一个用于评估文档级机器翻译模型的多语言数据集,由 HiTZ 团队发布,采用 CC-BY-SA-4.0 许可证。

数据集构成

该数据集包含 7 个子集(config),每个子集仅提供 test 拆分,用于模型评估。

子集名称 数据量(样本数) 数据大小 语言对
aldizkariak_eu_es_en 60 175,976 bytes 巴斯克语 → 西班牙语、英语
berria_eu_es_en 77 251,931 bytes 巴斯克语 → 西班牙语、英语
bopv_eu_es 40 146,508 bytes 巴斯克语 ↔ 西班牙语
eusparallel_eu_es_en 66 323,813 bytes 巴斯克语 → 西班牙语、英语
instructions_eu_es_en 753 612,805 bytes 巴斯克语 → 西班牙语、英语
parliament_eu_es 38 141,483 bytes 巴斯克语 ↔ 西班牙语
podcast_eu_es 17 704,242 bytes 巴斯克语 → 西班牙语

数据字段

各子集字段略有不同,主要包含:

  • id / uid:样本唯一标识符
  • text / text_eu / src:源语言文本(巴斯克语)
  • translation_es / text_es:西班牙语翻译
  • translation_en / en_translation:英语翻译(部分子集)
  • meta:元数据字段,包括标题、日期、来源、发言人、政党等信息(部分子集)
  • date / url:日期和原网址(部分子集)

用途与背景

  • 用途:文档级机器翻译模型评估及多语言 NLP 研究
  • 资助:由西班牙数字化转型与公共职能部通过欧盟 NextGenerationEU 资金资助(ALIA 项目)
  • 引用:使用该数据集时请引用 ALIA 项目及对应翻译模型
搜集汇总
数据集介绍
ALIA_DocMT_Evaluation 数据集图片
构建方式
ALIA_DocMT_Evaluation数据集是专为评估文档级机器翻译模型而构建的测试基准,其数据源自多个高质量的双语及三语语料库,涵盖巴斯克语(eu)、西班牙语(es)和英语(en)。数据集包含七个不同的配置,分别对应不同的数据源:如出自杂志的aldizkariak、新闻报纸berria、官方公报bopv、平行语料eusparallel、技术文档instructions、议会记录parliament以及播客转录podcast。每个配置均以测试集(test split)的形式提供,样本数量从17到753不等,确保了评估场景的多样性和专业性。数据遵循CC-BY-SA许可协议,以确保原始数据的授权合规性。
特点
该数据集的核心特点在于其针对文档级翻译评估的专门设计,覆盖了从正式文本(如官方公报、议会记录)到非正式内容(如播客)的广泛文本类型和领域。每个配置均包含源语言文本及对应的精准人工翻译,例如bopv配置提供了每篇文档的独特标识符、来源、日期、URL以及丰富的元数据字段(如标题、范围、状态、组织等),便于进行细粒度的分析与可复现性研究。数据集规模精心规划,整体样本量控制在约1051个实例,在促进高效评估的同时,亦能有效捕捉低资源语言对翻译的挑战性特征。
使用方法
使用者可通过Hugging Face Datasets库直接加载该数据集,按需指定配置名称(如'instructions_eu_es_en')以获取特定领域的测试数据。加载后,数据以标准字典格式呈现,包含id、源文及译文列,便于直接输入到文档级机器翻译模型中进行推理。评估过程中,用户可采用如BLEU、chrF或COMET等标准指标计算译文质量,并利用数据集内嵌的元数据(如bopv配置中的组织信息)进行分组或领域层面的性能剖析。数据集仅提供测试集,故其设计初衷是作为统一评估基准,而非训练数据使用。
背景与挑战
背景概述
ALIA_DocMT_Evaluation数据集是西班牙ALIA项目与HiTZ研究团队联合构建的专用评测基准,旨在服务于文档级机器翻译模型的评估与多语言自然语言处理研究。该数据集创建于2023年至2024年间,聚焦于巴斯克语这一低资源语言与西班牙语、英语之间的翻译对,覆盖了新闻、议会记录、播客、官方公报及指令文本等多元领域。其核心研究问题在于填补文档级翻译评测中低资源语言与高资源语言之间系统性评估的空白,为评估模型在跨句语境、篇章连贯性和领域适应性上的表现提供标准化测试集。凭借其精心设计的子集划分与细粒度元数据,该数据集对巴斯克语机器翻译技术的进步以及多语言NLP模型的鲁棒性评估产生了重要推动作用。
当前挑战
该数据集所解决的领域问题聚焦于文档级机器翻译中跨句子语境建模与领域适应性的双重挑战。与传统句子级翻译不同,文档级翻译要求模型在保持术语一致性、指代消解和篇章连贯性方面展现出更强能力,而低资源语言如巴斯克语更因数据稀缺导致模型难以学习到足够的语言结构特征。在构建过程中,研究人员面临的主要挑战包括:从不同来源(新闻、议会、播客等)搜集并清洗双语平行语料,确保翻译质量与元数据描述的准确性;对包含时间、演讲者、政党和公报状态等结构化元数据的子集(如bopv_eu_es和parliament_eu_es)进行规范化处理以保持可复现性;以及在有限样本量(如播客子集仅17个样本)下设计出能够有效区分模型性能的评测任务。
常用场景
经典使用场景
在自然语言处理领域,文档级机器翻译是一项极具挑战性的任务,它要求模型在翻译过程中不仅关注句子层面的对应关系,还需捕捉段落乃至全文的语境连贯性与指代一致性。ALIA_DocMT_Evaluation数据集正是为这一学术诉求而生,其核心用途在于评估和验证多语种文档级翻译模型的性能。该数据集汇聚了巴斯克语、西班牙语和英语间的平行语料,覆盖杂志、新闻、官方公报、议会记录、播客及使用说明等多元文本类型,每个配置均以测试集形式提供,确保评估的标准化与可重复性。研究者可借助此数据集,在真实场景下检验翻译系统对长文本语义保持、术语统一及语篇结构迁移的能力,从而推动神经机器翻译从句子级向文档级的跃迁。
衍生相关工作
围绕ALIA_DocMT_Evaluation数据集,已衍生出若干具有启发性的研究方向与方法论创新。其中,最常见的工作是将其作为评测基准,比较不同文档级翻译策略的有效性,例如上下文窗口扩展、跨句注意力机制以及基于大型语言模型的提示工程。部分研究者利用该数据集中的元数据字段(如日期、来源与演讲者信息)探索时间敏感型翻译与说话风格保持的建模技术。此外,数据集内包含的巴斯克语语料,极大地推动了低资源语言的文档级翻译研究,相关成果常涉及跨语言迁移学习与数据增强策略的适应性改良。这些衍化工作不仅验证了该数据集作为评估工具的鲁棒性,也揭示了其在激发新算法设计与理论探讨方面的催化剂作用。
数据集最近研究
最新研究方向
在低资源语言神经机器翻译领域,ALIA_DocMT_Evaluation数据集的问世为巴斯克语的多语种文档级翻译评估注入了新活力。该数据集整合了来自期刊、议会记录、播客等多元领域的平行语料,涵盖巴斯克语与西班牙语、英语之间的双向翻译对,尤其关注文档级语义连贯性与上下文一致性。当前研究前沿聚焦于利用该基准测试推动大型语言模型在低资源场景下的微调与评估,探索如何通过跨句语境建模提升翻译质量,并回应欧盟多语言政策对少数族裔语言数字化的迫切需求,为ALIA等国家级AI项目提供可靠评测支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务