遇见数据集

HiTZ/ALIA_DocMT_Evaluation

收藏
Hugging Face2026-06-26 更新2026-07-22 收录
官方服务:

资源简介:

ALIA_DocMT_Evaluation 是一个具有挑战性的文档级机器翻译(Doc-MT)基准数据集,包含高质量的人工翻译参考数据。请注意,对于BOPV和Parliament领域,片段是从真实源数据的测试分割中采样,目前正在手动翻译成英语。数据集涵盖多个领域:Berria(来自巴斯克报纸Berria的新闻领域)、Parliament(来自巴斯克议会的政治和法律对话领域)、BOPV(来自巴斯克自治区官方公报的行政和法律领域)、Instructions(用于任务评估的多样化指令提示,如问答、摘要等)、EUSparallel(从euscrawl语料库过滤的通用网络领域)、Aldizkariak(来自巴斯克期刊的科学和学术领域)以及Podcasts(从巴斯克播客转录中提取的非正式对话领域)。该数据集旨在用于评估文档级机器翻译模型和多语言NLP研究。

ALIA_DocMT_Evaluation is a challenging document-level machine translation (Doc-MT) benchmark featuring high-quality, human-translated reference data. Please note that for the BOPV and Parliament domains, the segments are sampled from the test splits of the real source data and are currently in the process of being manually translated into English. The dataset covers multiple domains: Berria (news domain extracted from the Basque newspaper Berria), Parliament (political and legal dialogue domain from the Basque Parliament), BOPV (administrative and legal domain from the Official Gazette of the Basque Country), Instructions (diverse instructional prompts, e.g., Q&A, summarization, for task evaluation), EUSparallel (general web domain filtered from the euscrawl corpus), Aldizkariak (scientific and academic domain sourced from Basque journals), and Podcasts (informal conversational domain extracted from Basque podcast transcripts). It is intended for evaluation of document-level machine translation models and multilingual NLP research.

提供机构:
HiTZ
搜集汇总
数据集介绍
HiTZ/ALIA_DocMT_Evaluation 数据集图片
构建方式
ALIA_DocMT_Evaluation数据集致力于构建一个严谨的文档级机器翻译评估基准,其数据源自七个具有代表性的领域,包括新闻、政治法律对话、行政法律文本、多样化任务指令、科学期刊、非正式对话及通用网络文本。每个领域的语料均经过人工翻译,确保参考译文的高质量标准。其中,BOPV与Parliament领域的片段取自真实源数据的测试分割,英文翻译工作正在进行中。数据集以HuggingFace格式组织,每个配置对应一个领域,包含唯一的测试分割,并提供了文本、翻译及元数据等特征。
特点
该数据集的核心特点在于其高度的领域多样性与文档级上下文完整性。每个配置均聚焦于特定领域,如Berria的动态新闻上下文、Parliament的连续政治对话、Podcasts的即兴口语转录等,从而全面覆盖了从正式到非正式、从书面到口语的语言使用场景。数据集的测试样本量虽有限,但每个样本均保留了文档级别的结构,例如对话序列或段落连贯性,为评估模型在长距离依赖和篇章翻译能力方面提供了极具挑战性的测试环境。此外,数据集还具备多语言对(如巴斯克语-西班牙语-英语)的扩展性。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,每个领域作为一个独立的配置(config_name),例如'berria_eu_es_en'或'parliament_eu_es'。加载时需指定配置名称和分割(当前仅提供'test'分割)。数据集以'id'、源文本(如'text_eu')及目标翻译(如'translation_es'、'translation_en')的键值对形式呈现,部分配置包含丰富的元数据(如时间戳、说话人信息),便于进行细粒度分析。典型用途包括评估文档级翻译模型的性能、开展多语言自然语言处理研究,或作为对比系统优化的标准化测试集。
背景与挑战
背景概述
ALIA_DocMT_Evaluation数据集由ALIA / HiTZ团队创建,专为评估文档级机器翻译(Doc-MT)模型而设计。该数据集覆盖巴斯克语、西班牙语和英语三种语言,包含Berria(新闻)、Parliament(政治法律对话)、BOPV(行政法律)、Instructions(多样指令)、EUSparallel(通用网页)、Aldizkariak(科学学术)及Podcasts(非正式会话)七个领域,共计约1062个文档。其核心研究问题在于如何准确评估模型在长文本上下文和跨领域场景下的翻译质量,尤其针对低资源语言巴斯克语。该数据集基于人工翻译的高质量参考数据构建,对推动多语言文档级翻译研究具有重要影响力。
当前挑战
该数据集解决的核心领域挑战是文档级机器翻译中语义连贯性和上下文一致性的评估。与句子级翻译不同,文档级翻译需处理指代消解、篇章逻辑和修辞结构等问题,而现有基准对此覆盖不足。构建过程中,挑战在于从多源异构数据(如议会记录、播客转录)中提取对齐的文档级平行语料,并确保人工翻译的准确性。此外,BOPV和Parliament域段的英文翻译尚在完善中,部分领域(如Podcasts)因口语化和非正式性,翻译与对齐难度显著增加。
常用场景
经典使用场景
在自然语言处理领域,文档级机器翻译(Doc-MT)评估是一项极具挑战性的任务,其核心在于捕捉跨句子的语境依赖与篇章连贯性。ALIA_DocMT_Evaluation数据集正是为此而生,它汇聚了源自巴斯克语的多领域高质量人工翻译数据,覆盖新闻、议会演讲、行政公报、学术期刊、播客对话及通用网页等多元文本类型。经典使用场景包括以完整文档为单元的翻译质量评测,要求模型不仅处理独立句子,还要在段落乃至全文维度上维持语义一致、指代清晰与风格统一。例如,面对议会对话中连续发言的隐式承接关系,或科学文献中术语与逻辑的跨句呼应,该基准能够精准评估模型对复杂篇章结构的理解与生成能力。每个子集如berria或bopv均精心构建为具有真实语境窗口的测试集,为Doc-MT研究提供了兼具窄域专业性与宽域多样性的可靠评价标准。
衍生相关工作
该数据集的发布催生了一系列以篇章一致性为核心的衍生研究。学者们基于其多域划分,提出了面向特定语体(如议会辩论 vs. 播客对话)的领域自适应翻译框架,并利用instructions子集中的问答与摘要任务拓展了指令型语言模型的评估维度。与此类似,鉴于部分子集(如bopv与parliament)标注了发言者元数据与时间戳信息,后续工作探索了结合说话人角色对齐与历史上下文建模的篇章翻译方法。此外,该基准所强调的‘动态上下文窗口’概念被引入到对比学习与检索增强生成等前沿范式中,形成了诸如跨句子注意力蒸馏、篇章级对比解码等创新技术。这些成果不仅深化了对巴斯克语语言特化的理解,也为其他低资源语言构建评估体系提供了可复现的架构模板,推动文档级MT从原型验证走向系统化工程实践。
数据集最近研究
最新研究方向
ALIA_DocMT_Evaluation作为一项面向巴斯克语的多领域文档级机器翻译基准,正引领低资源语言翻译评估的前沿探索。该数据集涵盖新闻、议会对话、行政公告、学术期刊及播客等七大典型场景,通过人工精译参考语料构建了高难度评测框架。当前研究热点聚焦于利用该基准验证大型语言模型在长文本连贯性与跨句指代消解上的表现,尤其在处理巴斯克语这种形态复杂的孤立语言时,模型对上下文窗口的动态适应能力成为关键突破方向。结合欧盟“数字转型计划”对多语言AI的投入,该数据集正助力推动少数民族语言在政务、科研等正式场景下的机器翻译实用化,为构建更具包容性的多语言智能系统提供重要评估标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务