遇见数据集

proxectonos/MT_en-gl

收藏
Hugging Face2026-07-09 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个英语-加利西亚语平行语料库,包含两个JSONL文件:en_gl.jsonl(约998万行,2.6GB)和en_gl_trans.jsonl(约1026万行,4.1GB)。数据格式为JSONL,每个条目包含源语言(英语)和目标语言(加利西亚语)的文本对,以及唯一标识符。en_gl.jsonl通过standard_pipeline处理,包括编码、去重、pyplexity评分、QueLingua语言过滤和标准化;en_gl_trans.jsonl通过PT_GL_parallel处理,涉及机器翻译去重、Apertium和port2gal工具的音译以及标准化。数据来源整合了OPUS中兼容CC BY 4.0许可证的英语-加利西亚语语料库,以及额外非OPUS语料库(如CLUVI文学平行语料库和自定义验证集)。en_gl.jsonl包含自然平行文本,en_gl_trans.jsonl包含机器翻译后编辑的文本。该数据集适用于机器翻译任务,支持英语到加利西亚语的翻译模型训练。

This dataset is an English-Galician parallel corpus consisting of two JSONL files: en_gl.jsonl (approximately 9,982,077 lines, 2.6 GB) and en_gl_trans.jsonl (approximately 10,262,102 lines, 4.1 GB). The data is in JSONL format, with each entry containing source (English) and target (Galician) text pairs, along with a unique identifier. en_gl.jsonl is processed via the standard_pipeline, which includes encoding, deduplication, pyplexity scoring, QueLingua language filtering, and normalization. en_gl_trans.jsonl is processed via the PT_GL_parallel pipeline, involving machine translation deduplication, transliteration using Apertium and port2gal tools, and normalization. The data sources incorporate all available OPUS corpora for the English-Galician pair compatible with the CC BY 4.0 license, as well as additional non-OPUS corpora (such as the CLUVI literary parallel corpus and a custom validation set). en_gl.jsonl contains naturally occurring parallel text, while en_gl_trans.jsonl contains machine-translated and post-edited text. This dataset is suitable for machine translation tasks, supporting training models for English-to-Galician translation.

提供机构:
proxectonos
搜集汇总
数据集介绍
proxectonos/MT_en-gl 数据集图片
构建方式
MT_en-gl数据集是一个面向英语到加利西亚语翻译任务的大规模平行语料库,整合了来自OPUS平台中兼容CC BY 4.0许可的所有可用语料,并额外纳入了CLUVI文学平行语料库及自定义验证集。数据集以两个JSONL文件形式呈现:en_gl.jsonl收录了约998万行自然发生的平行文本,经过标准流水线处理,涵盖编码、去重、pyplexity评分、QueLingua语言过滤及归一化;en_gl_trans.jsonl则包含约1026万行源自机器翻译后经人工编辑的平行文本,经由专门流水线执行平行去重、基于Apertium与port2gal的自动音译以及归一化步骤。所有处理依托Proxecto Nós流水线完成,确保了语料的高质量与一致性。
特点
该数据集具备双重结构特性,创新性地同时提供自然平行文本与机器翻译后编辑文本,为翻译模型训练与评估提供了丰富的对比维度。en_gl.jsonl中的源文本与目标文本均为原始语言材料,反映了真实的语言使用场景;而en_gl_trans.jsonl则以源语言文本为原始内容,目标语言文本为经过人工修正的机器翻译输出,有助于模型学习翻译修正模式。数据集规模宏大,总条目超过2000万行,覆盖文学、通用等多领域语料,且经过严格的去重、语言过滤与质量评分处理,有效降低了噪声与冗余,保证了语料的纯净度与代表性。
使用方法
数据集以JSONL格式存储,每条记录包含src-tgt(语言对标识)、src(源语言文本)、tgt(目标语言文本)及id(唯一标识符)四个字段,便于程序化读取与处理。用户可根据研究需求灵活选择使用en_gl.jsonl进行基于自然平行语料的翻译模型训练,或采用en_gl_trans.jsonl探索机器翻译后编辑任务。由于数据集许可为CC BY 4.0,允许自由共享与改编,适用于学术界与工业界的翻译系统研发、跨语言自然语言处理基准测试,以及低资源语言的机器翻译方法研究。建议使用时注意文件体积,合理配置计算资源。
背景与挑战
背景概述
在神经机器翻译蓬勃发展的浪潮中,低资源语言对的平行语料库匮乏成为制约翻译质量提升的关键瓶颈。MT_en-gl数据集由Proxecto Nós研究团队在NextGenerationEU和西班牙数字化转型部的资助下创建,旨在填补英语至加利西亚语翻译领域的资源空白。该数据集汇聚了OPUS平台及CLUVI文学语料库等资源,经过编码、去重、语言过滤与归一化等多重流水线处理,最终构建了包含约2000万句对的双语平行语料,为低资源语言对的机器翻译研究提供了坚实的数据基础。
当前挑战
MT_en-gl数据集面临的核心挑战在于解决低资源语言对翻译中的领域通用性问题。加利西亚语作为少数民族语言,其数字化语料稀缺且分布零散,导致数据规模与质量参差不齐。构建过程中,团队需在有限数据源中挖掘并整合大规模平行句对,同时应对文本编码不一致、语义混淆及来源多样带来的噪声。为保障数据纯净,研究团队设计了严格的过滤与去重流程,并引入机器翻译后编辑策略以提升目标端文本的自然度,但数据平衡性与领域覆盖度仍是持续优化的方向。
常用场景
经典使用场景
在神经机器翻译领域,英加平行语料库MT_en-gl的经典应用场景是训练与评估英语到加利西亚语的翻译模型。该数据集汇聚了超过一千万句对,涵盖自然平行文本与机器翻译后编辑文本,为构建鲁棒的翻译系统提供了海量训练资源。其精心设计的two-pipeline处理流程——包括去重、语言过滤、及困惑度评分等步骤——保障了语料的高质量与一致性,使其成为低资源语言机器翻译研究的理想基准。
衍生相关工作
该数据集衍生出了一系列经典的机器翻译研究工作。例如,基于MT_en-gl训练的Transformer与ConvS2S模型成为加利西亚语翻译的基准系统。后续工作探索了利用后编辑数据训练质量估计模型,以及结合前一个Pipeline进行的语言过滤方法改进。此外,Proxecto Nós项目基于该语料开发的公开翻译模型和工具链,进一步推动了低资源语言的翻译技术创新与评测标准化。
数据集最近研究
最新研究方向
当前,低资源语言神经机器翻译的突破性进展正促使学界与产业界将目光投向少数语种的数字化转型,而MT_en-gl数据集正是这一浪潮中极具代表性的基石资源。该数据集汇聚了来自OPUS及CLUVI文学语料库等近千万条英-加利西亚语平行句对,并通过精细的双流水线处理(standard_pipeline与PT_GL_parallel)实现了去重、语言过滤、困惑度评分及归一化,尤其引入基于Apertium与port2gal的自动转写技术,为加利西亚语这一使用人口逾两百万的罗曼语支语言提供了高质量、大规模的训练与评估语料。该数据集紧密关联欧盟下一代计划(NextGenerationEU)框架下的ALIA模型开发项目,不仅服务于加利西亚语机器翻译系统的迭代优化,也为濒危语言的语料构建与模型训练树立了可复用的技术范式,对推动多语种平等及数字语言生态的可持续发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务