遇见数据集

proxectonos/MT_es-gl

收藏
Hugging Face2026-07-09 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个西班牙语-加利西亚语平行语料库,专为机器翻译任务设计。它包含两个JSONL文件:es_gl.jsonl(约1583万行,5.1 GB)包含自然平行文本,es_gl_trans.jsonl(约2839万行,8.1 GB)包含机器翻译后编辑的文本。每个条目采用JSON格式,包括源语言(西班牙语)、目标语言(加利西亚语)和唯一ID。数据集通过Proxecto Nós pipeline处理,包括编码、去重、pyplexity评分、QueLingua语言过滤和标准化等步骤。数据来源整合了OPUS中兼容CC BY 4.0的语料库,以及额外的非OPUS语料库,如CLUVI文学平行语料库、系统错误、习语表达和自定义验证集。数据集规模在1000万到1亿之间,语言为西班牙语和加利西亚语,适用于翻译任务,采用CC BY 4.0许可协议。

This dataset is a Spanish-Galician parallel corpus specifically designed for machine translation tasks. It contains two JSONL files: es_gl.jsonl (approximately 15.83 million lines, 5.1 GB) containing natural parallel text, and es_gl_trans.jsonl (approximately 28.39 million lines, 8.1 GB) containing post-edited machine translation text. Each entry is formatted in JSON, including the source language (Spanish), target language (Galician), and a unique ID. The dataset was processed via the Proxecto Nós pipeline, which includes steps such as encoding, deduplication, perplexity scoring, language filtering with QueLingua, and standardization. The data sources integrate corpora compatible with CC BY 4.0 from OPUS, as well as additional non-OPUS corpora such as the CLUVI literary parallel corpus, system error pairs, idiomatic expressions, and a custom validation set. With a corpus size ranging from 10 million to 100 million, the dataset uses Spanish and Galician, is suitable for translation tasks, and is released under the CC BY 4.0 license.

提供机构:
proxectonos
搜集汇总
数据集介绍
proxectonos/MT_es-gl 数据集图片
构建方式
MT_es-gl数据集是为西班牙语至加利西亚语的机器翻译任务而构建的大规模平行语料库。其构建过程依托Proxecto Nós团队开发的标准化流水线,聚合了所有来自OPUS平台且兼容CC BY 4.0许可的平行语料,并额外纳入CLUVI文学平行语料库、Proxecto Nós系统性错误与习语表达等非OPUS资源。数据经过编码、去重、基于pyplexity的困惑度评分、QueLingua语言过滤以及归一化处理,最终形成两个JSONL文件:es_gl.jsonl收录15,832,586条自然平行句对,而es_gl_trans.jsonl包含28,389,111条机器翻译后经人工译后编辑的句对,通过并行去重和Apertium与port2gal相结合的自动音译流程完成加工。
使用方法
使用MT_es-gl数据集时,研究者可直接加载两个JSONL文件,每条记录包含src-tgt字段标识语言方向为es-gl、src字段存放西班牙语原文、tgt字段存放加利西亚语译文,以及唯一标识id。对于需要干净自然语言对的场景,推荐使用es_gl.jsonl;而对于追求更大数据量且可接受部分机器翻译痕迹的应用,可选择es_gl_trans.jsonl。数据兼容主流深度学习框架,支持通过HuggingFace Datasets库快速读取,并按标准翻译任务格式进行训练与评估。建议根据模型需求对两个文件进行按比例混合或单独使用,并在应用前进行必要的分词与预处理操作。
背景与挑战
背景概述
机器翻译领域长期受制于低资源语言对的语料匮乏困境,西班牙语–加利西亚语作为罗曼语族内部密切关联却数据稀缺的语言对,其平行语料库的建设尤为迫切。MT_es-gl数据集由Proxecto Nós研究团队在欧盟NextGenerationEU基金及西班牙数字化转型与公共职能部的资助下,于2024年构建完成,旨在为西班牙语到加利西亚语的神经机器翻译研究提供规模化、高质量的平行数据。该数据集整合了OPUS平台中所有兼容CC BY 4.0协议的语料,并补充了CLUVI文学平行语料、Proxecto Nós系统性错误表、习语表达以及自定义验证集,总计超过4400万条平行句对。MT_es-gl的发布显著推动了加利西亚语这一区域性语言在自然语言处理领域的资源建设与模型发展,为低资源语言机器翻译研究树立了典范。
当前挑战
MT_es-gl所应对的核心领域挑战是低资源语言神经机器翻译中的数据稀疏性问题,加利西亚语在数字化语料、双语词典及标注数据方面的匮乏长期制约着翻译模型的性能。构建过程中面临的挑战尤为严峻:首先,语料来源异构性导致数据质量参差不齐,需设计包含编码、去重、语言过滤、困惑度评分与归一化在内的多阶段标准流水线进行清洗;其次,为扩充有效语料,团队创造性引入基于后编辑机器翻译的PT_GL_parallel流水线,通过跨语言的去重与音译转换处理葡萄牙语–加里西亚语相关语料,但人工后编辑的成本与一致性控制仍是关键瓶颈;此外,非OPUS语料如CLUVI等需逐一进行格式适配与对齐验证,确保与主流语料的兼容性。
常用场景
经典使用场景
MT_es-gl数据集是为西班牙语到加利西亚语的机器翻译任务精心打造的大规模平行语料库,汇聚了OPUS平台中兼容CC BY 4.0协议的语料,并额外整合了CLUVI文学平行语料库、Proxecto Nós的系统性错误与习语表达等特色资源。该数据集包含近4400万条对齐句对,经过去重、语言过滤、归一化等严谨流水线处理,为神经机器翻译模型的训练与评估提供了高质量且领域多样的数据基础。其经典使用场景在于训练和验证西班牙语-加利西亚语翻译系统,尤其适用于低资源语言对场景,助力提升翻译准确性与流畅度。
解决学术问题
该数据集的核心学术价值在于破解低资源语言对机器翻译中数据匮乏与质量不均的困境。通过整合自然平行文本与人工后编辑的机器翻译数据,MT_es-gl有效扩充了西班牙语-加利西亚语对的训练资源,为研究数据增强、双语词典构建、机器翻译后编辑策略等前沿课题提供了基准。其标准化流水线处理为跨语言迁移学习与多模态翻译研究奠定了可靠基础。该数据集的意义在于推动加利西亚语等区域语言的数字化发展,平衡语言技术生态。
实际应用
在实际应用中,MT_es-gl数据集深度赋能西班牙与加利西亚地区的多语言服务场景。它被用于开发政府文书、法律条款、医疗指南及教育材料的高精度自动翻译系统,支持公共服务平台实现双语无缝切换。在媒体与出版领域,该数据集助力新闻稿件、文学作品及影视字幕的快速翻译,降低跨语言传播成本。此外,它支撑企业级翻译工具与智能客服系统的搭建,促进跨境商务与文旅产业的沟通效率,切实服务于区域语言保护与文化传播需求。
数据集最近研究
最新研究方向
近期研究聚焦于西班牙语-加利西亚语机器翻译领域的大规模平行语料构建与质量提升。MT_es-gl数据集通过融合OPUS多源语料、CLUVI文学平行库及Proxecto Nós系统性错误与习语表达数据,经去重、困惑度评分、语言过滤与规范化精细流水线处理,形成了逾4400万句对的超大规模双语资源。尤其值得关注的是,该数据集引入了基于Apertium与port2gal自动音译的后编辑机器翻译机制,显著提升了低资源语言对的数据多样性与翻译自然度。作为欧盟NextGenerationEU资助的ALIA模型开发项目核心组件,该工作为加利西亚语这一濒危罗曼语族的神经机器翻译研究提供了关键数据基石,有力推动了ibe语言技术平权与数字语言生态的可持续发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务