遇见数据集

BSC-LT/BSC_ParaMT_8

收藏
Hugging Face2026-06-12 更新2026-06-14 收录
官方服务:

资源简介:

BSC_ParaMT_8是一个大规模多语言平行语料库,主要覆盖加泰罗尼亚语、西班牙语和英语与阿拉伯语、印地语、中文、日语、韩语之间的配对。该数据集通过聚合和精心过滤多个公共来源(如Tatoeba、UNPC、NLLB、WikiMatrix等)构建,提供句子级别的对齐数据,用于训练机器翻译系统。其中,西班牙语部分包含通过将原始英语句子翻译成西班牙语生成的合成数据;加泰罗尼亚语部分包含通过将原始英语和西班牙语句子翻译成加泰罗尼亚语生成的合成数据,这些合成文本使用了SalamandraTA 7B Instruct模型生成。数据集旨在促进机器翻译研究,支持多语言NLP应用,并改善对代表性不足语言对的翻译可访问性。

BSC_ParaMT_8 is a large-scale multilingual parallel corpus primarily covering parallel pairs between Catalan, Spanish, English and Arabic, Hindi, Chinese, Japanese, Korean. Constructed by aggregating and meticulously filtering multiple public resources such as Tatoeba, UNPC, NLLB, WikiMatrix, etc., it provides sentence-level aligned data for training machine translation systems. Specifically, the Spanish subset includes synthetic data generated by translating original English sentences into Spanish; the Catalan subset contains synthetic data produced by translating original English and Spanish sentences into Catalan, where the synthetic texts were generated using the SalamandraTA 7B Instruct model. This dataset aims to advance machine translation research, support multilingual natural language processing (NLP) applications, and improve translation accessibility for underrepresented language pairs.

提供机构:
BSC-LT
搜集汇总
数据集介绍
BSC-LT/BSC_ParaMT_8 数据集图片
构建方式
BSC_ParaMT_8是一个大规模多语言平行语料库,涵盖了加泰罗尼亚语、西班牙语和英语与阿拉伯语、印地语、中文、日语和韩语之间的句子级对齐。该数据集通过整合并精心筛选来自Tatoeba、UNPC、NLLB、WikiMatrix、News-Commentary等二十余个公开来源的数据构建而成。对于加泰罗尼亚语和西班牙语部分的某些语对,研究团队利用自主研发的SalamandraTA 7B Instruct模型将英文或西班牙文句子翻译为目标语言,生成了合成平行数据。所有原始数据均经过ParaCLEAN流水线的处理,包括多语言句子嵌入计算(LaBSE)、语言识别(GlotLID或Lingua.py)、基于嵌入分数和语言概率阈值的过滤、重复项去除以及标点与间距的标准化,最终形成约7.18亿条高质量平行句对。
特点
该数据集最显著的特点在于其庞大的规模与丰富的语种覆盖,总计包含717,809,877条平行句对,并按语对分文件存储于Parquet格式中,每个数据实例均包含源语言句子、目标语言句子及对应的ISO 639-1语言代码。数据集尤其强化了加泰罗尼亚语和西班牙语与五种非印欧语言(阿拉伯语、印地语、中文、日语、韩语)的平行资源,填补了这些语对的资源空白。此外,合成数据的引入有效扩充了低资源语对的规模,而多层过滤与去重机制则保障了数据质量。数据集采用ODbL开放许可,适用于机器翻译系统的监督训练、多语言模型的微调以及数据增强等下游任务。
使用方法
该数据集以Parquet格式提供,每个语对对应一个独立的文件,所有数据均位于'train'单一拆分中,便于直接加载。使用者可通过HuggingFace Datasets库或Pandas等工具读取Parquet文件,获取'l1_sentence'、'l2_sentence'、'l1'和'l2'四个字段进行模型训练。由于数据集覆盖多种语对,研究者可根据需求选择特定语对进行翻译模型的训练或评估,也可将多个语对结合以支持多语言模型的训练。值得注意的是,数据集中包含合成生成的文本,用户在使用时需留意其可能反映源语言模型的潜在偏差。对于个性化数据移除请求,可通过联系邮箱ai_institute_mt@bsc.es提交,经确认后将在下一版本中处理。
背景与挑战
背景概述
机器翻译作为自然语言处理领域的核心任务,长期受限于高质量平行语料的匮乏,尤其是对加泰罗尼亚语等低资源语言以及非英语语系语言对的覆盖严重不足。为应对这一瓶颈,巴塞罗那超级计算中心(BSC)人工智能研究所的机器翻译团队于近期发布了BSC_ParaMT_8数据集,该数据集由717,809,877个平行句对构成,涵盖加泰罗尼亚语、西班牙语、英语与阿拉伯语、印地语、中文、日语、韩语七种目标语言之间的十五个语言方向。通过整合Tatoeba、UNPC、NLLB、WikiMatrix等二十余个公开语料库,并利用自研的SalamandraTA 7B Instruct模型生成合成数据以扩充加泰罗尼亚语和西班牙语对稀缺语言的语料规模,该数据集为多语言机器翻译系统的训练提供了前所未有的资源基础,有力推动了跨语言自然语言处理研究的进展。
当前挑战
BSC_ParaMT_8数据集所解决的领域挑战在于,加泰罗尼亚语、西班牙语等罗曼语族语言与阿拉伯语、印地语、中日韩语等非印欧语系语言之间的机器翻译长期面临平行语料稀缺、语言结构差异显著以及语义对齐精度不足等难题。在构建过程中,研究人员面临多重技术挑战:首先,来自二十余个来源的异构语料需经过格式统一、语言识别(借助GlotLID与Lingua.py)、基于LaBSE嵌入的语义过滤及去重等复杂流水线处理;其次,合成数据的引入虽扩充了规模,但需通过严格的评分阈值控制以降低翻译模型固有偏差对数据质量的影响;此外,大规模数据清洗与并行计算资源的协调管理亦构成工程层面的重大挑战。
常用场景
经典使用场景
BSC_ParaMT_8数据集的核心应用在于赋能机器翻译系统的训练与优化,特别是针对加泰罗尼亚语、西班牙语、英语与阿拉伯语、印地语、中文、日语、韩语等低资源语言对之间的翻译。该数据集汇聚了来自Tatoeba、UNPC、NLLB、WikiMatrix等十余个公开语料库的平行句对,并经过严格的清洗与对齐处理,为监督式机器翻译、多语言模型微调以及数据增强提供了坚实基础。其涵盖的七亿余条句对,既包含了自然采集的高质量语料,也融入了利用SalamandraTA 7B Instruct模型生成的合成数据,有效弥补了某些语言对平行语料匮乏的短板,从而显著提升了翻译模型的泛化能力与鲁棒性。
解决学术问题
在学术研究层面,该数据集直面多语言神经机器翻译中数据稀缺与质量不均衡的瓶颈问题。通过整合海量公开资源并引入合成数据生成策略,它为解决低资源语言对的翻译任务提供了充沛的可训练样本,促进了跨语言语义对齐与知识迁移的研究。此外,数据集附带的ParaCLEAN处理流水线——涵盖嵌入计算、语言识别、阈值过滤与去重——为语料库构建的标准化流程提供了范本,推动了数据驱动型翻译方法论的发展。其成果不仅验证了大规模多源数据融合的可行性,还揭示了合成数据对模型性能的增益效应,对多语言NLP领域的理论探索具有重要启示。
衍生相关工作
该数据集衍生出的相关工作广泛涉及多语言机器翻译系统的构建与评估。基于BSC_ParaMT_8,研究者已训练出如SalamandraTA系列等面向加泰罗尼亚语和西班牙语的高性能翻译模型,这些模型进一步被用于生成合成数据,形成数据-模型迭代优化的闭环。此外,数据集中的平行句对为跨语言预训练模型的微调提供了资源,支撑了如零样本翻译、多任务学习及语言无关表示的研究。ParaCLEAN工具链的公开也促进了社区在语料过滤与对齐算法上的改进,催生了更多关注数据质量与模型鲁棒性的学术探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务