遇见数据集

LocalDoc/en-az-opus-filtered-parallel-corpus

收藏
Hugging Face2026-06-26 更新2026-07-22 收录
官方服务:

资源简介:

这是一个经过过滤的英语-阿塞拜疆语平行语料库,名为Filtered EN-AZ OPUS Parallel Corpus。数据集从OPUS语料库中收集英语-阿塞拜疆语平行句子,并通过两阶段质量估计流程进行过滤。过滤流程包括:首先使用LaBSE跨语言余弦相似度保留对齐良好的句子对,然后对剩余句子对使用COMET-Kiwi(基于Unbabel/wmt22-cometkiwi-da模型)进行无参考质量估计,最后进行精确去重。本发布版本的有效最小阈值为:LaBSE ≥ 0.900,COMET-Kiwi ≥ 0.900。数据集包含983,849对句子,特征列包括:en_text(英语源句子)、az_text(阿塞拜疆语目标句子)、source(来源OPUS子语料库)、labse(LaBSE余弦相似度得分)、cometkiwi(COMET-Kiwi质量估计得分)。数据主要来源于NLLB(849,380对)、ParaCrawl-Bonus(128,575对)等多个OPUS子语料库。数据集适用于机器翻译任务,支持英语和阿塞拜疆语。

English–Azerbaijani parallel sentences pooled from OPUS corpora and filtered with a two-stage quality-estimation pipeline. The pipeline involves LaBSE cross-lingual cosine similarity to keep well-aligned pairs, followed by COMET-Kiwi (Unbabel/wmt22-cometkiwi-da) reference-free quality estimation on the survivors, and exact-pair deduplication. Effective minimums in this release: LaBSE ≥ 0.900, COMET-Kiwi ≥ 0.900. The dataset contains 983,849 sentence pairs with columns: en_text (English source sentence), az_text (Azerbaijani target sentence), source (originating OPUS sub-corpus), labse (LaBSE cosine similarity score), cometkiwi (COMET-Kiwi QE score). Major sources include NLLB (849,380 pairs), ParaCrawl-Bonus (128,575 pairs), and others from OPUS. It is designed for machine translation tasks in English and Azerbaijani.

提供机构:
LocalDoc
搜集汇总
数据集介绍
LocalDoc/en-az-opus-filtered-parallel-corpus 数据集图片
构建方式
该数据集源自OPUS多语平行语料库,针对英语-阿塞拜疆语对构建,通过两阶段质量评估流程筛选而成。首先,采用LaBSE跨语言余弦相似度衡量句子对齐质量,保留高度对齐的语料对;随后,利用COMET-Kiwi(Unbabel/wmt22-cometkiwi-da)无参考质量评估模型对幸存句子进行二次过滤。与此同时,执行精确重复对去重操作,确保数据唯一性。有效最低阈值设定为LaBSE ≥ 0.900且COMET-Kiwi ≥ 0.900,从而保证语料质量。
特点
该语料库共包含983,849条平行句对,覆盖多个OPUS子语料库来源,其中NLLB贡献849,380对,占绝大多数,其余来自ParaCrawl-Bonus、CCMatrix、Tatoeba等。每条记录包含英文句子、阿塞拜疆语句子、来源子语料库名称、LaBSE余弦相似度分数以及COMET-Kiwi质量评估分数,为研究者提供了充足的质量过滤依据。数据规模介于10万至100万之间,属于中等规模翻译资源。
使用方法
该数据集可直接用于机器翻译模型训练与评估,尤适用于英语至阿塞拜疆语的神经翻译任务。用户可通过HuggingFace datasets库加载,指定配置名称'default'并读取'train'分片即可获取全部数据。在使用时,可依据'labse'与'cometkiwi'分数进一步筛选高质量子集,或结合'源'字段分析不同子语料库的数据分布。数据以标准字典格式提供,其中'en_text'为源语言文本,'az_text'为目标语言文本,便于集成进入常见的翻译训练流程。
背景与挑战
背景概述
在神经机器翻译领域,低资源语言对的平行语料库稀缺是制约翻译质量提升的关键瓶颈。阿塞拜疆语(Azerbaijani)作为突厥语系的一种低资源语言,其与英语之间的高质量平行语料尤为匮乏。为此,研究者从OPUS多源语料库中提取英语-阿塞拜疆语平行句对,构建了经过双重质量评估过滤的并行语料库。该数据集于近期发布,主要依托LaBSE跨语言余弦相似度和COMET-Kiwi无参考质量评估两阶段流水线,对来自NLLB、ParaCrawl-Bonus、CCMatrix等九个子语料库的句对进行筛选与去重,最终保留983,849条高质量句对。这一工作显著提升了英-阿平行语料的质量与规模,为低资源机器翻译模型训练提供了可靠数据基础,对推动阿塞拜疆语自然语言处理研究具有重要价值。
当前挑战
该数据集主要应对两大挑战。领域问题方面,低资源语言对的平行语料普遍存在质量参差不齐、噪声严重的问题,直接使用原始OPUS语料训练翻译模型可能导致生成结果的忠实度与流畅度不足,需要高效的质量评估机制以剔除误对齐或低质量句对。构建过程方面,面对来自九个异质子语料库的海量数据,需设计兼顾准确性与计算效率的过滤方案:LaBSE虽能捕捉跨语言语义相似性但阈值设定需平衡召回与精确,COMET-Kiwi作为无参考评估模型需在无人工标注条件下保持稳定的判别能力,同时需解决子语料分布不均(如NLLB贡献86%数据)带来的潜在偏差,并实现精确去重以避免冗余样本对模型泛化能力的负面影响。
常用场景
经典使用场景
在神经机器翻译领域,该数据集作为英-阿塞拜疆语平行语料库,是训练和评估翻译模型的标准基准。其经过LaBSE跨语言余弦相似度与COMET-Kiwi无参考质量评估两阶段严格筛选,确保了句对的对齐质量与语义保真度,常被用于构建低资源语言对的翻译系统。研究者可依此开展受限语料条件下的翻译模型微调、多任务学习或跨语言迁移研究。
解决学术问题
该数据集有效缓解了阿塞拜疆语等高资源稀缺语言在机器翻译研究中的平行语料匮乏问题。通过引入双阶段质量过滤管线,解决了传统语料库中噪声对齐与语义偏差对翻译性能的干扰,为低资源神经翻译模型的鲁棒性提升提供了可靠数据支撑。其发布的意义在于填补了英-阿塞拜疆语对高质量训练数据的空白,推动了图尔克语系自然语言处理技术的学术探索。
衍生相关工作
该数据集催生了一系列经典工作,包括基于LaBSE与COMET-Kiwi联合过滤的跨语言对齐方法研究,以及针对低资源语言的无监督预训练翻译模型改进。后续研究者还以此为基础,探索了对比学习与知识蒸馏技术在小规模平行语料上的表现,并衍生出多语种质量评估框架的泛化性验证工作,为OPUS语料生态的标准化贡献了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务