遇见数据集

xone-repository-parallel-en-id-corpus

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

Xone Parallel English-Indonesian Corpus 是一个大规模的英-印尼平行语料库,包含超过7800万原始句子对,整合自11个翻译数据集。该数据集提供两个配置:default 子集包含经过清洗、去重的高质量平行句对,字段包括唯一索引(no)、英文文本(en)、印尼文文本(id)、数据来源(source)和领域标签(domain);drop_by_filter 子集包含被过滤的句对,并附带明确的拒绝原因(reason),如垃圾广告、编码错误、URL/代码、过短、未翻译、比例失衡或重复哈希。清洗规则包括连字符规范化、HTML实体转义、标签去除、括号平衡、去重等,保留专有名词和品牌名以增强翻译模型训练多样性。数据集适用于神经机器翻译(NMT)和大语言模型(LLM)训练任务。

Xone Parallel English-Indonesian Corpus is a large-scale English-Indonesian parallel corpus containing over 78 million raw sentence pairs, integrated from 11 translation datasets. It provides two configurations: the default subset contains cleaned, deduplicated high-quality parallel sentence pairs with fields including unique index (no), English text (en), Indonesian text (id), data source (source), and domain label (domain); the drop_by_filter subset contains filtered sentence pairs with explicit rejection reasons (reason), such as spam/ads, encoding errors, URLs/code, too short, untranslated, imbalance ratio, or duplicate hash. Cleaning rules include hyphen normalization, HTML entity escaping, tag removal, bracket balancing, deduplication, etc., preserving proper nouns and brand names to enhance translation model training diversity. The dataset is suitable for neural machine translation (NMT) and large language model (LLM) training tasks.

创建时间:
2026-08-31
原始信息汇总

Xone Parallel English-Indonesian Corpus 数据集概述

该数据集是一个大规模的英印(英语-印尼语)平行语料库,包含超过7800万个原始句子对,整合自11个翻译数据集。数据集提供经清洗的平行句对及单独的过滤子集,用于诊断透明度。

数据集配置

数据集包含两个配置子集:

配置名称 Parquet文件路径 描述
default(训练集) data/train-*.parquet 完整清洗、去重后的高质量平行句对。
drop_by_filter drop_by_filter/dropped-*.parquet 被过滤的句对,附有明确的拒绝原因。

数据结构

1. default 子集(清洗数据)

  • no(int64):全局唯一行索引。
  • en(string):清洗后的英语文本。
  • id(string):清洗后的印尼语文本。
  • source(string):数据来源,包括 opus100opus_ccmatrix_en_idparacrawlopus_opensubtitles_en_idquran_translationfloresnusax_mt_parallel 等。
  • domain(string):领域标签,包括 multisubtitleberitakeagamaanartikel wikipedia

2. drop_by_filter 子集(被拒绝数据)

  • 含有与 default 相同的字段(noenidsourcedomain)。
  • 额外包含 reason(string)字段,记录过滤原因,包括:
    • REJECTED_SPAM:检测到在线赌博或推广垃圾信息。
    • REJECTED_MOJIBAKE:损坏的UTF-8文本编码。
    • REJECTED_URL_OR_CODE:包含原始网页URL或代码片段。
    • REJECTED_TOO_SHORT:清理后文本长度短于2个字符。
    • REJECTED_UNTRANSLATED_IDENTICAL:英语与印尼语文本完全相同且句子超过3个词。
    • REJECTED_INVALID_RATIO:英印词数比例失衡(超出0.20-4.00范围)。
    • REJECTED_DUPLICATE_HASH:通过64位Blake2b哈希检测到的完全重复句对。

清洗与过滤规则

  • 连字符规范化:严格保留被字母数字字符包围的连字符(如 well-knownanak-anak),删除开头、结尾或单独的连字符。
  • 标点与括号处理:反转义HTML实体,移除HTML/字幕格式标签,通过自动化括号平衡处理器修复不平衡括号。
  • 语料丰富性保留:完整保留专有名词、品牌名、地名及括号内容,确保数据多样性适用于神经机器翻译与大型语言模型训练。
  • 去重:使用64位Blake2b哈希确保 default 训练子集中完全无误的重复句对。

使用示例

该数据集可通过Hugging Face datasets 库加载,支持默认加载、诊断数据加载以及流式模式(适用于内存受限环境)。

搜集汇总
数据集介绍
xone-repository-parallel-en-id-corpus 数据集图片
构建方式
该数据集汇聚了来自11个翻译语料库的逾7800万原始句对,通过精细化的清洗流程构建而成。清洗过程包括连字符规范化、HTML实体反转义、格式标签剥离、括号自动平衡处理,以及基于64位Blake2b哈希的精确去重,确保最终语料的纯净度与多样性。数据集被划分为两个配置:default子集包含去重后的高质量平行句对,而drop_by_filter子集则保留了被过滤的条目,并附有明确的拒绝原因,以增强诊断透明度。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该数据集。加载default配置的train分割即可获得高质量平行句对,用于机器翻译或语言模型的训练;加载drop_by_filter配置则可获取被拒绝的句对及原因,用于分析或诊断数据质量问题。对于内存受限的环境,支持流式加载模式,逐条读取数据,极大提升了数据处理的灵活性与可扩展性。
背景与挑战
背景概述
Xone Parallel English-Indonesian Corpus是2024年由CloverX-ID团队构建的大规模英印平行语料库,整合了11个翻译数据集,包含超过7800万原始句对,经严格清洗后提供高质量训练数据。该数据集旨在解决印尼语机器翻译中平行语料稀缺的问题,为神经机器翻译和大型语言模型的训练提供丰富的语料资源。其公开的过滤子集增强了数据构建的透明度和可复现性,对低资源语言机器翻译研究具有重要推动作用,尤其在语料库构建方法论上提供了新的范式。
当前挑战
该数据集面临的挑战包括:1)领域问题:英印机器翻译面临语料多样性不足、口语与正式文体混杂、专有名词处理难等难题,影响翻译模型的泛化能力;2)构建挑战:数据清洗需处理乱码(mojibake)、HTML标签、不合格括号、重复句对及极端长度比,同时保留语料丰富性,过滤规则需兼顾质量与数量平衡,确保高精度与高覆盖率并存,此外,跨数据集整合需统一格式与领域标签,确保来源可追溯性和数据可用性。
常用场景
经典使用场景
Xone Parallel English-Indonesian Corpus作为大规模英-印尼语平行语料库,汇聚了超过7800万句对的丰富资源,其经典使用场景集中于神经机器翻译(NMT)模型的训练与评估。该语料库经过严格的数据清洗与去重,确保了训练数据的洁净度与多样性,为构建高性能的英-印尼翻译系统奠定了坚实基础。研究者可借助其default配置进行端到端的序列到序列模型训练,亦可利用drop_by_filter子集进行数据过滤策略的对比分析,从而优化翻译质量与鲁棒性。
解决学术问题
该数据集有效解决了低资源语言对(如英语-印尼语)平行语料稀缺与质量参差不齐等学术难题。通过提供大规模、多领域(如新闻、宗教、维基百科)且带有来源与领域标签的洁净数据,它促进了多领域机器翻译、领域适应、数据增强等研究方向的深入探索。同时,明确的过滤规则与拒绝原因列表使研究者能够定性与定量分析噪声数据对模型性能的影响,为数据驱动的鲁棒性研究提供了重要基准。
实际应用
在实际应用中,该数据集直接服务于印尼语相关的商业翻译系统、跨语言信息检索及多语言对话代理的开发。其高质量平行句对可用于构建面向新闻、影视字幕及宗教文献的专用翻译引擎,提升内容本地化效率。此外,通过drop_by_filter子集,企业可训练垃圾信息与格式异常检测模型,强化数据管线中的质量监控,从而降低部署风险,保障用户交互体验。
数据集最近研究
最新研究方向
在神经机器翻译与大规模语言模型训练的前沿探索中,数据质量与规模之平衡始终是核心议题。Xone Parallel English-Indonesian Corpus的构建,正是对这一挑战的精准回应。该数据集汇聚逾七千八百万原始句对,横跨多源异质语料,并经由严苛的净化与过滤流程,形成兼具广度与深度的双语资源。其独特之处在于,不仅提供高品质的训练子集,还开创性地保留被剔除的样本及其拒因标签,此举为数据清洗策略的透明化与可解释性树立了新标杆。该数据集的问世,有望推动低资源语言对神经翻译模型的性能跃升,同时为研究数据偏差、噪声鲁棒性及语料质量评估提供了宝贵的实验场域,其影响深远,将惠及自然语言处理社区的诸多研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务