xone-repository-parallel-en-id-corpus
收藏资源简介:
Xone Parallel English-Indonesian Corpus 是一个大规模的英-印尼平行语料库,包含超过7800万原始句子对,整合自11个翻译数据集。该数据集提供两个配置:default 子集包含经过清洗、去重的高质量平行句对,字段包括唯一索引(no)、英文文本(en)、印尼文文本(id)、数据来源(source)和领域标签(domain);drop_by_filter 子集包含被过滤的句对,并附带明确的拒绝原因(reason),如垃圾广告、编码错误、URL/代码、过短、未翻译、比例失衡或重复哈希。清洗规则包括连字符规范化、HTML实体转义、标签去除、括号平衡、去重等,保留专有名词和品牌名以增强翻译模型训练多样性。数据集适用于神经机器翻译(NMT)和大语言模型(LLM)训练任务。
Xone Parallel English-Indonesian Corpus is a large-scale English-Indonesian parallel corpus containing over 78 million raw sentence pairs, integrated from 11 translation datasets. It provides two configurations: the default subset contains cleaned, deduplicated high-quality parallel sentence pairs with fields including unique index (no), English text (en), Indonesian text (id), data source (source), and domain label (domain); the drop_by_filter subset contains filtered sentence pairs with explicit rejection reasons (reason), such as spam/ads, encoding errors, URLs/code, too short, untranslated, imbalance ratio, or duplicate hash. Cleaning rules include hyphen normalization, HTML entity escaping, tag removal, bracket balancing, deduplication, etc., preserving proper nouns and brand names to enhance translation model training diversity. The dataset is suitable for neural machine translation (NMT) and large language model (LLM) training tasks.
Xone Parallel English-Indonesian Corpus 数据集概述
该数据集是一个大规模的英印(英语-印尼语)平行语料库,包含超过7800万个原始句子对,整合自11个翻译数据集。数据集提供经清洗的平行句对及单独的过滤子集,用于诊断透明度。
数据集配置
数据集包含两个配置子集:
| 配置名称 | Parquet文件路径 | 描述 |
|---|---|---|
| default(训练集) | data/train-*.parquet |
完整清洗、去重后的高质量平行句对。 |
| drop_by_filter | drop_by_filter/dropped-*.parquet |
被过滤的句对,附有明确的拒绝原因。 |
数据结构
1. default 子集(清洗数据)
- no(int64):全局唯一行索引。
- en(string):清洗后的英语文本。
- id(string):清洗后的印尼语文本。
- source(string):数据来源,包括
opus100、opus_ccmatrix_en_id、paracrawl、opus_opensubtitles_en_id、quran_translation、flores、nusax_mt_parallel等。 - domain(string):领域标签,包括
multi、subtitle、berita、keagamaan、artikel wikipedia。
2. drop_by_filter 子集(被拒绝数据)
- 含有与
default相同的字段(no、en、id、source、domain)。 - 额外包含 reason(string)字段,记录过滤原因,包括:
REJECTED_SPAM:检测到在线赌博或推广垃圾信息。REJECTED_MOJIBAKE:损坏的UTF-8文本编码。REJECTED_URL_OR_CODE:包含原始网页URL或代码片段。REJECTED_TOO_SHORT:清理后文本长度短于2个字符。REJECTED_UNTRANSLATED_IDENTICAL:英语与印尼语文本完全相同且句子超过3个词。REJECTED_INVALID_RATIO:英印词数比例失衡(超出0.20-4.00范围)。REJECTED_DUPLICATE_HASH:通过64位Blake2b哈希检测到的完全重复句对。
清洗与过滤规则
- 连字符规范化:严格保留被字母数字字符包围的连字符(如
well-known、anak-anak),删除开头、结尾或单独的连字符。 - 标点与括号处理:反转义HTML实体,移除HTML/字幕格式标签,通过自动化括号平衡处理器修复不平衡括号。
- 语料丰富性保留:完整保留专有名词、品牌名、地名及括号内容,确保数据多样性适用于神经机器翻译与大型语言模型训练。
- 去重:使用64位Blake2b哈希确保
default训练子集中完全无误的重复句对。
使用示例
该数据集可通过Hugging Face datasets 库加载,支持默认加载、诊断数据加载以及流式模式(适用于内存受限环境)。




