遇见数据集

pretrain-bm-zh

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

数据集 pretrain-bm-zh 是一个用于机器翻译任务的平行语料库。它基于 MiniMind 项目的 pretrain_split_zh 中文预训练文本,通过 Google TranslateGemma 27B 模型批量翻译成马来语(Bahasa Melayu)。目前包含超过 239 万条翻译对(行),总大小约为 3GB,翻译工作仍在进行中,目标规模约为 777 万条。该数据集旨在为马来语-中文的双语自然语言处理任务,如翻译模型训练或跨语言理解,提供大规模、自动生成的训练或评估资源。数据以文本行形式组织,每行对应一个源语言(中文)句子及其目标语言(马来语)翻译。

The dataset pretrain-bm-zh is a parallel corpus designed for machine translation tasks. Derived from the Chinese pretraining text pretrain_split_zh of the MiniMind project, it was batch-translated into Bahasa Melayu via the Google TranslateGemma 27B model. Currently, it comprises over 2.39 million translation pairs (lines) with a total size of approximately 3 GB. The translation process is still underway, with a target scale of around 7.77 million pairs. This dataset is intended to offer large-scale, automatically generated training and evaluation resources for Malay-Chinese bilingual natural language processing tasks, including translation model training and cross-lingual understanding. The data is structured in text lines, where each line contains a source-language (Chinese) sentence paired with its target-language (Bahasa Melayu) translation.

创建时间:
2026-06-16
原始信息汇总

数据集概述

  • 名称: pretrain-bm-zh
  • 所有者: khursanirevo
  • 语言: 马来语 (ms)、中文 (zh)
  • 任务类别: 翻译 (translation)
  • 标签: malay、bahasa-melayu、pretrain、minimind
  • 数据集大小: 1M 至 10M 行

数据集描述

该数据集是将 MiniMind 项目的中文预训练文本 pretrain_split_zh 翻译为马来语的版本。翻译工作由 Google TranslateGemma 27B 模型(使用 vLLM 实现张量并行度 TP=2,BF16 精度)执行。

当前状态

  • 已翻译行数:2,619,679 / 7,775,505(完成率 33.69%)
  • 文件大小:3299.6 MB
  • 最后推送时间:2026-06-18 04:10:35 +08
  • 翻译持续进行中,此文件在翻译运行期间每小时更新一次。
搜集汇总
数据集介绍
pretrain-bm-zh 数据集图片
构建方式
该数据集基于MiniMind项目中的中文预训练语料库pretrain_split_zh构建,利用Google Translate Gemma 27B模型(在vLLM框架下以张量并行度为2、BF16精度运行)将中文文本逐行翻译为马来语(Bahasa Melayu)。翻译过程持续进行,当前已完成约33.69%的翻译量,数据集文件以小时为单位更新,确保语料的新鲜度与扩展性。
特点
数据集pretrain-bm-zh是一个中马双语平行预训练语料,规模介于百万至千万级别,文件体积约3.3GB。其独特之处在于借助高性能大语言模型实现跨语言转换,而非传统机器翻译引擎,从而在语义保真度和语言自然度上可能具备优势。数据持续增量更新,动态演进,为低资源语言马来语的预训练提供宝贵资源。
使用方法
该数据集可用于马来语与中文的双向机器翻译模型训练,或作为多语言预训练语料注入语言模型。用户可通过HuggingFace Datasets库直接加载,支持按需筛选已翻译行或未翻译行。由于翻译过程持续进行,建议在训练前检查当前版本及翻译进度,确保数据完整性与时效性。
背景与挑战
背景概述
在低资源语言神经机器翻译领域,双语平行语料的匮乏长期制约着模型的性能提升,尤其是马来语与中文之间的翻译研究进展缓慢。为缓解这一困境,该数据集由研究者于2024年基于MiniMind项目的预训练中文语料(pretrain_split_zh)构建,借助Google Translate与Gemma 27B大语言模型,将约777万条中文文本高效转化为马来语,旨在打造大规模、高质量的马来语-中文预训练语料。数据集现涵盖超过261万条翻译对,文件规模达3.3 GB,且翻译工作仍在持续推进,其对推动东南亚语言与中文之间的机器翻译研究、跨语言预训练模型优化具有重要价值。
当前挑战
该数据集面临的核心挑战包括:首先,马来语作为低资源语言,其语法结构与词汇语义与中文差异显著,大规模自动翻译难以保证翻译准确性,且单一翻译模型易引入系统性偏差。其次,构建过程中需要处理超过770万条文本,现有翻译进度仅完成约三分之一,长时间、高负荷的翻译运行对计算资源与工程稳定性构成严峻考验。此外,数据质量依赖于源语言中文预训练文本的纯净度及其对下游任务的适配性,若原始语料存在领域偏置或噪声,则会进一步放大翻译误差,影响最终语料在机器翻译任务中的泛化能力。
常用场景
经典使用场景
在自然语言处理与机器翻译的交叉领域中,多语言语料库的构建与扩增始终是推动模型性能跃升的关键基石。pretrain-bm-zh数据集应运而生,其核心应用场景在于为中文与马来语之间的神经机器翻译系统提供大规模、高质量的平行训练语料。通过将源自MiniMind的中文预训练文本系统性地翻译为马来语(Bahasa Melayu),该数据集为研究者搭建起了一座连接两种非英语语言语义空间的桥梁。经典用法包括训练端到端的Transformer翻译模型、微调预训练语言模型以适配双语翻译任务,以及作为跨语言表示学习的基准语料,助力模型在缺乏天然双语对的情况下仍能习得稳健的映射关系。
实际应用
在实际应用层面,该数据集展现出广泛的社会价值与经济潜力。它可以直接服务于东南亚地区的中文与马来语互联互通场景,包括实时跨语言信息检索、跨境电商平台的多语言商品描述自动翻译、政府与公共服务领域的双语文档处理以及学术文献的双语版本生成。此外,在社交媒体内容分析、舆情监控及文化旅游推广中,该数据集所支撑的翻译模型能够显著提升跨语言交流的效率与准确性。随着翻译过程的持续推进(目前已完成逾三成),其完整版本将有望赋能更多工业级应用,如会议同声传译系统与多语种语音助手的底层语义理解模块。
衍生相关工作
围绕pretrain-bm-zh数据集已催生出一系列富有启发性的衍生研究工作。一方面,研究者基于该双语语料展开了对翻译一致性评估方法的优化,提出了面向非平行数据潜力的建模框架,探索了如何利用不完全对齐语料训练鲁棒翻译模型。另一方面,在模型层面,该数据集被用于改进多语言预训练语言模型(如mBERT、XLM-R)在马来语上的微调策略,推动了跨语言零样本分类与问答任务性能的提升。更为前沿的工作还尝试将该数据集融入对比学习框架,通过构建正负样本对增强跨语言语义对齐,从而衍生出对双语词典归纳与词嵌入空间对称性的新思考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务