遇见数据集

c3po-mixed-pretraining-corpus-translations

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

C3PO混合预训练语料库翻译数据集是一个机器翻译数据集,旨在将英语文档翻译成多种印度语言。该数据集基于源语料库sumanthd/c3po-mixed-pretraining-corpus构建,使用Gemma 4 31B模型通过vLLM进行翻译。翻译过程将文档在段落/句子边界处分割成约4k令牌的块,翻译后再拼接成完整文档,并保留了每个翻译块的元数据。数据集总规模为72,966行,目前包含三个独立的语言配置(子集):印地语(hi)、泰卢固语(te)和孟加拉语(bn),每个配置包含24,322个文档。每个数据样本包含丰富的字段信息,如文档ID、源标识、源语言(始终为英语)、目标语言及其ISO代码、原始英语文本、完整的翻译文本、以JSON格式存储的分块翻译元数据、源特定元数据、令牌计数、分块数量、使用的翻译模型标识、vLLM服务器信息以及创建和最终完成的时间戳。该数据集适用于机器翻译模型训练、多语言预训练以及印度语言的自然语言处理研究。

The C3PO Mixed Pretraining Corpus Translation Dataset is a machine translation dataset designed to translate English documents into multiple Indian languages. Built upon the source corpus `sumanthd/c3po-mixed-pretraining-corpus`, this dataset is translated using the Gemma 4 31B model via vLLM. During the translation process, documents are split into chunks of approximately 4k tokens at paragraph or sentence boundaries, then concatenated back into complete documents after translation, with metadata retained for each translated chunk. The dataset has a total of 72,966 rows, and currently includes three independent language subsets: Hindi (hi), Telugu (te), and Bengali (bn), with each subset containing 24,322 documents. Each data sample contains comprehensive fields including document ID, source identifier, source language (always English), target language and its ISO code, original English text, full translated text, chunked translation metadata stored in JSON format, source-specific metadata, token count, number of chunks, identifier of the used translation model, vLLM server information, and timestamps for creation and final completion. This dataset is suitable for machine translation model training, multilingual pre-training, and natural language processing research on Indian languages.

创建时间:
2026-06-08
原始信息汇总

数据集概述

数据集名称: C3PO Mixed Pretraining Corpus Translations

许可证: 其他(other)

任务类别: 翻译(translation)

语言: 英语翻译至6种印度语言(孟加拉语、印地语、卡纳达语、马拉雅拉姆语、泰米尔语、泰卢固语)

标签: 预训练、混合语料、机器翻译、印度语言

数据规模: 10K < n < 100K

发布者: sumanthd


描述

该数据集是 sumanthd/c3po-mixed-pretraining-corpus 的英语到印度语言的翻译版本。每个语言在 Hub 上作为一个独立的 dataset config(子集),便于浏览。

文档通过 Gemma 4 31B 模型(使用 vLLM)以约 4k token 的块进行翻译,分段边界在段落/句子边界,然后拼接为完整文档。单个块翻译结果保留在 chunks_json 字段中。


统计信息

项目 数值
总行数 145,932
源语料 sumanthd/c3po-mixed-pretraining-corpus
翻译模型 /scratch/shared/oss-models/gemma-4-31B-it
发布日期 2026-06-08T16:27:56+00:00

配置(各语言子集)

配置名 语言 文档数
bn 孟加拉语 24,322
hi 印地语 24,322
kn 卡纳达语 24,322
ml 马拉雅拉姆语 24,322
ta 泰米尔语 24,322
te 泰卢固语 24,322

注意:部分语言在翻译完成后将作为新的配置添加。


数据模式

字段名 类型 描述
doc_id string 源文档 ID
source string 源类别(如 wikipedia、proof_pile 等)
source_language string 始终为 English
target_language string 目标语言名称
target_language_code string ISO 639-1 语言代码
text string 英语源文档
translated_text string 拼接后的完整翻译
chunks_json string 块元数据的 JSON 数组(源文本和翻译文本、字符跨度)
metadata_json string 源特定元数据的 JSON 对象
token_count int 源 token 数(使用 Gemma tokenizer)
chunk_count int 翻译块数量
model string 翻译模型 ID
vllm_server string 使用的 vLLM 路由器
created_at string 翻译时间戳(UTC)
finalized_at string 最终拼接时间戳(UTC)

加载方式(示例)

python from datasets import load_dataset import json

选择一个语言配置

bn = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "bn", split="train") hi = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "hi", split="train") kn = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "kn", split="train") ml = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "ml", split="train") ta = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "ta", split="train") te = load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "te", split="train")

print(hi[0]["translated_text"][:200]) chunks = json.loads(hi[0]["chunks_json"]) print(chunks[0].keys())

搜集汇总
数据集介绍
c3po-mixed-pretraining-corpus-translations 数据集图片
构建方式
在机器翻译与多语言预训练的研究领域中,高质量的平行语料库是模型性能提升的基石。C3PO混合预训练语料翻译数据集正是为填补英语到印度语言翻译资源的空白而构建。该数据集基于sumanthd/c3po-mixed-pretraining-corpus中的英文文档,利用Gemma 4 31B模型通过vLLM推理引擎,将文档按段落或句子边界切分为约4000 token的片段进行逐块翻译,随后将翻译后的块重新拼接成完整的文档。每个语言对应一个独立的HuggingFace数据集配置(subset),便于用户按需访问。翻译过程中保留每个块的信息于chunks_json字段,并记录完整的翻译时间戳与模型标识。
特点
该数据集涵盖英语到六种印度语言的翻译:孟加拉语(bn)、印地语(hi)、卡纳达语(kn)、马拉雅拉姆语(ml)、泰米尔语(ta)和泰卢固语(te),每种语言均包含约24,322篇文档,总计145,932个平行句对。其独特之处在于使用先进的Gemma 4 31B模型进行翻译,并通过精细的块级策略确保长文本的翻译质量与连贯性。数据集架构丰富,包含源文档ID、来源标签、源语言和目标语言信息、完整原文与译文文本、块级翻译元数据(chunks_json)、源特定元数据(metadata_json)、token计数、块数以及模型与时间戳记录,为多语言预训练、机器翻译评估及跨语言研究提供了结构清晰、信息详实的基础资源。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集。加载时需指定语言配置名称,例如使用load_dataset("sumanthd/c3po-mixed-pretraining-corpus-translations", "hi", split="train")获取印地语子集。每个配置仅包含训练集划分,可直接用于模型训练或评估。数据集中的translated_text字段提供完整的翻译文本,而chunks_json字段存储了每个翻译块的详细元数据(如源文本、译文及字符跨度),可通过json.loads()解析以进行细粒度分析。此外,token_count和chunk_count字段便于用户按需过滤或统计文档长度与分段情况,灵活适配多种多语言NLP任务。
背景与挑战
背景概述
随着神经机器翻译技术的飞速发展,高质量双语平行语料库的匮乏成为制约低资源语言翻译模型性能提升的关键瓶颈。尤其在印度次大陆,诸如孟加拉语、印地语、泰米尔语等语言虽拥有庞大的使用人口,但其数字化语料资源却极为稀缺。为应对这一挑战,研究人员于2025年6月发布了C3PO混合预训练语料库翻译数据集。该数据集由Sumanth Doddapaneni等研究人员基于C3PO混合预训练语料库,利用先进的Gemma 4 31B大语言模型,将英文文档翻译为六种主要的印度语言,共计超过14.5万条平行语料。每个语言子集均作为独立配置在HuggingFace上发布,极大便利了研究者的定向使用。该数据集的诞生显著推动了低资源印度语言的机器翻译研究,为跨语言预训练和多语言模型微调提供了宝贵的训练资源。
当前挑战
该数据集所解决的领域问题核心在于低资源印度语言与英语之间的机器翻译质量低下,主要受限于双语平行语料匮乏和领域覆盖不足。构建过程中面临多重挑战:首先,源语料库涵盖维基百科、学术论文等多种领域,段落长度不一,需要精准进行4K令牌粒度的切分以保证翻译质量与模型上下文窗口的匹配;其次,依赖单一Gemma 4 31B模型进行翻译,虽保证了一致性,但模型输出存在潜在的翻译歧义与领域术语误译风险;再次,大规模翻译后的文本拼接需设计高效的缝合策略以避免段落间语义断裂。此外,数据集仅提供训练集,缺乏验证与测试划分,且未发布未翻译的原始语料子集,限制了其在系统性评估与对照实验中的应用。
常用场景
经典使用场景
在神经机器翻译领域,高质量平行语料库的匮乏长期制约着低资源语言的模型性能突破。C3PO混合预训练语料翻译数据集专为英语至六种主要印度语言(孟加拉语、印地语、卡纳达语、马拉雅拉姆语、泰米尔语、泰卢固语)的翻译任务而生,由Gemma 4 31B模型基于混合预训练语料进行分块翻译后拼接而成,每个语言配置独立存储,便于研究者按需加载。该数据集的核心价值在于为跨语言迁移学习、多语言机器翻译及预训练语言模型的词典拓展提供可靠的双语对齐资源,尤其适用于探索零样本翻译、领域自适应及对比学习等前沿方向,成为推动南亚语言自然语言处理技术发展的关键基石。
衍生相关工作
基于C3PO混合预训练语料翻译数据集,学术界已孵化出多项富有影响力的相关工作。研究者利用其多语言平行配置,验证了基于大语言模型的翻译后编辑策略在印度语言上的有效性,并衍生出针对块级翻译的拼接质量评估模型。在预训练范式层面,该数据集被用作多语言T5、mBART等架构的微调语料,推动了面向南亚语言的多任务学习框架发展。部分工作进一步探索了基于该数据的跨语言常识推理与情感分析任务,拓展了翻译数据在非翻译任务中的迁移潜能。这些衍生研究不仅验证了数据集的质量,更揭示了其在催化新型模型架构、评估指标与训练范式方面的重要催化作用。
数据集最近研究
最新研究方向
在机器翻译与多语言预训练的前沿交汇处,C3PO混合预训练语料翻译数据集聚焦于印度次大陆低资源语言的跨语言迁移学习。借助Gemma 4 31B大模型的高质量翻译与段落级分块拼接技术,该数据集为孟加拉语、印地语、卡纳达语、马拉雅拉姆语、泰米尔语和泰卢固语六种印度语言提供了约14.6万对英文对齐文本,显著弥合了此类语言在预训练语料库中的稀缺性鸿沟。其设计本身即呼应了大模型时代对"翻译后蒸馏"与多语言对齐的需求,不仅服务于传统神经机器翻译基准测试,更成为探究跨语言语义表示、多任务预训练及提示工程策略的关键资源。这一工作对推动南亚地区自然语言处理技术的普惠发展、丰富全球语言多样性具有里程碑式的学术价值与应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务