遇见数据集

KietReal/Vietnamese-English-translation

收藏
Hugging Face2026-05-17 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个越南语-英语平行语料库,通过结合多个高质量的机器翻译数据集和合成数据源构建而成。数据集设计用于机器翻译(MT)、大语言模型(LLM)训练、序列到序列学习以及越南语↔英语翻译系统的评估。数据来源包括PhoMT(来自新闻和平行文本资源的大规模越南语-英语翻译数据集)、MTet(专注于对话和通用领域翻译任务的数据集)以及由GPT-5.5 Pro生成的合成数据(约10,000个样本,以增加语言多样性、对话覆盖范围、释义变体和低频模式)。每个样本包含越南语句子、英语句子和数据来源标识。数据集经过清洗和预处理,包括去除畸形标点、空白标准化、去重、过滤空行以及对话符号和特殊字符的规范化。数据集分为训练集、验证集和测试集,并进行了随机打乱。适用于神经机器翻译、基于Transformer的模型、编码器-解码器架构、LLM微调和越南语NLP研究。

dataset_info: 特征: - 名称:English,数据类型:字符串 - 名称:Vietnamese,数据类型:字符串 - 名称:From,数据类型:字符串 划分集: - 名称:train,字节数:1557376339.6765032,样本数:6355063 - 名称:validation,字节数:18379554.298004244,样本数:75000 - 名称:test,字节数:6126518.0993347475,样本数:25000 下载大小:1119555973,数据集总大小:1581882412.073842 配置: - 配置名称:default,数据文件: - 划分集train对应路径data/train-* - 划分集validation对应路径data/validation-* - 划分集test对应路径data/test-* 许可证:MIT 任务类别:翻译 语言:越南语(vi)、英语(en) 样本规模:1M<n<10M # 越南语-英语翻译数据集 ## 概述 本数据集为越南语-英语平行语料库,整合了多个高质量机器翻译(Machine Translation, MT)数据集与合成数据源。 本数据集适用于: * 机器翻译(Machine Translation, MT) * 大语言模型(Large Language Model, LLM)训练 * 序列到序列学习 * 越南语↔英语翻译系统的评估 ## 数据源 本数据集整合了以下来源: ### 1. PhoMT 一款基于新闻与平行文本资源构建的大规模越南语-英语翻译数据集。 来源:Vin/PhoMT ### 2. MTet 聚焦于对话与通用领域翻译任务的越南语-英语翻译数据集。 ### 3. GPT-5.5 Pro 生成的合成数据(约10,000条样本) 通过GPT-5.5 Pro生成的额外平行合成数据,用于提升: * 语言多样性 * 对话覆盖范围 * 释义多样性 * 低频语言模式占比 合成数据在合并前已经过人工清洗与归一化处理。 ## 数据集结构 每条样本格式如下: python { "Vietnamese": "...", "English": "...", "From": "PhoMT | MTet | GPT-5.5pro" } ## 统计数据集 ### 训练集 📊 --- 越南语语句长度统计 --- - 平均长度:24.7词 - 最大长度:1827词 - 90%的语句长度小于:49词 - 95%的语句长度小于:68词 - 99%的语句长度小于:138词 📊 --- 英语语句长度统计 --- - 平均长度:19.0词 - 最大长度:1345词 - 90%的语句长度小于:37词 - 95%的语句长度小于:52词 - 99%的语句长度小于:105词 ### 验证集 📊 --- 越南语语句长度统计 --- - 平均长度:24.9词 - 最大长度:679词 - 90%的语句长度小于:50词 - 95%的语句长度小于:69词 - 99%的语句长度小于:141词 📊 --- 英语语句长度统计 --- - 平均长度:19.1词 - 最大长度:529词 - 90%的语句长度小于:38词 - 95%的语句长度小于:52词 - 99%的语句长度小于:107词 ### 测试集 📊 --- 越南语语句长度统计 --- - 平均长度:24.5词 - 最大长度:479词 - 90%的语句长度小于:49词 - 95%的语句长度小于:67词 - 99%的语句长度小于:133词 📊 --- 英语语句长度统计 --- - 平均长度:18.7词 - 最大长度:388词 - 90%的语句长度小于:37词 - 95%的语句长度小于:51词 - 99%的语句长度小于:100词 ### 列说明 | 列名 | 说明 | | :--------- | :----------------------- | | Vietnamese | 越南语语句 | | English | 英语语句 | | From | 样本的原始来源 | ## 预处理 本数据集通过以下步骤进行清洗: * 移除格式错误的标点符号 * 空白字符归一化 * 移除重复样本 * 过滤空行 * 对话符号与特殊字符归一化 示例: * 移除重复连字符 * 归一化多个连续空格 * 保留合法的复合词,如`eco-friendly` ## 划分方式 本数据集划分为训练集、验证集与测试集,划分前已进行随机打乱操作。 ## 预期用途 本数据集适用于: * 神经机器翻译 * Transformer 模型 * 编码器-解码器架构 * 大语言模型(Large Language Model, LLM)微调 * 越南语自然语言处理研究 ## 局限性 * 合成数据可能包含少量翻译伪影 * 根据数据源分布,部分领域可能存在样本占比过高的情况 * 自动清洗流程在极少数情况下可能无法完美归一化标点符号 ## 许可证 请遵循各原始数据集的许可证要求: * PhoMT * MTet 通过GPT-5.5 Pro生成的合成数据需遵循OpenAI使用政策。 ## 引用 若使用本数据集,请引用以下来源: * PhoMT * MTet * 本数据集仓库 ## 作者 创建者: * KietReal ## 📬 联系方式 * 如有任何疑问,可通过我的LinkedIn联系我。 * 若有问题或改进建议,欢迎提交Issue或贡献代码。

提供机构:
KietReal
二维码
社区交流群
二维码
科研交流群
商业服务