平行语料数据
收藏官方服务:
资源简介:
用于训练机器翻译、跨语言语义建模、跨语言信息处理、多语言对话等算法,重点提升翻译质量、跨语言语义对齐、跨语言迁移、跨语言信息抽取等能力,广泛应用于跨境贸易、跨国政务、多语言内容创作、小语种文化传播等领域。
提供机构:
数据堂(北京)科技股份有限公司创建时间:
2025-12-30
搜集汇总
数据集介绍

背景与挑战
背景概述
该平行语料数据集包含中葡、中越、中日等多种语种的1亿组对齐数据,覆盖旅游、医药、日常、新闻等领域,总存储量为300GB。主要用于训练机器翻译、跨语言语义建模和多语言对话等算法,以提升翻译质量和跨语言信息处理能力,广泛应用于跨境贸易、政务及多语言内容创作等场景。
以上内容由遇见数据集搜集并总结生成



