遇见数据集

平行语料数据

收藏
杭州数据交易所2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

用于训练机器翻译、跨语言语义建模、跨语言信息处理、多语言对话等算法,重点提升翻译质量、跨语言语义对齐、跨语言迁移、跨语言信息抽取等能力,广泛应用于跨境贸易、跨国政务、多语言内容创作、小语种文化传播等领域。

创建时间:
2025-12-30
搜集汇总
数据集介绍
平行语料数据 数据集图片
背景与挑战
背景概述
该平行语料数据集包含中葡、中越、中日等多种语种的1亿组对齐数据,覆盖旅游、医药、日常、新闻等领域,总存储量为300GB。主要用于训练机器翻译、跨语言语义建模和多语言对话等算法,以提升翻译质量和跨语言信息处理能力,广泛应用于跨境贸易、政务及多语言内容创作等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务