遇见数据集

人工智能中文-哈萨克文平行语料文本数据集

收藏
北京市数据知识产权2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

本数据集面向中文与哈萨克文(西里尔文)平行语料的采集与标注场景,适用于跨语言机器翻译、双语对齐与跨语言理解技术的研发与应用。该数据可用于中哈双向神经机器翻译模型的训练、评测及优化,提升翻译系统对哈萨克文这一哈萨克斯坦主要官方语言的翻译质量与鲁棒性;可用于跨语言信息检索、双语词典构建与语言学研究,支撑面向中哈跨境交流、多语种智能翻译等产品的算法验证与效果调优。数据集由成对的中文文本与对应的哈萨克文译文组成,内容覆盖科技、医疗、旅游、新闻及口语等多个领域,配套编号标识与双语对齐标注,可为相关人工智能模型提供高质量的中哈平行训练与评测语料。

搜集汇总
数据集介绍
人工智能中文-哈萨克文平行语料文本数据集 数据集图片
背景与挑战
背景概述
该数据集由成对的中文文本与哈萨克文(西里尔文)译文组成,覆盖科技、医疗、旅游、新闻及口语等多个领域,并配有编号标识与双语对齐标注。它主要面向中文与哈萨克文平行语料的采集与标注场景,可用于中哈双向神经机器翻译模型的训练、评测及优化,同时支持跨语言信息检索、双语词典构建与语言学研究等应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务