人工智能中文-泰文平行语料数据集
收藏数据链接:
官方服务:
资源简介:
本数据集收录中文句子及其对应的泰文译文,可面向以下具体应用场景提供中泰双语平行语料层面的基础支撑: 1)机器翻译系统构建:为中文-泰文神经机器翻译模型的训练与评测提供高质量平行句对,支撑编码器-解码器与大规模多语预训练模型在中泰方向的对齐学习,提升翻译系统对双语句法的覆盖能力; 2)跨语言检索与信息抽取:为面向泰文互联网内容的跨语言检索、关键词对齐与实体抽取提供中英(泰)对照语料,支撑跨境电商、舆情监测与本地化内容的自动分类与聚合; 3)双语教学与辅助阅读:为泰语学习者与中文母语者的双向语言学习应用提供标准对照例句,支撑例句推送、译文评测与错误诊断功能,改善双语学习效率; 4)泰文自然语言处理基础能力建设:为泰文分词、词性标注与句法分析等上游任务提供中文侧语义锚点,支撑低资源泰文方向的自然语言处理模型训练与迁移学习。
提供机构:
数据堂(北京)科技股份有限公司搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集是中文-泰文平行语料数据集,收录中文句子及其对应的泰文译文,可为中泰神经机器翻译、跨语言检索与信息抽取、双语教学及泰文自然语言处理等任务提供基础平行语料支撑。
以上内容由遇见数据集搜集并总结生成



