遇见数据集

多领域文本藏汉机器翻译数据

收藏
官方服务:

资源简介:

多领域藏汉文本机器翻译数据主要面向低资源条件下藏汉机器翻译研究及教育、媒体、医疗、政务等场景的应用需求建设,服务于解决藏汉翻译中领域语料稀缺、分布不均和术语差异明显等问题。该数据依托“领域数据不平衡条件下的多模态藏汉机器翻译关键技术研究”课题形成,主要通过公开新闻与政务信息筛选、教育类文本人工翻译、授权医疗双语资料抽取,以及句级对齐、术语统一和人工复核等流程构建。数据内容为藏汉、汉藏双向平行文本测试样本,覆盖政务、教育、媒体、医疗四个领域,总量4000条,可用于多领域机器翻译系统测试、第三方评测和跨领域性能分析。

提供机构:
西藏大学
二维码
社区交流群
二维码
科研交流群
商业服务