多方言语音翻译数据
收藏国家基础学科公共科学数据中心2026-08-10 收录
官方服务:
资源简介:
本数据集面向图文多模态藏汉机器翻译研究建设,契合解决纯文本藏汉翻译歧义问题的需求。背景为藏汉机器翻译领域现有资源多为百科、新闻等纯文本平行语料,缺乏公开图文多模态藏汉平行语料库。其意义在于通过文本与对应图像结合,帮助模型建立语言与视觉关联,提供语境信息以减少歧义,提升翻译准确性与场景适配度。产生方法上,依据藏文句子是否含歧义,划分“有歧义”与“无歧义”两类文本-图像对构建数据集。主要内容为图文藏汉平行文本-图像对,体量共计15,300条,含300条有歧义、15,000条无歧义数据,按8:1:1比例随机划分为训练集、验证集和测试集,支撑多模态翻译模型训练与评估。
提供机构:
西藏大学


