遇见数据集

多方言语音翻译数据

收藏
官方服务:

资源简介:

本数据集面向图文多模态藏汉机器翻译研究建设,契合解决纯文本藏汉翻译歧义问题的需求。背景为藏汉机器翻译领域现有资源多为百科、新闻等纯文本平行语料,缺乏公开图文多模态藏汉平行语料库。其意义在于通过文本与对应图像结合,帮助模型建立语言与视觉关联,提供语境信息以减少歧义,提升翻译准确性与场景适配度。产生方法上,依据藏文句子是否含歧义,划分“有歧义”与“无歧义”两类文本-图像对构建数据集。主要内容为图文藏汉平行文本-图像对,体量共计15,300条,含300条有歧义、15,000条无歧义数据,按8:1:1比例随机划分为训练集、验证集和测试集,支撑多模态翻译模型训练与评估。

提供机构:
西藏大学
二维码
社区交流群
二维码
科研交流群
商业服务