登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
藏汉多领域文本句对数据集
藏汉多领域文本句对数据集
收藏
国家基础学科公共科学数据中心
2026-08-10 收录
数据链接:
https://nbsdc.cn/general/dataDetail?id=6a76010ef175603b25c4483d&type=1
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
藏汉多领域文本句对数据集包含文本句对约1000万行,包含古籍、极乐原文、新闻、社交媒体、藏医药等领域。
应用场景:
提供机构:
西藏大学
相关数据集
TLUE (A Tibetan Language Understanding Evaluation Benchmark)
多语言处理
自然语言处理评估
TLUE是一个针对藏语言理解的大型评估基准,由西藏大学等机构开发。该数据集包含两部分:Ti-MMLU,涵盖67个子领域的多任务理解基准;Ti-SafetyBench,涵盖7个子领域的安全评估基准。数据集总共有22,963个评估问题,旨在推动藏语言模型的研发和评估,特别是在低资源语言环境中。
arXiv
2025-03-15 更新
112
0
藏文文献典藏(古籍文献)手写体图像测试集
该测试集主要面向藏文文献典藏(古籍文献)的多风格字体文字识别研究与识别准确率评测需求建设,用于评估标准印刷品藏文识别综合准确率质量指标。数据基于藏文古籍木刻雕版及其早期精印本的高清扫描图像产生,字体类型为乌金体(有冠体,字形规整,常用于佛经、官方文告)。为反映历史文献在真实环境中的分布特征,样本涵盖因长期保存不当出现的黄化、污渍及墨迹晕染等自然退化情况,并进一步使用OpenCV系统性引入高斯、椒盐
国家基础学科公共科学数据中心
1
0
多方言语音翻译数据
本数据集面向图文多模态藏汉机器翻译研究建设,契合解决纯文本藏汉翻译歧义问题的需求。背景为藏汉机器翻译领域现有资源多为百科、新闻等纯文本平行语料,缺乏公开图文多模态藏汉平行语料库。其意义在于通过文本与对应图像结合,帮助模型建立语言与视觉关联,提供语境信息以减少歧义,提升翻译准确性与场景适配度。产生方法上,依据藏文句子是否含歧义,划分“有歧义”与“无歧义”两类文本-图像对构建数据集。主要内容为图文藏汉
国家基础学科公共科学数据中心
1
0
领域词汇语音/文本数据
本数据集为多领域融合的语音文本语料数据,数据格式包含WAV、MP3音频文件及TXT文本标注文件,音频与文本内容一一对应、标注规范准确。数据覆盖金融、法律、日常、地理、医疗、教育等主流领域专业词汇及常用语句,同时收录各类新兴词汇、网络新词及行业新术语。
国家基础学科公共科学数据中心
2
0
藏汉混合语音识别测试数据集
该数据集为藏汉混合语音语料库,核心包含藏语三大方言(安多方言、康巴方言、卫藏方言)与汉语普通话混合后的语音-文本对数据,其中藏语每类方言与汉语普通话混合各200条,共600条,整体提供3个藏语方言参考文本文件和 3 个专属音频文件夹,属于结构化语音-文本对齐混合语料,可用于藏汉双语语音识别、跨语言语音转换等相关研究与工程开发。
国家基础学科公共科学数据中心
1
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广