藏文文献全文数据库|藏文文献数据集|文字识别数据集

国家基础学科公共科学数据中心2024-03-05 收录

藏文文献

文字识别

下载链接：

https://www.nbsdc.cn/general/dataDetail?id=64f0826abb16e06dfdc78c6f&type=1

下载链接

链接失效反馈

资源简介：

藏文文献全文数据库是藏文文献全文数据库是采用藏文文字识别技术对藏文文献进行数字化，形成可查阅可复制的全文数据库。具体包含文献的元数据（名称、出版时间、出版机构、类型等信息）和文献全文内容。其中文献本身是对现有已出版的文献进行扫描和收集，项目不享有版权，项目使用项目研究成果对文献进行了加工处理。

用户留言

有没有相关的论文或文献参考？

这个数据集是基于什么背景创建的？

数据集的作者是谁？

能帮我联系到这个数据集的作者吗？

这个数据集如何下载？

点击留言

数据主题

具身智能

数据集 4098个

机构 8个

大模型

数据集 439个

机构 10个

无人机

数据集 37个

机构 6个

指令微调

数据集 36个

机构 6个

蛋白质结构

数据集 50个

机构 8个

空间智能

数据集 21个

机构 5个

5,000+

优质数据集

54 个

任务类型

进入经典数据集

热门数据集

中国区域教育数据库

该数据集包含了中国各区域的教育统计数据，涵盖了学校数量、学生人数、教师资源、教育经费等多个方面的信息。

www.moe.gov.cn 收录

THUCNews

THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成，包含74万篇新闻文档（2.19 GB），均为UTF-8纯文本格式。本次比赛数据集在原始新浪新闻分类体系的基础上，重新整合划分出14个候选分类类别：财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。提供训练数据共832471条。

github 收录

Figshare

Figshare是一个在线数据共享平台，允许研究人员上传和共享各种类型的研究成果，包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。

figshare.com 收录

Traditional-Chinese-Medicine-Dataset-SFT

该数据集是一个高质量的中医数据集，主要由非网络来源的内部数据构成，包含约1GB的中医各个领域临床案例、名家典籍、医学百科、名词解释等优质内容。数据集99%为简体中文内容，质量优异，信息密度可观。数据集适用于预训练或继续预训练用途，未来将继续发布针对SFT/IFT的多轮对话和问答数据集。数据集可以独立使用，但建议先使用配套的预训练数据集对模型进行继续预训练后，再使用该数据集进行进一步的指令微调。数据集还包含一定比例的中文常识、中文多轮对话数据以及古文/文言文<->现代文翻译数据，以避免灾难性遗忘并加强模型表现。

huggingface 收录

Eurovision Song Contest Dataset

Eurovision Song Contest数据集是一个免费提供的数据集，包含1735首参赛歌曲的音频特征、元数据、比赛排名和投票数据，这些歌曲参与了从1956年到2023年的Eurovision Song Contest。

github 收录