中文《诗歌总集》|中文诗词数据集|数据集标准化数据集
收藏中文《诗歌总集》数据集概述
数据集目标
- 收录所有中文诗词
- 校正诗词内容
- 鉴赏、翻译、考究诗词的创作背景
- 从不同角度对诗词进行评分评级
数据格式
每一首诗词统一建模,标准化为如下的JSON格式,所有内容使用简体中文:
json { "id": "全局唯一标识,title+author+content的hash id", "title": "标题/词牌", "content": "内容", "author": "作者", "form": "文学体裁,诗、词、曲- optional", "dynasty": "创作朝代、时期 - optional", "year": "创作年代 - optional", "volume": "收录诗集或者著作名称 - optional", "introduction": "作品说明 - optional", "traditional": { "title": "繁体标题- optional", "author": "繁体作者- optional", "content": "繁体内容- optional" }, "translation": "现在简体中文翻译 - optional", "metadata": { "ai_score": "AI视角的分数- optional", "human_score": "人的视角分数- optional", "popularity": "流行度- optional", "words_count": "作品字数- optional", "sentence_count": "作品句子数- optional", "vector": "向量化" } }

中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
PQAref
PQAref数据集是一个用于生物医学领域参考问答任务的数据集,旨在微调大型语言模型。该数据集包含三个部分:指令(问题)、摘要(从PubMed检索的相关摘要,包含PubMed ID、摘要标题和内容)和答案(预期答案,包含PubMed ID形式的参考)。数据集通过半自动方式创建,利用了PubMedQA数据集中的问题。
huggingface 收录
UAVDT
UAVDT是一个用于目标检测任务的数据集。
github 收录
THUCNews
THUCNews是根据新浪新闻RSS订阅频道2005~2011年间的历史数据筛选过滤生成,包含74万篇新闻文档(2.19 GB),均为UTF-8纯文本格式。本次比赛数据集在原始新浪新闻分类体系的基础上,重新整合划分出14个候选分类类别:财经、彩票、房产、股票、家居、教育、科技、社会、时尚、时政、体育、星座、游戏、娱乐。提供训练数据共832471条。
github 收录
Figshare
Figshare是一个在线数据共享平台,允许研究人员上传和共享各种类型的研究成果,包括数据集、论文、图像、视频等。它旨在促进科学研究的开放性和可重复性。
figshare.com 收录