YAGO|知识图谱数据集|数据整合数据集
收藏
- YAGO首次发表,由德国马克斯·普朗克研究所的研究团队开发,旨在整合维基百科和WordNet的知识,构建一个大规模的语义知识库。
- YAGO 1.0版本发布,包含超过100万个实体和500万个事实,标志着该数据集在知识图谱领域的初步应用。
- YAGO 2.0版本发布,数据集规模扩展至超过1000万个实体和1.2亿个事实,显著提升了其在语义搜索和问答系统中的应用价值。
- YAGO 3.0版本发布,引入了时间信息和地理信息,使得数据集在时态推理和地理信息系统中的应用更加广泛。
- YAGO 4.0版本发布,进一步优化了数据质量和规模,支持更多的实体类型和关系,增强了其在人工智能和大数据分析中的应用潜力。
- 1YAGO: A Core of Semantic KnowledgeMax Planck Institute for Informatics · 2007年
- 2YAGO: A Large Ontology from Wikipedia and WordNetMax Planck Institute for Informatics · 2008年
- 3YAGO3: A Knowledge Base from Multilingual WikipediasMax Planck Institute for Informatics · 2016年
- 4Knowledge Graph Completion with Adaptive Sparse Transfer MatrixTsinghua University · 2016年
- 5A Review of Relational Machine Learning for Knowledge GraphsUniversity of Cambridge · 2015年
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
HUSTgearbox
This reposotory release a gearbox failure dataset, which can support intelliegnt fault diagnosis research
github 收录
PCLT20K
PCLT20K数据集是由湖南大学等机构创建的一个大规模PET-CT肺癌肿瘤分割数据集,包含来自605名患者的21,930对PET-CT图像,所有图像都带有高质量的像素级肿瘤区域标注。该数据集旨在促进医学图像分割研究,特别是在PET-CT图像中肺癌肿瘤的分割任务。
arXiv 收录
MOOCs Dataset
该数据集包含了大规模开放在线课程(MOOCs)的相关数据,包括课程信息、用户行为、学习进度等。数据主要用于研究在线教育的行为模式和学习效果。
www.kaggle.com 收录
ChineseSafe
ChineseSafe是由南方科技大学统计与数据科学系创建的一个中文安全评估基准数据集,旨在评估大型语言模型在识别中文不安全内容方面的能力。该数据集包含205,034个样本,涵盖4个类别和10个子类别的安全问题,特别关注政治敏感性、色情内容和变体/同音词等新型安全问题。数据集通过从开源数据集和互联网资源中收集数据,经过数据清洗和去重处理,确保了数据集的高质量和多样性。ChineseSafe的应用领域主要集中在大型语言模型的安全评估,旨在帮助开发者和研究者提升模型在实际应用中的安全性。
arXiv 收录