awesome-public-datasets
收藏官方服务:
资源简介:
这是一个主题中心的高质量公共数据源列表,收集整理了来自博客、回答和用户反馈的多个领域的数据集,涵盖农业、建筑等主题,大多数数据集是免费的,但部分可能收费。
This is a topic-centric high-quality public data source list. It compiles datasets from multiple domains sourced from blogs, Q&A platforms and user feedback, covering topics such as agriculture and architecture. Most of these datasets are free of charge, while some may require payment.
创建时间:
2014-11-20
原始信息汇总
数据集详情总结
项目概述
该项目名为 Awesome Public Datasets,是一个高质量、以主题为中心的公共数据源列表。数据集来自博客、问答和用户反馈的收集与整理,大多数免费,部分需付费。项目由上海交通大学OMNILab孵化,现归属于BaiYuLan Open AI社区。该仓库由 apd-core 自动生成,不直接修改本文件。
数据集分类与内容
农业
- 全球主要作物历史产量数据集 (1981–2016):提供1981-2016年主要作物的全球历史产量数据。
- 土壤水分高光谱基准数据集:包含为期五天的土壤水分测量数据。
- 柠檬质量控制数据集:用于研究柠檬质量检测的图像数据集。
- Open Food Facts:众包食品成分数据库,覆盖170多个国家的250万+产品。
- Optimized Soil Adjusted Vegetation Index:用于遥感数据处理的指数数据库。
- USDA FoodData Central:美国农业部食品成分数据的主要来源。
- 美国农业部PLANTS数据库:包含近7种植物清单的数据库。
- USDA NASS县级作物产量:提供美国农业部NASS县级年度作物产量的免费静态JSON API。
建筑学
- 瑞士公寓模型:包含42,207套公寓(242,257个房间)的详细数据。
生物学
- 1000 Genomes:2008-2015年开展的千人基因组计划,创建了最大的人类基因组数据集。
- ANHIR:自动非刚性组织学图像配准,包含2D组织学图像。
- American Gut (微生物组项目):最大的众包微生物组项目。
- BCNB:包含1058名患者的WSI数据,部分肿瘤区域已标注。
- Broad Bioimage Benchmark Collection (BBBC):生物图像基准数据集集合。
- Broad Cancer Cell Line Encyclopedia (CCLE):癌细胞系百科全书。
- CIMA:组织学显微镜组织切片数据集,包含2D组织学图像。
- Cell Image Library:细胞图像图书馆。
- Complete Genomics Public Data:自由可用的全人类基因组数据集。
- CytoImageNet:大规模显微镜图像数据集,包含890,737张灰度图像。
- EBI ArrayExpress:功能基因组学数据档案库。
- EBI Protein Data Bank in Europe:欧洲电子显微镜数据库(EMDB)。
- ENCODE project:DNA元件百科全书。
- Electron Microscopy Pilot Image Archive (EMPIAR):电子显微镜公共图像档案。
- Ensembl Genomes:基因组数据库。
- Gene Expression Omnibus (GEO):公共功能基因组学数据仓库。
- Gene Ontology (GO):基因本体论注释文件。
- Global Biotic Interactions (GloBI):全球生物相互作用数据。
- Harvard Medical School (HMS) LINCS Project:哈佛医学院LINCS中心项目。
- Human Genome Diversity Project:斯坦福大学人类基因组多样性项目。
- Human Microbiome Project (HMP):人类微生物组项目。
- ICOS PSP Benchmark:ICOS PSP基准测试数据集。
- International HapMap Project:国际单倍型图谱计划。
- Journal of Cell Biology DataViewer:JCB数据已迁移至Biostudies。
- KEGG:用于理解高级功能和效用的数据库资源。
- NCBI Proteins:NCBI蛋白质数据库。
- NCBI Taxonomy:NCBI分类学数据库。
- NCI Genomic Data Commons:NCI基因组数据共享门户。
- NIH Microarray data:NIH微阵列数据。
- OpenSNP genotypes data:开放SNP基因型数据。
- Palmer Penguins:为数据探索提供的数据集。
- Pathguid:蛋白质-蛋白质相互作用目录。
- Protein Data Bank:蛋白质数据银行档案。
- Psychiatric Genomics Consortium:精神基因组学联盟数据下载。
- PubChem Project:世界上最大的免费化学信息数据库。
- PubGene (now Coremine Medical):由挪威公司开发的工具集。
- Sanger Catalogue of Somatic Mutations in Cancer (COSMIC):癌症体细胞突变目录。
- Sanger Genomics of Drug Sensitivity in Cancer Project (GDSC):癌症药物敏感性基因组学项目。
- Sequence Read Archive (SRA):存储原始测序数据的序列读取档案。
- Serratus:分析710万RNA/DNA测序数据集以发现病毒。
- Stanford Microarray Data (已退休):斯坦福微阵列数据。
- Stowers Institute Original Data Repository:斯托尔斯研究所原始数据仓库。
- Systems Science of Biological Dynamics (SSBD) Database:生物动力学系统科学数据库。
- The Cancer Genome Atlas (TCGA):癌症基因组图谱(通过Broad GDAC获取)。
- The Catalogue of Life:超过180万种生物的质量保证清单。
- The Personal Genome Project:个人基因组计划。
- UCSC Public Data:UCSC公共数据。
- UniGene:UniGene数据库。
- Universal Protein Resource (UniProt):通用蛋白质资源。
- iNaturalist:社区维护的物种观察数据库,拥有1.8亿+观察记录。
- Rfam:RNA家族数据库。
化学
- Ionic Liquids Database (ILThermo):离子液体数据库。
气候与天气
- Actuaries Climate Index:精算气候指数数据。
- Australian Weather:澳大利亚天气数据。
- Aviation Weather Center:全球航空天气信息。
- Brazilian Weather:巴西天气历史数据(葡萄牙语)。
- Several Climate Datasets (CDS):C3S气候数据商店。
- Canadian Meteorological Centre:加拿大气象中心。
- Caravan:大型样本水文学开放社区数据集。
- Climate Data from UEA:东英吉利大学气候数据(每月更新)。
- Dutch Weather:KNMI数据中心的荷兰天气数据。
- European Climate Assessment & Dataset:欧洲气候评估与数据集。
数据质量标识
- OK_ICON (|OK_ICON|):表示数据集状态良好。
- FIXME_ICON (|FIXME_ICON|):表示数据集需要修复或更新。
搜集汇总
数据集介绍

构建方式
在数据科学蓬勃发展的时代,高质量公共数据集的汇聚成为推动研究进步的重要基石。该数据集以GitHub仓库为载体,由上海交通大学OMNILab实验室在陈厦明博士研究期间孵化,现归属于白玉兰开放AI社区。其构建方式独具匠心:通过自动化工具apd-core从博客、问答平台及用户反馈中精心搜集、整理并筛选出以主题为中心的高质量公共数据源,形成一个动态更新的结构化列表。每个条目均附带元数据链接,便于溯源与验证,部分数据源虽非完全免费,但整体确保了资源的权威性与实用性。
特点
该数据集的核心魅力在于其广泛而精细的覆盖范围与卓越的组织性。它横跨农业、建筑、生物学、化学、气候与天气等数十个领域,每个领域下细分出具体的数据集条目,如农业中的全球作物产量历史数据集、生物学中的千人基因组计划等,充分满足了跨学科研究的多元需求。每条数据均以清晰的状态图标标注(如良好或待修复),并附有直接访问链接与元数据描述,极大提升了检索效率。此外,项目通过Slack社区与贡献指南鼓励持续参与,确保了数据集的鲜活与迭代能力,使其成为科研工作者的导航明灯。
使用方法
使用该数据集的过程极为直观且高效。用户可直接访问GitHub仓库的README文件,浏览按主题分类的表格目录,快速定位感兴趣的领域。每个条目均提供超链接直达原始数据源,并附有元数据文件以供深入参考。对于希望贡献的用户,项目提供了基于apd-core的标准化提交流程,避免直接修改主文件,同时通过Slack社区获取实时更新与协作支持。研究人员可据此便捷地下载所需数据,用于分析、建模或验证,而开发者则可利用其自动化生成机制,定制专属的数据集列表,实现资源的高效复用与扩展。
背景与挑战
背景概述
Awesome Public Datasets 是由上海交通大学 OMNILab 实验室在陈厦明博士研究期间创建并维护的一个高质量、主题导向的公开数据集索引列表。该项目始于2010年代,旨在系统性地搜集、整理和分类来自博客、问答平台及用户反馈中的优质公共数据资源。其核心研究问题在于如何为数据科学、机器学习及跨学科研究提供一个便捷、可靠且持续更新的数据发现平台。该列表覆盖农业、生物学、化学、气候气象等多个领域,已成为全球数据科学家和研究人员广泛引用的重要资源,对推动开放数据运动和数据驱动型研究产生了深远影响。
当前挑战
该数据集索引面临的核心挑战包括:其一,所解决的领域问题是数据发现与整合的碎片化困境——海量公共数据集分散于不同机构与平台,缺乏统一、高质量的分类与检索机制,导致研究者难以高效定位所需数据。其二,构建过程中遇到的挑战在于维护数据质量与时效性:随着新数据集不断涌现及旧链接失效,需持续进行人工审核与自动化校验(如使用 apd-core 工具生成列表),同时确保收录标准的一致性与中立性,避免遗漏或偏见。此外,不同数据集的使用许可差异也增加了合规性管理的复杂性。
常用场景
经典使用场景
在数据科学领域,awesome-public-datasets 作为一个综合性的高质量公共数据集索引库,其最经典的使用场景是为研究者与从业者提供一个便捷的入口,以检索和获取涵盖农业、生物学、化学、气候与天气等多学科领域的权威数据资源。用户可通过该仓库按主题分类快速定位所需数据集,例如从农业子类中获取全球作物产量历史数据,或从生物学子类中访问基因组学与蛋白质组学数据库。这种结构化的组织方式极大降低了数据发现的时间成本,使得跨学科的数据驱动研究成为可能,尤其在探索性分析和基准测试任务中,该仓库常被用作初始数据源的参考清单。
衍生相关工作
该索引库衍生了一系列重要的相关工作,包括自动化的数据质量评估工具(如apd-core)、领域特定的数据集推荐系统以及基于该索引构建的元数据标准。例如,研究者开发了自动化脚本定期验证数据链接的有效性,并生成了结构化元数据文件,这启发了后续的数据集版本控制与持续集成实践。此外,该仓库的社区驱动维护模式催生了多个类似的主题性awesome列表,如awesome-datasets-for-NLP,推动了开放数据生态的繁荣。其分层分类方法也被借鉴用于构建知识图谱中的数据集本体,为语义网与数据湖的治理提供了参考框架。
数据集最近研究
最新研究方向
在数据科学蓬勃发展的浪潮中,高质量公共数据集的系统化整理与开放共享已成为驱动人工智能与跨学科研究的关键基石。awesome-public-datasets 项目作为汇聚全球优质主题数据源的权威索引,其最新研究动向紧密围绕数据生态的智能化治理与前沿应用展开。当前,该领域的研究焦点已从简单的资源罗列转向动态元数据管理、自动化质量评估与领域特定数据集的精准推荐,尤其关注农业遥感、生物医学影像、气候水文等热点方向的高价值数据整合。随着开放科学运动的深化,该项目所倡导的社区协作与标准化贡献机制,正深刻影响着科研数据基础设施的构建范式,为应对气候变化、精准医疗等全球性挑战提供了坚实的数据支撑,其影响力已超越技术范畴,成为推动知识民主化与跨领域创新的重要力量。
以上内容由遇见数据集搜集并总结生成




