five

Awesome Public Datasets

收藏
github2018-06-02 更新2024-05-31 收录
下载链接:
https://github.com/Marcelpv96/awesome-public-datasets
下载链接
链接失效反馈
官方服务:
资源简介:
一个主题中心的高质量公开数据集列表,收集并整理自博客、问答和用户反馈。

A curated list of high-quality open datasets centered around specific themes, collected and organized from blogs, Q&A platforms, and user feedback.
创建时间:
2018-06-02
原始信息汇总

数据集概述

农业

  • U.S. Department of Agricultures Nutrient Database

    • 链接: https://www.ars.usda.gov/northeast-area/beltsville-md/beltsville-human-nutrition-research-center/nutrient-data-laboratory/docs/sr28-download-files/
  • U.S. Department of Agricultures PLANTS Database

    • 链接: http://www.plants.usda.gov/dl_all.html

生物学

  • 1000 Genomes

    • 链接: http://www.1000genomes.org/data
  • American Gut (Microbiome Project)

    • 链接: https://github.com/biocore/American-Gut
  • Broad Bioimage Benchmark Collection (BBBC)

    • 链接: https://www.broadinstitute.org/bbbc
  • Broad Cancer Cell Line Encyclopedia (CCLE)

    • 链接: http://www.broadinstitute.org/ccle/home
  • Cell Image Library

    • 链接: http://www.cellimagelibrary.org
  • Complete Genomics Public Data

    • 链接: http://www.completegenomics.com/public-data/69-genomes/
  • EBI ArrayExpress

    • 链接: http://www.ebi.ac.uk/arrayexpress/
  • EBI Protein Data Bank in Europe

    • 链接: http://www.ebi.ac.uk/pdbe/emdb/index.html/
  • ENCODE project

    • 链接: https://www.encodeproject.org
  • Electron Microscopy Pilot Image Archive (EMPIAR)

    • 链接: http://www.ebi.ac.uk/pdbe/emdb/empiar/
  • Ensembl Genomes

    • 链接: http://ensemblgenomes.org/info/genomes
  • Gene Expression Omnibus (GEO)

    • 链接: http://www.ncbi.nlm.nih.gov/geo/
  • Gene Ontology (GO)

    • 链接: http://geneontology.org/page/download-annotations
  • Global Biotic Interactions (GloBI)

    • 链接: https://github.com/jhpoelen/eol-globi-data/wiki#accessing-species-interaction-data
  • Harvard Medical School (HMS) LINCS Project

    • 链接: http://lincs.hms.harvard.edu
  • Human Genome Diversity Project

    • 链接: http://www.hagsc.org/hgdp/files.html
  • Human Microbiome Project (HMP)

    • 链接: http://www.hmpdacc.org/reference_genomes/reference_genomes.php
  • ICOS PSP Benchmark

    • 链接: http://ico2s.org/datasets/psp_benchmark.html
  • International HapMap Project

    • 链接: http://hapmap.ncbi.nlm.nih.gov/downloads/index.html.en
  • Journal of Cell Biology DataViewer

    • 链接: http://jcb-dataviewer.rupress.org
  • KEGG

    • 链接: http://www.genome.jp/kegg/
  • MIT Cancer Genomics Data

    • 链接: http://www.broadinstitute.org/cgi-bin/cancer/datasets.cgi
  • NCBI Proteins

    • 链接: http://www.ncbi.nlm.nih.gov/guide/proteins/#databases
  • NCBI Taxonomy

    • 链接: http://www.ncbi.nlm.nih.gov/taxonomy
  • NCI Genomic Data Commons

    • 链接: https://gdc-portal.nci.nih.gov
  • NIH Microarray data

    • 链接: http://bit.do/VVW6
  • OpenSNP genotypes data

    • 链接: https://opensnp.org/
  • Pathguid - Protein-Protein Interactions Catalog

    • 链接: http://www.pathguide.org/
  • Protein Data Bank

    • 链接: http://www.rcsb.org/
  • Psychiatric Genomics Consortium

    • 链接: https://www.med.unc.edu/pgc/downloads
  • PubChem Project

    • 链接: https://pubchem.ncbi.nlm.nih.gov/
  • PubGene (now Coremine Medical)

    • 链接: http://www.pubgene.org/
  • Sanger Catalogue of Somatic Mutations in Cancer (COSMIC)

    • 链接: http://cancer.sanger.ac.uk/cosmic
  • Sanger Genomics of Drug Sensitivity in Cancer Project (GDSC)

    • 链接: http://www.cancerrxgene.org/
  • Sequence Read Archive(SRA)

    • 链接: http://www.ncbi.nlm.nih.gov/Traces/sra/
  • Stanford Microarray Data

    • 链接: http://smd.stanford.edu/
  • Stowers Institute Original Data Repository

    • 链接: http://www.stowers.org/research/publications/odr
  • Systems Science of Biological Dynamics (SSBD) Database

    • 链接: http://ssbd.qbic.riken.jp
  • The Cancer Genome Atlas (TCGA), available via Broad GDAC

    • 链接: https://gdac.broadinstitute.org/
  • The Catalogue of Life

    • 链接: http://www.catalogueoflife.org/content/annual-checklist-archive
  • The Personal Genome Project

    • 链接: http://www.personalgenomes.org/
  • UCSC Public Data

    • 链接: http://hgdownload.soe.ucsc.edu/downloads.html
  • UniGene

    • 链接: http://www.ncbi.nlm.nih.gov/unigene
  • Universal Protein Resource (UnitProt)

    • 链接: http://www.uniprot.org/downloads

气候+天气

  • Actuaries Climate Index

    • 链接: http://actuariesclimateindex.org/data/
  • Australian Weather

    • 链接: http://www.bom.gov.au/climate/dwo/
  • Aviation Weather Center - Consistent, timely and accurate weather [...]

    • 链接: https://aviationweather.gov/adds/dataserver
  • Brazilian Weather - Historical data (In Portuguese)

    • 链接: http://sinda.crn2.inpe.br/PCD/SITE/novo/site/
  • Canadian Meteorological Centre

    • 链接: http://weather.gc.ca/grib/index_e.html
  • Climate Data from UEA (updated monthly)

    • 链接: https://crudata.uea.ac.uk/cru/data/temperature/#datter and ftp://ftp.cmdl.noaa.gov/
  • European Climate Assessment & Dataset

    • 链接: http://eca.knmi.nl/
  • Global Climate Data Since 1929

    • 链接: http://en.tutiempo.net/climate
  • NASA Global Imagery Browse Services

    • 链接: https://wiki.earthdata.nasa.gov/display/GIBS
  • NOAA Bering Sea Climate

    • 链接: http://www.beringclimate.noaa.gov/
  • NOAA Climate Datasets

    • 链接: http://www.ncdc.noaa.gov/data-access/quick-links
  • NOAA Realtime Weather Models

    • 链接: http://www.ncdc.noaa.gov/data-access/model-data/model-datasets/numerical-weather-prediction
  • NOAA SURFRAD Meteorology and Radiation Datasets

    • 链接: https://www.esrl.noaa.gov/gmd/grad/stardata.html
  • The World Bank Open Data Resources for Climate Change

    • 链接: http://data.worldbank.org/developers/climate-data-api
  • UEA Climatic Research Unit

    • 链接: http://www.cru.uea.ac.uk/data
  • WU Historical Weather Worldwide

    • 链接: https://www.wunderground.com/history/index.html
  • WorldClim - Global Climate Data

    • 链接: http://www.worldclim.org

复杂网络

  • AMiner Citation Network Dataset

    • 链接: http://aminer.org/citation
  • CrossRef DOI URLs

    • 链接: https://archive.org/details/doi-urls
  • DBLP Citation dataset

    • 链接: https://kdl.cs.umass.edu/display/public/DBLP
  • DIMACS Road Networks Collection

    • 链接: http://www.dis.uniroma1.it/challenge9/download.shtml
  • NBER Patent Citations

    • 链接: http://nber.org/patents/
  • NIST complex networks data collection

    • 链接: http://math.nist.gov/~RPozo/complex_datasets.html
  • Network Repository with Interactive Exploratory Analysis Tools

    • 链接: http://networkrepository.com/
  • Protein-protein interaction network

    • 链接: http://vlado.fmf.uni-lj.si/pub/networks/data/bio/Yeast/Yeast.htm
  • PyPI and Maven Dependency Network

    • 链接: https://ogirardot.wordpress.com/2013/01/31/sharing-pypimaven-dependency-data/
  • Scopus Citation Database

    • 链接: https://www.elsevier.com/solutions/scopus
  • Small Network Data

    • 链接: http://www-personal.umich.edu/~mejn/netdata/
  • Stanford GraphBase

    • 链接: http://www3.cs.stonybrook.edu/~algorith/implement/graphbase/implement.shtml
  • Stanford Large Network Dataset Collection

    • 链接: http://snap.stanford.edu/data/
  • Stanford Longitudinal Network Data Sources

    • 链接: http://stanford.edu/group/sonia/dataSources/index.html
  • The Koblenz Network Collection

    • 链接: http://konect.uni-koblenz.de/
  • The Laboratory for Web Algorithmics (UNIMI)

    • 链接: http://law.di.unimi.it/datasets.php
  • The Nexus Network Repository

    • 链接: http://nexus.igraph.org/
  • UCI Network Data Repository

    • 链接: https://networkdata.ics.uci.edu/resources.php
  • UFL sparse matrix collection

    • 链接: http://www.cise.ufl.edu/research/sparse/matrices/
  • WSU Graph Database

    • 链接: http://www.eecs.wsu.edu/mgd/gdb.html

计算机网络

  • 3.5B Web Pages from CommonCrawl 2012

    • 链接: http://www.bigdatanews.com/profiles/blogs/big-data-set-3-5-billion-web-pages-made-available-for-all-of-us
  • 53.5B Web clicks of 100K users in Indiana Univ.

    • 链接: http://cnets.indiana.edu/groups/nan/webtraffic/click-dataset/
  • CAIDA Internet Datasets

    • 链接: http://www.caida.org/data/overview/
  • CRAWDAD Wireless datasets from Dartmouth Univ.

    • 链接: https://crawdad.cs.dartmouth.edu/
  • ClueWeb09 - 1B web pages

    • 链接: http://lemurproject.org/clueweb09/
  • ClueWeb12 - 733M web pages

    • 链接: http://lemurproject.org/clueweb12/
  • CommonCrawl Web Data over 7 years

    • 链接: http://commoncrawl.org/the-data/get-started/
  • Criteo click-through data

    • 链接: http://labs.criteo.com/2015/03/criteo-releases-its-new-dataset/
  • Internet-Wide Scan Data Repository

    • 链接: https://scans.io/
  • OONI: Open Observatory of Network Interference - Internet censorship data

    • 链接: https://ooni.torproject.org/data/
  • Open Mobile Data by MobiPerf

    • 链接: https://console.developers.google.com/storage/openmobiledata_public/
  • Rapid7 Sonar Internet Scans

    • 链接: https://sonar.labs.rapid7.com/
  • UCSD Network Telescope, IPv4 /8 net

    • 链接: http://www.caida.org/projects/network_telescope/

数据挑战

  • Bruteforce Database

    • 链接: https://github.com/duyetdev/bruteforce-database
  • Challenges in Machine Learning

    • 链接: http://www.chalearn.org/
  • CrowdANALYTIX dataX

    • 链接: http://data.crowdanalytix.com
  • D4D Challenge of Orange

    • 链接: http://www.d4d.orange.com/en/home
  • DrivenData Competitions for Social Good

    • 链接: http://www.drivendata.org/
  • ICWSM Data Challenge (since 2009)

    • 链接: http://icwsm.cs.umbc.edu/
  • KDD Cup by Tencent 2012

    • 链接: http://www.kddcup2012.org/
  • Kaggle Competition Data

    • 链接: https://www.kaggle.com/
  • Localytics Data Visualization Challenge

    • 链接: https://github.com/localytics/data-viz-challenge
  • Netflix Prize

    • 链接: http://netflixprize.com/leaderboard.html
  • Space Apps Challenge

    • 链接: https://2015.spaceappschallenge.org
  • Telecom Italia Big Data Challenge

    • 链接: https://dandelion.eu/datamine/open-big-data/
  • TravisTorrent Dataset - MSR2017 Mining Challenge

    • 链接: https://travistorrent.testroots.org/
  • TunedIT - Data mining & machine learning data sets, algorithms, challenges

    • 链接: http://tunedit.org/challenges/
  • Yelp Dataset Challenge

    • 链接: http://www.yelp.com/dataset_challenge

地球科学

  • AQUASTAT - Global water resources and uses

    • 链接: http://www.fao.org/nr/water/aquastat/data/query/index.html?lang=en
  • BODC - marine data of ~22K vars

    • 链接: https://www.bodc.ac.uk/data/
  • EOSDIS - NASAs earth observing system data

    • 链接: http://sedac.ciesin.columbia.edu/data/sets/browse
  • Earth Models

    • 链接: http://www.earthmodels.org/
  • Integrated Marine Observing System (IMOS) - roughly 30TB of ocean measurements

    • 链接: https://imos.aodn.org.au/
  • Marinexplore - Open Oceanographic Data

    • 链接: http://marinexplore.org/
  • Smithsonian Institution Global Volcano and Eruption Database

    • 链接: http://volcano.si.edu/
  • USGS Earthquake Archives

    • 链接: http://earthquake.usgs.gov/earthquakes/search/

经济学

  • American Economic Association (AEA)
    • 链接: https://www
搜集汇总
数据集介绍
main_image_url
构建方式
该数据集通过自动化脚本从多个来源收集和整理而来,涵盖了各个领域的高质量公共数据集,旨在为研究人员提供一站式的数据资源。数据集的构建依赖于社区贡献,采用apd-core工具进行自动化生成和维护。
特点
数据集特点包括多样性、高质量和易于访问。它包含了农业、生物学、气候与天气、复杂网络、计算机网络、数据挑战、地球科学、经济学、教育、能源、金融、地理信息系统等多个领域的数据集。数据集以列表形式呈现,每个条目都提供了详细的信息和访问链接。
使用方法
用户可以通过GitHub页面浏览和搜索数据集,每个数据集都提供了详细的描述和访问方式。用户可以根据自己的研究需求,通过提供的链接直接访问和下载数据集。数据集的更新和维护是通过社区贡献和自动化工具实现的。
背景与挑战
背景概述
Awesome Public Datasets 是一个由社区驱动的开源项目,旨在收集和整理互联网上各种主题的公共数据集。该项目创建于2013年,由Sindre Sorhus发起,并在GitHub上进行维护。该项目的主要目的是为了方便研究人员、开发者和数据科学家能够轻松地发现和访问高质量的公共数据集。数据集覆盖了从农业、生物学到金融、地理信息系统等多个领域,对相关领域的研究产生了重要影响。
当前挑战
在构建过程中,Awesome Public Datasets 面临的挑战主要包括:1) 数据集的质量控制,确保收录的数据集是高质量和可靠的;2) 数据集的分类和整理,以便用户能够快速找到所需数据;3) 维护和更新问题,随着数据集的增加和更新,需要持续维护和更新列表;4) 数据集的版权和许可问题,确保所有数据集都符合开源许可要求。
常用场景
经典使用场景
Awesome Public Datasets 集合了众多领域的公共数据集,其经典使用场景主要在于为研究者和开发者提供丰富的数据资源。这些数据集涵盖了从生物学、气候学到计算机科学和社会科学等众多领域,使得用户能够在各自的研究领域内轻松地获取到所需的数据集,从而推动科研工作的进展。
衍生相关工作
该数据集衍生了大量的相关工作,包括但不限于数据集的进一步整理、分析工具的开发以及基于这些数据集的学术研究和应用案例。这些相关工作进一步扩展了数据集的用途,促进了跨学科的研究合作。
数据集最近研究
最新研究方向
该数据集涵盖了多个领域的大量公共数据集,最新的研究方向主要集中于数据挖掘、机器学习和大数据分析。研究者们正利用这些数据集探索诸如生物信息学中的基因序列分析、气候变化模型构建、复杂网络结构分析、社交网络分析以及金融市场的预测等前沿领域。这些研究不仅推动了相关学科的发展,也为社会决策提供了科学依据。
以上内容由遇见数据集搜集并总结生成
5,000+
优质数据集
54 个
任务类型
进入经典数据集
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

数据驱动未来

携手共赢发展

商业合作