awesome-public-datasets
收藏github2016-12-18 更新2024-05-31 收录
下载链接:
https://github.com/shubhamjain0594/awesome-public-datasets
下载链接
链接失效反馈官方服务:
资源简介:
一个包含高质量公开数据集的精选列表,涵盖多个领域,如农业、生物学等。
A curated list of high-quality public datasets spanning various fields such as agriculture, biology, and more.
创建时间:
2016-03-11
原始信息汇总
数据集概述
生物学
- 1000 Genomes: 数据集链接: http://www.1000genomes.org/data
- American Gut (Microbiome Project): 数据集链接: https://github.com/biocore/American-Gut
- Broad Cancer Cell Line Encyclopedia (CCLE): 数据集链接: http://www.broadinstitute.org/ccle/home
- Cell Image Library: 数据集链接: http://www.cellimagelibrary.org
- Collaborative Research in Computational Neuroscience (CRCNS): 数据集链接: http://crcns.org/data-sets
- Complete Genomics Public Data: 数据集链接: http://www.completegenomics.com/public-data/69-genomes/
- EBI ArrayExpress: 数据集链接: http://www.ebi.ac.uk/arrayexpress/
- EBI Protein Data Bank in Europe: 数据集链接: http://www.ebi.ac.uk/pdbe/emdb/index.html/
- ENCODE project: 数据集链接: https://www.encodeproject.org
- Ensembl Genomes: 数据集链接: http://ensemblgenomes.org/info/genomes
- Gene Expression Omnibus (GEO): 数据集链接: http://www.ncbi.nlm.nih.gov/geo/
- Gene Ontology (GO): 数据集链接: http://geneontology.org/page/download-annotations
- Global Biotic Interactions (GloBI): 数据集链接: https://github.com/jhpoelen/eol-globi-data/wiki#accessing-species-interaction-data
- Harvard Medical School (HMS) LINCS Project: 数据集链接: http://lincs.hms.harvard.edu
- Human Genome Diversity Project: 数据集链接: http://www.hagsc.org/hgdp/files.html
- Human Microbiome Project (HMP): 数据集链接: http://www.hmpdacc.org/reference_genomes/reference_genomes.php
- ICOS PSP Benchmark: 数据集链接: http://ico2s.org/datasets/psp_benchmark.html
- International HapMap Project: 数据集链接: http://hapmap.ncbi.nlm.nih.gov/downloads/index.html.en
- Journal of Cell Biology DataViewer: 数据集链接: http://jcb-dataviewer.rupress.org
- MIT Cancer Genomics Data: 数据集链接: http://www.broadinstitute.org/cgi-bin/cancer/datasets.cgi
- NCBI Proteins: 数据集链接: http://www.ncbi.nlm.nih.gov/guide/proteins/#databases
- NCBI Taxonomy: 数据集链接: http://www.ncbi.nlm.nih.gov/taxonomy
- NeuroData: 数据集链接: http://neurodata.io
- NIH Microarray data: 数据集链接: http://bit.do/VVW6 或 FTP
- OpenSNP genotypes data: 数据集链接: https://opensnp.org/
- Pathguid - Protein-Protein Interactions Catalog: 数据集链接: http://www.pathguide.org/
- Protein Data Bank: 数据集链接: http://www.rcsb.org/
- Psychiatric Genomics Consortium: 数据集链接: https://www.med.unc.edu/pgc/downloads
- PubChem Project: 数据集链接: https://pubchem.ncbi.nlm.nih.gov/
- PubGene (now Coremine Medical): 数据集链接: http://www.pubgene.org/
- Sanger Catalogue of Somatic Mutations in Cancer (COSMIC): 数据集链接: http://cancer.sanger.ac.uk/cosmic
- Sanger Genomics of Drug Sensitivity in Cancer Project (GDSC): 数据集链接: http://www.cancerrxgene.org/
- Sequence Read Archive(SRA): 数据集链接: http://www.ncbi.nlm.nih.gov/Traces/sra/
- Stanford Microarray Data: 数据集链接: http://smd.stanford.edu/
- Stowers Institute Original Data Repository: 数据集链接: http://www.stowers.org/research/publications/odr
- Systems Science of Biological Dynamics (SSBD) Database: 数据集链接: http://ssbd.qbic.riken.jp
- Temple University Hospital EEG Database: 数据集链接: https://www.nedcdata.org/drupal/node/12
- The Cancer Genome Atlas (TCGA), available via Broad GDAC: 数据集链接: https://gdac.broadinstitute.org/
- The Catalogue of Life: 数据集链接: http://www.catalogueoflife.org/content/annual-checklist-archive
- The Personal Genome Project: 数据集链接: http://www.personalgenomes.org/ 或 PGP
- UCSC Public Data: 数据集链接: http://hgdownload.soe.ucsc.edu/downloads.html
- Universal Protein Resource (UnitProt): 数据集链接: http://www.uniprot.org/downloads
- UniGene: 数据集链接: http://www.ncbi.nlm.nih.gov/unigene
气候/天气
- Australian Weather: 数据集链接: http://www.bom.gov.au/climate/dwo/
- Brazilian Weather - Historical data (In Portuguese): 数据集链接: http://sinda.crn2.inpe.br/PCD/SITE/novo/site/
- Canadian Meteorological Centre: 数据集链接: http://weather.gc.ca/grib/index_e.html
- Climate Data from UEA (updated monthly): 数据集链接: https://crudata.uea.ac.uk/cru/data/temperature/#datter 和 ftp://ftp.cmdl.noaa.gov/
- European Climate Assessment & Dataset: 数据集链接: http://eca.knmi.nl/
- Global Climate Data Since 1929: 数据集链接: http://en.tutiempo.net/climate
- NASA Global Imagery Browse Services: 数据集链接: https://wiki.earthdata.nasa.gov/display/GIBS
- NOAA Bering Sea Climate: 数据集链接: http://www.beringclimate.noaa.gov/
- NOAA Climate Datasets: 数据集链接: http://www.ncdc.noaa.gov/data-access/quick-links
- NOAA Realtime Weather Models: 数据集链接: http://www.ncdc.noaa.gov/data-access/model-data/model-datasets/numerical-weather-prediction
- The World Bank Open Data Resources for Climate Change: 数据集链接: http://data.worldbank.org/developers/climate-data-api
- UEA Climatic Research Unit: 数据集链接: http://www.cru.uea.ac.uk/data
- WorldClim - Global Climate Data: 数据集链接: http://www.worldclim.org
- WU Historical Weather Worldwide: 数据集链接: https://www.wunderground.com/history/index.html
复杂网络
- AMiner Citation Network Dataset: 数据集链接: http://aminer.org/citation
- CrossRef DOI URLs: 数据集链接: https://archive.org/details/doi-urls
- DBLP Citation dataset: 数据集链接: https://kdl.cs.umass.edu/display/public/DBLP
- NBER Patent Citations: 数据集链接: http://nber.org/patents/
- Network Repository with Interactive Exploratory Analysis Tools: 数据集链接: http://networkrepository.com/
- NIST complex networks data collection: 数据集链接: http://math.nist.gov/~RPozo/complex_datasets.html
- Protein-protein interaction network: 数据集链接: http://vlado.fmf.uni-lj.si/pub/networks/data/bio/Yeast/Yeast.htm
- PyPI and Maven Dependency Network: 数据集链接: https://ogirardot.wordpress.com/2013/01/31/sharing-pypimaven-dependency-data/
- Scopus Citation Database: 数据集链接: https://www.elsevier.com/solutions/scopus
- Small Network Data: 数据集链接: http://www-personal.umich.edu/~mejn/netdata/
- Stanford GraphBase (Steven Skiena): 数据集链接: http://www3.cs.stonybrook.edu/~algorith/implement/graphbase/implement.shtml
- Stanford Large Network Dataset Collection: 数据集链接: http://snap.stanford.edu/data/
- Stanford Longitudinal Network Data Sources: 数据集链接: http://stanford.edu/group/sonia/dataSources/index.html
- The Koblenz Network Collection: 数据集链接: http://konect.uni-koblenz.de/
- The Laboratory for Web Algorithmics (UNIMI): 数据集链接: http://law.di.unimi.it/datasets.php
- The Nexus Network Repository: 数据集链接: http://nexus.igraph.org/
- UCI Network Data Repository: 数据集链接: https://networkdata.ics.uci.edu/resources.php
- UFL sparse matrix collection: 数据集链接: http://www.cise.ufl.edu/research/sparse/matrices/
- WSU Graph Database: 数据集链接: http://www.eecs.wsu.edu/mgd/gdb.html
- DIMACS Road Networks Collection: 数据集链接: http://www.dis.uniroma1.it/challenge9/download.shtml
计算机网络
- 3.5B Web Pages from CommonCraw 2012: 数据集链接: http://www.bigdatanews.com/profiles/blogs/big-data-set-3-5-billion-web-pages-made-available-for-all-of-us
- 53.5B Web clicks of 100K users in Indiana Univ.: 数据集链接: http://cnets.indiana.edu/groups/nan/webtraffic/click-dataset/
- CAIDA Internet Datasets: 数据集链接: http://www.caida.org/data/overview/
- ClueWeb09 - 1B web pages: 数据集链接: [http://lemurproject.org/clueweb0
搜集汇总
数据集介绍

构建方式
该数据集是通过收集和整理来自博客、回答和用户响应的公共数据源而构建的。大部分列出的数据集是免费的,但也有一些不是。
特点
数据集的特点在于其广泛性,涵盖了多个领域,如农业、生物学、气候/天气、复杂网络等,提供了丰富的数据资源。同时,数据集持续更新,保证了数据的时效性和多样性。
使用方法
用户可以通过GitHub页面浏览和下载数据集,也可以根据数据集的URL直接访问相关网站以获取数据。部分数据集可能需要特定的工具或格式来处理。
背景与挑战
背景概述
‘awesome-public-datasets’是一个收集和整理自博客、回答和用户响应的公共数据集列表。该数据集的创建时间不详,主要维护者或机构为caesar0301。其核心研究问题是如何高效地收集和整理互联网上的公共数据集,以便于研究人员和开发者使用。该数据集对相关领域的影响力在于,它为研究人员提供了一个便捷的方式来发现和访问大量的公共数据集,从而推动了数据驱动的研究和应用的发展。
当前挑战
在构建‘awesome-public-datasets’数据集时,所面临的挑战主要包括:1)如何确保收集的数据集的质量和可靠性;2)如何处理和整合不同来源和格式的数据;3)如何保持数据集的更新和维护,以适应不断变化的数据资源和研究需求。此外,该数据集解决的领域问题是提供一个全面的数据集列表,以便研究人员可以根据需要找到合适的数据集,但在数据集的选择和使用过程中也存在挑战,如数据集的适用性、数据质量和数据隐私等问题。
常用场景
经典使用场景
awesome-public-datasets数据集是一个收集和整理自博客、回答和用户响应的公共数据源列表。其经典使用场景包括为研究人员提供方便的数据集查找服务,使研究者能够快速定位到所需的数据集,进而促进各类学术研究和应用开发。
衍生相关工作
基于awesome-public-datasets,研究者可以开展数据集的进一步整理、整合和衍生工作,例如构建专门的数据集搜索引擎、开发数据管理工具或者进行数据质量评估等,以支持更广泛的数据科学研究。
数据集最近研究
最新研究方向
awesome-public-datasets数据集的近期研究方向主要集中在数据集的整理、归类和共享上。研究者们致力于从各种来源收集公共数据集,并将它们进行分类,以便于用户查找和使用。此外,也有研究关注于如何提高数据集的质量和可用性,以及如何通过数据集促进不同领域的研究合作。
以上内容由遇见数据集搜集并总结生成



