OpenML|机器学习数据集|数据挖掘数据集
收藏
- OpenML项目由Joaquin Vanschoren教授在荷兰埃因霍温理工大学发起,旨在创建一个开放的机器学习平台,促进数据和算法的共享与协作。
- OpenML平台正式上线,首次发布并开放给公众使用,标志着机器学习社区开始广泛采用这一平台进行数据集和实验的共享。
- OpenML发布了其首个API,使得开发者能够通过编程方式访问和上传数据集,进一步推动了平台的自动化和集成。
- OpenML与多个国际研究机构和公司合作,扩展了其数据集库,增加了对多种机器学习任务的支持,包括分类、回归和聚类等。
- OpenML推出了新的版本,引入了对深度学习模型的支持,并改进了用户界面和用户体验,吸引了更多研究者和企业的参与。
- OpenML发布了其数据集质量评估工具,帮助用户更好地理解和选择高质量的数据集,提升了平台的实用性和可靠性。
- OpenML与多个开源社区和标准组织合作,推动了数据集和实验结果的标准化,促进了跨平台和跨领域的数据共享与协作。
- 1OpenML: Networked Science in Machine LearningUniversity of Freiburg · 2010年
- 2OpenML: An R Package to Connect to the Machine Learning Platform OpenMLUniversity of Freiburg · 2014年
- 3OpenML: An Open Science Platform for the Machine Learning CommunityUniversity of Freiburg · 2019年
- 4The OpenML Platform for Machine Learning ExperimentationUniversity of Freiburg · 2020年
- 5OpenML-Python: An Open Source Python API for OpenMLUniversity of Freiburg · 2021年
Subway Dataset
该数据集包含了全球多个城市的地铁系统数据,包括车站信息、线路图、列车时刻表、乘客流量等。数据集旨在帮助研究人员和开发者分析和模拟城市交通系统,优化地铁运营和乘客体验。
www.kaggle.com 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录
LibriSpeech
LibriSpeech 是一个大约 1000 小时的 16kHz 英语朗读语音语料库,由 Vassil Panayotov 在 Daniel Povey 的协助下编写。数据来自 LibriVox 项目的已读有声读物,并经过仔细分割和对齐。
OpenDataLab 收录
CatMeows
该数据集包含440个声音样本,由21只属于两个品种(缅因州库恩猫和欧洲短毛猫)的猫在三种不同情境下发出的喵声组成。这些情境包括刷毛、在陌生环境中隔离和等待食物。每个声音文件都遵循特定的命名约定,包含猫的唯一ID、品种、性别、猫主人的唯一ID、录音场次和发声计数。此外,还有一个额外的zip文件,包含被排除的录音(非喵声)和未剪辑的连续发声序列。
huggingface 收录
长江干流实时水位观测数据集(2024年)
该数据集为长江干流主要水文站实时水位观测数据集,包含了汉口、户口、九江、宜昌等16个水文站点的逐小时或逐日水位观测数据。 该数据集包含3个excel表格文件,长江干流站点.xls,逐日水位.xlsx,逐小时水位.xlsx。
国家地球系统科学数据中心 收录