olympics.csv|奥运会数据集|奖牌榜数据集
收藏Olympics Dataset - Case Study
数据集概述
- 来源: 该数据集源自维基百科上的“历届奥运会奖牌榜”。
- 文件格式: CSV文件(olympics.csv)。
数据处理任务
-
数据加载与清洗:
- 创建函数
load_data
以读取CSV文件并转换为数据框。 - 跳过首行。
- 重命名包含“01”、“02”和“03”的列名为“Gold”、“Silver”和“Bronze”。
- 分割国家名称和国家代码,并将国家名称设为数据框索引。
- 去除国家名称中的多余字符。
- 删除“Totals”列。
- 返回处理后的数据框。
- 创建函数
-
获取首个国家详情:
- 创建函数
first_country
。 - 返回首个国家的详细信息。
- 创建函数
-
获取夏季奥运会金牌最多的国家:
- 创建函数
gold_medal
。 - 返回获得最多金牌的国家的名称。
- 创建函数
-
获取夏季与冬季奥运会金牌数差异最大的国家:
- 创建函数
biggest_difference_in_gold_medal
。 - 返回夏季与冬季奥运会金牌数差异最大的国家的名称。
- 创建函数
-
添加“Points”列:
- 创建函数
get_points
。 - 根据金牌3分、银牌2分、铜牌1分的规则计算“Points”列,并返回包含此列的数据框。
- 创建函数
-
执行k-means聚类分析:
- 创建函数
k_means
。 - 返回聚类中心。
- 创建函数

LFW
人脸数据集;LFW数据集共有13233张人脸图像,每张图像均给出对应的人名,共有5749人,且绝大部分人仅有一张图片。每张图片的尺寸为250X250,绝大部分为彩色图像,但也存在少许黑白人脸图片。 URL: http://vis-www.cs.umass.edu/lfw/index.html#download
AI_Studio 收录
中国区域交通网络数据集
该数据集包含中国各区域的交通网络信息,包括道路、铁路、航空和水路等多种交通方式的网络结构和连接关系。数据集详细记录了各交通节点的位置、交通线路的类型、长度、容量以及相关的交通流量信息。
data.stats.gov.cn 收录
网易云音乐数据集
该数据集包含了网易云音乐平台上的歌手信息、歌曲信息和歌单信息,数据通过爬虫技术获取并整理成CSV格式,用于音乐数据挖掘和推荐系统构建。
github 收录
CatMeows
该数据集包含440个声音样本,由21只属于两个品种(缅因州库恩猫和欧洲短毛猫)的猫在三种不同情境下发出的喵声组成。这些情境包括刷毛、在陌生环境中隔离和等待食物。每个声音文件都遵循特定的命名约定,包含猫的唯一ID、品种、性别、猫主人的唯一ID、录音场次和发声计数。此外,还有一个额外的zip文件,包含被排除的录音(非喵声)和未剪辑的连续发声序列。
huggingface 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录