olympics-dataset|奥运会数据集|数据查询数据集
收藏奥运会数据集
数据集概述
该数据集用于练习编写SQL查询,使用真实的奥运会数据。
数据集来源
来源:https://techtfq.com/blog/practice-writing-sql-queries-using-real-dataset
数据集任务列表
- 奥运会共举办了多少届?
- 列出所有奥运会举办年份、季节和城市。
- 每届奥运会参与国家的总数是多少?
- 哪一年参与国家的数量最多和最少?
- 哪个国家参加了所有的奥运会?
- 哪个运动项目在所有夏季奥运会中都有比赛?
- 哪些运动项目只在奥运会中举办过一次?
- 每届奥运会举办的运动项目总数是多少?
- 获得金牌的最年长运动员是谁?
- 参与奥运会的男女运动员比例是多少?
- 获得最多金牌的前五名运动员是谁?
- 获得最多奖牌(金/银/铜)的前五名运动员是谁?
- 在奥运会中获得最多奖牌的前五名国家是哪些?
- 每个国家获得的金、银、铜牌总数是多少?
- 每个国家在每届奥运会中获得的金、银、铜牌总数是多少?
- 在每届奥运会中,哪个国家获得了最多的金、银、铜牌?
- 在每届奥运会中,哪个国家获得了最多的金、银、铜牌和总奖牌数?
- 哪些国家从未获得过金牌,但获得过银牌或铜牌?
- 印度在哪个运动项目中获得的奖牌最多?
- 印度在哪些奥运会中获得了曲棍球奖牌,每届奥运会获得多少奖牌?
数据表结构
运动员事件表 (athlete_events)
- 字段:
- id: 运动员ID (INT)
- name: 运动员姓名 (VARCHAR(255))
- sex: 性别 (VARCHAR(255))
- age: 年龄 (VARCHAR(255))
- height: 身高 (VARCHAR(255))
- weight: 体重 (VARCHAR(255))
- team: 队伍 (VARCHAR(255))
- noc: 国家奥委会代码 (VARCHAR(255))
- games: 奥运会名称 (VARCHAR(255))
- year: 年份 (INT)
- season: 季节 (VARCHAR(255))
- city: 举办城市 (VARCHAR(255))
- sport: 运动项目 (VARCHAR(255))
- event: 比赛项目 (VARCHAR(255))
- medal: 奖牌 (VARCHAR(255))
数据加载
- 数据文件:athlete_events.csv
- 加载命令: sql LOAD DATA INFILE athlete_events.csv INTO TABLE athlete_events FIELDS TERMINATED BY , ENCLOSED BY " LINES TERMINATED BY IGNORE 1 ROWS;

中国食物成分数据库
食物成分数据比较准确而详细地描述农作物、水产类、畜禽肉类等人类赖以生存的基本食物的品质和营养成分含量。它是一个重要的我国公共卫生数据和营养信息资源,是提供人类基本需求和基本社会保障的先决条件;也是一个国家制定相关法规标准、实施有关营养政策、开展食品贸易和进行营养健康教育的基础,兼具学术、经济、社会等多种价值。 本数据集收录了基于2002年食物成分表的1506条食物的31项营养成分(含胆固醇)数据,657条食物的18种氨基酸数据、441条食物的32种脂肪酸数据、130条食物的碘数据、114条食物的大豆异黄酮数据。
国家人口健康科学数据中心 收录
中国空气质量数据集(2014-2020年)
数据集中的空气质量数据类型包括PM2.5, PM10, SO2, NO2, O3, CO, AQI,包含了2014-2020年全国360个城市的逐日空气质量监测数据。监测数据来自中国环境监测总站的全国城市空气质量实时发布平台,每日更新。数据集的原始文件为CSV的文本记录,通过空间化处理生产出Shape格式的空间数据。数据集包括CSV格式和Shape格式两数数据格式。
国家地球系统科学数据中心 收录
URPC系列数据集, S-URPC2019, UDD
URPC系列数据集包括URPC2017至URPC2020DL,主要用于水下目标的检测和分类。S-URPC2019专注于水下环境的特定检测任务。UDD数据集信息未在README中详细描述。
github 收录
Tropicos
Tropicos是一个全球植物名称数据库,包含超过130万种植物的名称、分类信息、分布数据、图像和参考文献。该数据库由密苏里植物园维护,旨在为植物学家、生态学家和相关领域的研究人员提供全面的植物信息。
www.tropicos.org 收录
中国1km分辨率逐月降水量数据集(1901-2023)
该数据集为中国逐月降水量数据,空间分辨率为0.0083333°(约1km),时间为1901.1-2023.12。数据格式为NETCDF,即.nc格式。该数据集是根据CRU发布的全球0.5°气候数据集以及WorldClim发布的全球高分辨率气候数据集,通过Delta空间降尺度方案在中国降尺度生成的。并且,使用496个独立气象观测点数据进行验证,验证结果可信。本数据集包含的地理空间范围是全国主要陆地(包含港澳台地区),不含南海岛礁等区域。为了便于存储,数据均为int16型存于nc文件中,降水单位为0.1mm。 nc数据可使用ArcMAP软件打开制图; 并可用Matlab软件进行提取处理,Matlab发布了读入与存储nc文件的函数,读取函数为ncread,切换到nc文件存储文件夹,语句表达为:ncread (‘XXX.nc’,‘var’, [i j t],[leni lenj lent]),其中XXX.nc为文件名,为字符串需要’’;var是从XXX.nc中读取的变量名,为字符串需要’’;i、j、t分别为读取数据的起始行、列、时间,leni、lenj、lent i分别为在行、列、时间维度上读取的长度。这样,研究区内任何地区、任何时间段均可用此函数读取。Matlab的help里面有很多关于nc数据的命令,可查看。数据坐标系统建议使用WGS84。
国家青藏高原科学数据中心 收录