遇见数据集

electricsheepeurope/europe-ilo-emp-5emp-sex-oc2-nb-employment-by-sex-and-occupation-isco-level-2-19th

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的就业统计数据,具体指标为按性别和职业统计的就业人数 - ISCO 2级分类 -- 第19届国际劳工统计学家会议(千单位)。数据覆盖32个欧洲国家,时间跨度为2014年至2025年,共包含42,280个观测值。数据集提供了按性别(总计、男性、女性)和职业分类(基于国际标准职业分类ISCO-08的2级水平)的年度就业人数统计,数据以千人为单位。数据来源包括劳动力调查等国家统计资料,经过ILO的协调处理,并包含数据质量注释(如可靠性标志)。数据集适用于表格分类、回归和时间序列预测等任务。

This dataset contains employment statistics from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Employment by sex and occupation - ISCO level 2 -- 19th ICLS (thousands). It covers 32 European countries from 2014 to 2025, with 42,280 observations. The data provides annual employment figures disaggregated by sex (total, male, female) and occupation (based on the International Standard Classification of Occupations ISCO-08 at the 2-digit level), measured in thousands. Sources include national labour force surveys and other statistical records, harmonized by the ILO, and include data quality notes (e.g., reliability flags). The dataset is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-5emp-sex-oc2-nb-employment-by-sex-and-occupation-isco-level-2-19th 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接提取,并针对欧洲地区进行过滤。构建过程中,数据经过统一清洗与标准化处理,纳入了ISO 3166-1 alpha-3国家代码作为地理标识,同时保留了ILO基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调的关键信息。为确保可追溯性,数据源的标注列(source.label)被完整保留,从而清晰呈现每一条观测的来源。最终以Parquet格式封装,形成包含42,280条观测、覆盖32个欧洲国家、时间跨度为2014至2025年的结构化数据集。
特点
该数据集聚焦于按性别和职业划分的就业指标,具体对应ISCO-08二级分类(19th ICLS标准),单位以千计。其核心特点在于多维度的层次化拆解:性别维度涵盖总计、男性与女性三类;职业分类则细化至两位数代码的ISCO级别。数据时间跨度覆盖12年,空间范围横跨东欧、西欧及部分独联体国家,为面板数据分析提供了丰富的时空变异。此外,数据集中包含了观测状态标记与系列断裂说明等质量注释,有助于研究人员审慎评估数据可靠性与潜在偏差。
使用方法
使用该数据集时,可直接通过HuggingFace的datasets库加载,一步转换为Pandas DataFrame,便于进行快速探索与预处理。典型应用包括:利用国家代码与时间列构建时间序列分析,研究特定国家或职业类别在时间维度上的就业趋势;亦可借助性别分类字段,比较不同性别群体的就业分布差异。进一步,可通过透视操作重塑数据结构为年份×国家矩阵,适配多元回归、面板数据建模等计量分析需求。对于高级应用场景,还可结合ILOSTAT的其他指标进行跨域联立分析。
背景与挑战
背景概述
在劳动力市场研究中,就业结构与性别差异的精准测量是评估经济发展与社会公平的关键切入点。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库整合了来自200多个经济体的劳动力调查与行政记录数据。2014年至2025年间,针对欧洲32个国家的就业数据,ILO依据第19届国际劳工统计学家会议(ICLS)的分类标准,发布了按性别与职业(ISCO-08第二层级)划分的就业人数统计。该数据集由Electric Sheep Europe于2025年重新打包并发布在HuggingFace平台,共包含42,280条观测记录,旨在为欧洲就业结构的跨时间、跨国别与跨性别分析提供标准化、可复用的时序数据资源,进而支撑劳动经济学、社会分层与政策评估领域的研究。
当前挑战
当前数据集面临的挑战主要体现在三个方面。首先,在领域问题层面,就业数据的性别与职业交叉分析常受到分类体系不一致与方法论变更的干扰,数据集中的标注如“Break in series: Methodology revised”明确提醒了序列断裂风险,研究者需谨慎处理此类结构性变化以避免错误推断。其次,数据构建过程中,因各国统计机构采用不同的调查框架(如劳动力调查、家庭收入调查等),ILO虽筛选“最佳来源”进行协调,但数据源异构性仍导致部分观测值被标记为“不可靠”,影响整体质量评价。此外,原始数据仅提供年度频率,忽略了更细粒度(月度或季度)的波动信息,限制了高频经济动态分析的适用性。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集为分析欧洲32国按性别和职业(ISCO第二层级)划分的就业结构提供了宝贵的时间序列资源。其最经典的用法在于构建面板数据模型,以探究2014至2025年间不同国家劳动市场的演变轨迹。研究者常借助其中的观测值,结合性别维度,揭示职业性别隔离的动态特征,比如通过性别与职业类别的交叉分析,量化女性在特定职业中的参与率随时间的变化。此外,该数据集也作为基准输入,服务于时序预测任务,用于训练模型预测未来各职业类别的就业趋势,为劳动力规划提供数据支撑。
衍生相关工作
基于该数据集,国际劳工组织(ILO)及众多研究机构衍生了一系列经典工作。一方面,数据集常被用于构建职业流动性的马尔可夫模型,预测劳动力在性别与职业类别间的转移概率,从而量化技术进步对特定职业群体的冲击。另一方面,它催生了融合地理信息与时间序列的协同过滤推荐系统,通过分析国家间相似的就业模式,为缺失值较多的区域提供数据插补算法。在学术文献中,围绕该数据集的变体被用于验证基于梯度提升树的就业预测方法,以及评估疫情前后欧洲劳动力市场的韧性。这些衍生工作共同推动了劳动经济数据科学与公共政策分析的融合。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲32国2014至2025年间按性别和职业分类(ISCO-08二级编码)的就业数据,是ILOSTAT劳动统计体系的重要组成部分。当前研究前沿主要围绕劳动力市场性别结构差异、职业分层与就业形态演变展开,尤其在欧洲数字化转型与绿色经济转型交织的背景下,该数据为量化分析不同职业群体的就业弹性、性别就业鸿沟变迁以及政策干预效果评估提供了关键支撑。结合ILO推动的体面劳动议程和欧洲就业战略,该数据集有助于揭示新冠疫情期间及疫后复苏阶段职业结构调整的微观机制,服务于可持续发展目标(SDG 8)中关于充分就业与机会均等的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务