遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-age-geo-nb-employees-by-sex-age-and-rural-urban-areas-thousan

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)核心统计数据库ILOSTAT的欧洲雇员数据,涵盖37个欧洲国家从1987年至2025年的124,040个观察值。数据指标为EES_TEES_SEX_AGE_GEO_NB,即按性别、年龄和城乡区域划分的雇员数量(以千计)。数据集通过ILOSTAT REST API直接获取,并过滤为欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据列包括国家代码、国家名称、来源代码、来源标签、指标代码、指标标签、性别分类(总计、男性、女性)、年龄等分类变量、观测年份、观测值、观测状态标志及相关注释。数据为年度频率,当同一国家×年份有多个来源时,采用ILO选定的最佳来源。该数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层,采用cc-by-4.0许可证发布。

This dataset contains employee data from the International Labour Organizations (ILO) core statistics database ILOSTAT, covering 124,040 observations across 37 European countries from 1987 to 2025. The indicator is EES_TEES_SEX_AGE_GEO_NB, representing employees by sex, age, and rural/urban areas (in thousands). Data is pulled directly from the ILOSTAT REST API, filtered to Europe ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. Columns include country code, country name, source code, source label, indicator code, indicator label, sex disaggregation (total, male, female), classification variables such as age, observation year, observed value, observation status flags, and related notes. The data is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. Repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe, released under the cc-by-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-age-geo-nb-employees-by-sex-age-and-rural-urban-areas-thousan 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口提取指标EES_TEES_SEX_AGE_GEO_NB的原始观测记录,并依据ISO3国家代码筛选出37个欧洲国家。ILOSTAT遵循国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,数据经Electric Sheep Europe机构重新打包为可直接加载的Parquet格式,并保留来源标识以确保可追溯性。
特点
数据集涵盖1987年至2025年间124,040条年度观测,以千人为单位记录了欧洲37国按性别、年龄及城乡区域划分的雇员人数。其核心特点在于多维 disaggregation 结构,包含性别(总计/男/女)、年龄分类(如青年与成人)和地理覆盖(国家层面或城乡),同时附带观测状态标记、分类注释和来源注释等元数据,为细粒度劳动力市场分析提供了丰富的时空维度。
使用方法
研究者可通过HuggingFace的datasets库以load_dataset函数加载数据并转换为Pandas DataFrame,进而灵活执行筛选、时间序列分析与交叉表操作。例如,可针对特定国家(如德国)提取子集,或按指标代码筛选并排序后绘制时序趋势图,亦可利用pivot_table生成国家×年份矩阵以观察跨国差异,满足分类、回归及时间序列预测等多类任务需求。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的就业、失业、工资等核心指标。在此背景下,Electric Sheep Europe于2025年对ILOSTAT中员工按性别、年龄及城乡区域分类的数据进行重新封装,覆盖欧洲37国、1987至2025年间共124,040条观测记录。该数据集为劳动经济学、人口统计学及区域发展研究提供了精细化的微观面板数据,其核心价值在于支持性别与城乡维度的就业结构分析,助力政策制定者评估区域劳动力市场差异及社会包容性进展。
当前挑战
该数据集所应对的领域问题在于传统劳动力统计常忽视性别与城乡交叉维度的细粒度刻画,导致就业政策难以精准触达弱势群体。构建过程中的主要挑战包括:原始调查数据源自各国劳动力调查、家庭收入调查等异构渠道,指标定义与年龄分组标准存在跨国差异,需依赖国际劳工统计学家会议(ICLS)准则进行协调;部分观测值因样本量不足或方法变更而被标记为‘不可靠’或存在序列断裂,需谨慎识别;城乡分类的国别界定差异亦增加了跨国可比性难度。这些因素共同要求使用者在建模时充分考量数据质量与一致性风险。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集凭借其1987至2025年间覆盖37个欧洲国家、逾12万条观测值的精细粒度,构成了剖析劳动力市场结构变迁的经典面板数据源。研究者通常将其用于刻画不同性别与年龄组别就业人口在城乡地域间的分布格局,进而揭示欧洲一体化进程中就业结构的时空演化规律。
解决学术问题
该数据集为解答劳动力市场分割理论中的城乡差异与性别年龄交叉不平等问题提供了关键实证基础。其标准化协调的ILO统计口径有效缓解了跨国比较中的定义异质性问题,使学者能够系统检验经济转型、政策干预与人口老龄化对就业构成的差异化影响,推动了比较劳动经济学的方法论进步。
衍生相关工作
基于该数据集,学界衍生出一系列聚焦欧洲劳动力市场动态的经典研究,包括城乡就业差距的收敛性分析、性别就业比率的年龄队列效应以及区域经济韧性评估等。这些工作不仅丰富了ILOSTAT数据的应用场景,也催生了多项跨国比较预测模型与政策仿真工具的开发。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务