遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-age-ins-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家工作时间统计数据,具体指标为HOW_TEMP_SEX_AGE_INS_NB,即按性别、年龄和公共/私营部门划分的就业人员平均每周实际工作时间。数据集涵盖13个欧洲国家(包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、法国、希腊、马其顿、摩尔多瓦、黑山、塞尔维亚、斯洛伐克、西班牙、瑞士、英国),时间跨度为1987年至2025年,共包含38,049个观测值。数据以年度频率提供,并包含国家代码、数据来源、指标代码、性别分类、年龄分类、部门分类、观测年份、观测值、观测状态等详细列信息。数据集经过Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset contains hours of work statistics for European countries from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator HOW_TEMP_SEX_AGE_INS_NB, which represents the mean weekly hours actually worked per employed person by sex, age and public/private sector. It covers 13 European countries (including Albania, Austria, Bosnia and Herzegovina, France, Greece, Macedonia, Moldova, Montenegro, Serbia, Slovakia, Spain, Switzerland, United Kingdom), spanning the years 1987 to 2025, with a total of 38,049 observations. Data is provided at annual frequency and includes detailed columns such as country code, data source, indicator code, sex disaggregation, age classification, sector classification, observation year, observed value, and observation status. The dataset is repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-age-ins-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,聚焦于欧洲13个国家1987年至2025年间就业人员实际工作周均时长的追踪。通过直接调用ILOSTAT的REST API接口,抽取指标代码为‘HOW_TEMP_SEX_AGE_INS_NB’的原始数据,并依据欧洲ISO3国家代码进行地理筛选。数据整合过程中遵循国际劳工统计学家会议(ICLS)定义标准,对各国劳动力调查、住户收入调查等原始微观数据进行统一协调与清洗,最终形成包含38,049条观测记录的规范化表格。
特点
数据集以多维度细粒度见长,涵盖性别(总、男、女)、年龄分层及公共/私营部门等分类变量,同时提供丰富的元数据字段如数据来源、观测状态标记及注释信息,便于用户追溯数据质量。时间跨度为年度频率,覆盖了东欧、西欧及南欧多个经济体的长期劳动工时演变。每一观测值均附有ILO优先选择的‘最佳来源’标识,确保数据的一致性与权威性。此外,数据集以Parquet格式打包,兼容机器学习与时间序列分析场景,具备良好的可扩展性与重现代价。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型应用场景包括按国家筛选子集、生成特定指标的时间序列可视化,或利用pivot_table构建国家×年份的面板矩阵。对于分类与回归任务,可直接利用‘obs_value’作为目标变量,结合‘sex’、‘classif1’等维度构建特征工程。使用时应留意年度频率特性,并对‘obs_status’标记为‘U’(不可靠)的观测值做适当过滤。引用时需注明ILO与Electric Sheep Europe的再包装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年通过其核心统计数据库ILOSTAT构建,并经Electric Sheep Europe团队在HuggingFace平台上重新封装发布,旨在提供欧洲13个国家自1987年至2025年间按性别、年龄及公共/私营部门分层的就业人员实际周平均工作时长数据。作为全球劳动统计的权威来源,ILOSTAT整合了各国劳动力调查、住户收入调查及行政记录等多元数据源,通过国际劳工统计学家会议(ICLS)定义进行标准化处理,为研究欧洲劳动力市场的时间配置、性别差异及部门结构演化提供了跨时长达38年的纵向观测基础。该数据集涵盖38,049条观测记录,包含希腊、瑞士、西班牙等多样化的欧洲经济体,其精细的分层维度(性别及制度部门)使其在劳动经济学、社会政策评估及跨国比较研究中具有显著价值,尤其为分析工作时间的长期趋势、经济周期响应及制度变迁效应提供了可靠的数据支撑。
当前挑战
该数据集面临的挑战主要体现在劳动统计领域的内在复杂性及数据构建过程中的整合难题。在领域问题层面,准确测量就业人员实际工作时长需应对不同国家间统计口径的差异、自报数据的主观偏差以及非正规就业的隐蔽性,同时性别与年龄分层揭示的结构性不平等(如女性因家务负担导致的工时缩减)要求模型具备对多维异质性的捕捉能力。在构建过程中,ILO需从不同来源的调查数据中通过ICLS定义进行协调统一,处理数据来源标识(source.label列)的追溯问题,并应对部分国家或年份观测值质量标记为“不可靠”(obs_status=U)的数据缺陷。此外,多源数据融合导致的时间序列不连续性——例如希腊(1987-2020)与瑞士(1996-2025)的覆盖窗口差异——以及分类维度(性别、年龄、行业)的稀疏性,使得跨国动态比较与缺失值插补成为方法学上的重要挑战。
常用场景
经典使用场景
欧洲劳动力市场中,不同性别、年龄及公共或私营部门从业者的实际周平均工作时间是衡量劳动强度与用工模式的关键指标。该数据集汇集了1987年至2025年间来自13个欧洲国家的逾三万八千条观测记录,为研究者提供了一份弥足珍贵的时空对齐资料。其经典用途在于支持多维度的比较分析,例如揭示性别间工作时间的差异格局、追踪特定年龄群体随年代变迁的劳动供给变化,以及评估公共与私营经济部门在工作负荷上的结构性分野,从而为劳动经济学中的供给决策与制度效应研究奠定坚实的实证基础。
解决学术问题
在劳动经济学与社会政策研究领域,长期缺乏一套标准化、跨国可比的微观聚合数据来精准刻画欧洲各国的工作时间动态。该数据集有效解决了这一瓶颈,使学者能够跨国界、跨时期地检验关于工作时间性别差异收敛假说的经验证据,并量化公共部门就业政策对整体劳动供给弹性的影响。同时,其丰富的时间跨度与细粒度的分类属性,为探究技术进步、全球化冲击以及制度变革对平均工作时长的长期效应提供了理想的分析素材,从而深化了对欧洲劳动力市场运行规律与福祉分配机制的理论认知。
衍生相关工作
基于该数据集衍生出的学术工作主要聚焦于三大方向:一是利用其面板结构构建时间序列预测模型,如以长短期记忆网络或引力模型模拟国别与代际间的劳动供给变化趋势;二是结合其他社会经济指标(如GDP、失业率、性别工资差异)进行多变量因果推断,以揭示工作时间变动的内在驱动机制;三是启发研究者对数据维度进行再聚合与重构,例如按年龄段或行业门类生成鲁棒的统计基准,从而催生出一批针对欧洲特定区域(如南欧与北欧)或特定人群(如青年与女性)工作时间的专题性分析报告与比较研究论文。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务