遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的工作时间数据,具体指标为按性别、公共/私营部门和婚姻状况划分的雇员实际平均每周工作小时数。数据集覆盖13个欧洲国家(包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、法国、希腊、北马其顿、摩尔多瓦、黑山、塞尔维亚、斯洛伐克、西班牙、瑞士、英国),时间跨度为1987年至2025年,共包含18,412条观测记录。数据通过ILOSTAT REST API获取,并经过欧洲国家代码过滤,ILO使用国际劳工统计学家会议(ICLS)定义对原始调查微数据进行标准化处理。数据集包含多个字段,如国家代码、来源、指标、性别分类(总计、男性、女性)、时间(年份)、观测值(平均每周工作小时数)、数据状态标志等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源,以及分类列仅在指标发布细分数据时非空。

This dataset contains working hour data sourced from the ILOSTAT database of the International Labour Organization (ILO). The specific indicator is the actual average weekly working hours of employees, categorized by gender, public/private sector, and marital status. It covers 13 European countries including Albania, Austria, Bosnia and Herzegovina, France, Greece, North Macedonia, Moldova, Montenegro, Serbia, Slovakia, Spain, Switzerland, and the United Kingdom, with a time span from 1987 to 2025, comprising a total of 18,412 observational records. The data was acquired via the ILOSTAT REST API, filtered using European country codes, and the original survey microdata was standardized by the ILO in accordance with the definitions established by the International Conference of Labour Statisticians (ICLS). The dataset includes multiple fields such as country code, data source, indicator, gender classification (total, male, female), time (year), observed value (average weekly working hours), data status flag, and others, which is applicable for tasks including table classification, regression, and time series forecasting. The data is released at an annual frequency and includes data quality annotations, such as the utilization of the best-selected sources by the ILO, and that categorical columns are non-empty only when the indicator publishes disaggregated data.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库构建而成,原始数据源自各国劳动力调查、家庭收入调查、机构调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。数据通过ILOSTAT REST API直接采集,并依据欧洲ISO3国家代码进行地理范围过滤,最终聚焦于13个欧洲国家。Electric Sheep Europe团队将原始数据重新打包为Parquet格式,并统一了数据模式,确保了数据集的机器学习就绪性。数据集包含18,412条观测记录,覆盖1987年至2025年的时间跨度。
特点
该数据集的核心特色在于其精细的维度划分与高结构化特征。其指标为“按性别、公共/私营部门及婚姻状况划分的雇员平均每周实际工作小时数”,通过sex、classif1、classif2等分类列提供了性别(总计、男性、女性)、机构部门及婚姻状况等多重维度的分解数据。此外,数据集保留了来源标识(source.label)和观测状态标志(obs_status),便于用户进行数据溯源与质量评估。数据频率为年度,并遵循CC-BY-4.0许可协议开放使用。
使用方法
用户可通过HuggingFace Datasets库便捷调用,只需执行`load_dataset("electricsheepeurope/europe-ilo-how-xees-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employee-by")`即可加载数据,并转换为Pandas DataFrame进行后续分析。典型应用包括:按国家代码筛选特定区域的时间序列数据,利用pivot_table构建国家×年份矩阵以进行面板数据研究,或按指标排序并绘制趋势图。数据集的列模式清晰,支持分组、聚合及可视化等常见操作,适合用于时间序列预测、表格分类与回归等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Europe重新整理打包至HuggingFace平台。数据集聚焦于欧洲13个国家在1987至2025年间雇员实际工作周均小时数的统计,按性别、公共/私营部门及婚姻状况进行细粒度分层。作为劳动经济学与时间利用研究领域的关键资源,该数据为评估劳动力市场效率、性别分工差异及社会保障政策效能提供了时空可比的实证基础。ILO统计司基于国际劳工统计学家会议(ICLS)标准对各国劳动力调查微观数据进行协调,保证了跨国数据的一致性,使其成为分析欧洲劳动力市场结构性变迁的重要工具,对政策制定者及学术研究者具有广泛影响力。
当前挑战
数据集的核心挑战在于解决劳动力时间统计中的多维异质性问题:不同国家间劳动力调查的方法论差异(如问卷设计、抽样框架、数据采集频率)导致观测值可比性受限,需依赖ILO的协调整合机制处理数据结构断裂。此外,分类变量中的缺失值(如婚姻状况及机构部门细分的非完整覆盖)与观测状态标记(如“不可靠”标识)增加了时序分析的复杂性。构建过程中,数据清洗需严格遵循ILO REST API的规范化输出,协调13国自1987年以来跨度近40年的离散调查记录,同时处理年份粒度不一致(部分国家仅提供年度数据而未发布月度或季度序列)及来源变更引发的断点效应,以保证面板数据的连续性与统计可靠性。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集承载着对员工实际工作周均时长进行跨国、跨时段精细度量的核心功能。凭借1987年至2025年间覆盖13个欧洲国家的18,412条观测记录,它融合了性别、公共与私营部门以及婚姻状况等维度进行分解,使得研究者能够挖掘工作时间在不同社会群体间的分布差异与演变规律。经典的建模任务包括基于表格数据的分类与回归分析,以及时间序列预测,例如利用历史观测值构建自回归模型或结构方程模型,以解析经济周期、政策干预与人口结构变化对劳动供给的交互影响。这一设计为量化劳动经济学研究提供了高分辨率的数据基础。
实际应用
在实际应用层面,该数据集为政府统计机构、国际组织及政策智库提供了支撑劳动力市场动态监测与评估的可靠工具。例如,欧洲各国劳动部可依据性别与部门分解的工时数据,研判工作时间立法的实际执行效果,并分析公共部门就业改革的短期冲击。国际劳工组织自身亦能借助这些精细化的时序面板,追踪体面劳动目标下各国工作时间的趋同或离散态势。此外,劳工权益倡导机构在推动缩短法定工作时长的公共议程时,能够借由该数据集中婚姻状态与性别交叉维度的证据,更具说服力地论证政策对不同家庭结构的差异化影响,从而实现数据驱动的社会对话与精准施策。
衍生相关工作
围绕该数据集已衍生出多项具有影响力的研究工作,尤其是在劳动供给与时间利用的计量经济学领域。学者们利用这些规范化的面板数据构建了随机前沿工时模型以度量劳动生产率动态,或在面板向量自回归框架下评估经济周期冲击对不同性别及婚姻状态群体的非对称劳动供给反应。更深层的衍生工作包括开发混合效应模型,控制欧盟国家固定效应与年份趋势,以解析公共部门就业对私人部门工时标准的溢出效应。此外,该数据集还激励了将分类信息纳入机器学习预测模型的研究潮流,例如通过梯度提升树或元学习方法提升周工时短期预报的准确性,从而为劳动统计数据的实时更新与质量核查提供了方法学增量。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务