遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-age-eco-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1991年到2025年关于“按性别、年龄和经济活动划分的就业人员实际平均每周工作时数”的统计数据,总计1,000,416个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集包括国家代码、来源、指标、性别(总计、男性、女性)、年龄分类、经济活动分类、年份、观测值等字段,并提供了数据质量说明,例如使用年度频率和最佳来源选择。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的欧洲劳动力市场数据。

This dataset contains 1,000,416 observations of Mean weekly hours actually worked per employed person by sex, age and economic activity across 38 Europe countries, spanning from 1991 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via REST API and filtered to Europe ISO3 country codes. It includes columns such as country code, source, indicator, sex (total, male, female), age classification, economic activity classification, year, observed value, and data quality notes (e.g., annual frequency and best source selection). The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and is designed to provide machine learning-ready labor market data for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-age-eco-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=HOW_TEMP_SEX_AGE_ECO_NB)直接抽取原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出38个欧洲国家。数据涵盖了1991年至2025年间的年度观测值,共包含1,000,416条记录。ILOSTAT基于国际劳动统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查、企业调查及行政记录中的微观数据进行统一整合与协调,并在source.label字段中标注了数据来源,确保了跨国家数据的可比性与审计追溯能力。整个流程由Electric Sheep Europe进行了标准化重封装,形成机器学习就绪的Parquet格式数据集。
特点
该数据集聚焦于一个核心指标——按性别、年龄及经济活动分类的受雇人员每周实际工作平均小时数,是劳动经济学研究中衡量工作时间模式的关键变量。其显著特征在于多维度的细分能力:sex字段支持对总人口、男性和女性的独立分析,classif1与classif2字段则分别提供年龄阶段与经济行业部门的分类视角,使研究者能够从人口统计学与产业结构两个层面深入挖掘工作时间的异质性。数据覆盖了38个欧洲国家长达35年的时间跨度,拥有超过百万条观测记录,为长期趋势分析、面板数据建模以及国际比较研究提供了高密度的时空数据基础。
使用方法
使用HuggingFace的datasets库可便捷加载该数据集,通过load_dataset("electricsheepeurope/europe-ilo-how-temp-sex-age-eco-nb-mean-weekly-hours-actually-worked-per-employed-per")即可获得训练集,并利用to_pandas()方法转换为Pandas DataFrame。借助ref_area字段可实现单国过滤,例如选取德国数据(DEU)。对于时间序列分析,可按indicator字段筛选特定指标后以time字段排序,绘制观测值随时间演变的序列图。此外,通过pivot_table操作可将数据重塑为国家×年份的矩阵形式,便于进行多国横向对比或面板数据回归分析,从而支持从宏观劳动力市场波动到微观群体工作行为差异的各类研究探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT整理,并经Electric Sheep Europe于2025年重新打包发布,旨在提供欧洲38个国家1991年至2025年间按性别、年龄及经济活动分类的从业人员平均每周实际工作小时数。作为劳动统计学领域的关键资源,ILOSTAT依托劳动力调查、家庭收支调查及行政记录等多源数据,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理,为研究欧洲劳动力市场的时间配置、性别差异及产业结构演变提供了高质量、细粒度的时序观测基础。该数据集以其超过百万条的观测记录和长跨度的覆盖范围,在劳动经济学、人口社会学及公共政策评估等跨学科研究中具有显著影响力,尤其支撑了对工作时间趋势、就业质量及体面劳动目标实现程度的实证分析。
当前挑战
核心领域挑战在于:欧洲各国劳动力数据在调查方法、季节调整规则及统计口径上存在差异,导致跨国比较时需处理来源标签的异质性及指标定义的非完全对齐,例如部分国家数据被标记为不可靠(obs_status为'U')需谨慎剔除。构建过程中面临的挑战包括:ILOSTAT原始API返回的多源数据中,同一国家与年份可能出现多个数据来源,需依赖ILO的'最佳来源'选择逻辑进行消歧;同时,分类维度(性别、年龄、经济活动)存在不同程度缺失,部分观测仅在特定细分层次有效,增加了数据清洗与重构的复杂度;此外,年度频率限制了短期波动分析,而月度或季度高频序列未被纳入,对政策响应的即时性研究构成数据粒度限制。
常用场景
经典使用场景
在劳动经济学与统计建模的交叉领域,欧洲各国按性别、年龄及经济活动分类的周实际工时可作为面板数据分析的核心变量。研究者常利用该数据集构建时间序列回归模型,探索工时与宏观经济指标(如GDP增长率、失业率)间的动态关联。借助38个国家跨越34年的长时序观测,学者可开展跨国比较研究,分析制度差异(如劳动法、福利政策)对工时的异质性影响。此外,该数据支持多维度分解分析,例如通过性别维度揭示女性劳动供给的时间弹性特征,或借助经济活动分类评估不同产业(制造业、服务业)的工时收敛趋势。
衍生相关工作
围绕该数据衍生了若干具有方法论贡献的研究成果。学界利用其细粒度分类构建了嵌套于随机前沿分析中的工时效率测量模型,揭示了欧洲各国全要素生产率中未观测到的劳动利用差异。另有工作结合人口普查数据,将性别与年龄维度投射到退休年龄改革模拟中,预测政策调整对中老年群体供给时间的挤出效应。同时,部分研究将时序分解方法(如Hodrick-Prescott滤波)应用于高频子样本,识别出分产业工时的趋势成分与周期成分,为结构性失业理论提供了新的间接验证路径。
数据集最近研究
最新研究方向
在当前欧洲劳动力市场深刻变革与工作模式多样化的背景下,该数据集聚焦于探究性别、年龄及经济活动类型如何塑造实际周工时分布,为劳动经济学与政策研究提供了高分辨率时序证据。前沿方向包括利用时间序列预测模型揭示后疫情时代工时恢复的非对称性,以及结合固定效应模型识别不同社会经济群体间的工时差异动态。该数据集与国际劳工组织ILOSTAT衔接,其百万级观测涵盖38国三十余年数据,使研究者得以追踪灵活就业、兼职经济与产业数字化对工时结构的重塑效应,为欧盟体面工作议程与性别平等政策提供了量化基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务