遇见数据集

electricsheepeurope/europe-ilo-ged-phow-sex-hht-geo-nb-mean-weekly-hours-actually-worked-of-prime-age-emp

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际劳工组织(ILO)统计的欧洲27个国家从2000年至2024年的22,736个观测值,核心指标为主要年龄段就业人员按性别、家庭类型和城乡区域划分的实际平均每周工作时间。数据来源于ILOSTAT数据库,通过其REST API获取并过滤为欧洲国家数据,涵盖了就业、工作时间等劳动统计信息。数据集包含国家代码、年份、性别分类、家庭类型分类、城乡区域分类以及观测值等字段,适用于表格分类、回归分析和时间序列预测等机器学习任务。数据由Electric Sheep Europe重新打包,以标准化格式提供,便于使用HuggingFace的datasets库直接加载和分析。

This dataset contains 22,736 observations from 27 European countries spanning 2000 to 2024, with the core indicator being Mean weekly hours actually worked of prime-age employed persons by sex, household type and rural / urban areas. The data is sourced from the ILOSTAT database, the International Labour Organizations central statistics database, which harmonizes labor statistics from national surveys and administrative records. It includes fields such as country codes, years, sex disaggregation, household type classification, area type classification, and observed values. The dataset is repackaged by Electric Sheep Europe into a standardized format suitable for tabular classification, regression, and time-series forecasting tasks, and can be easily loaded via HuggingFaces datasets library.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ged-phow-sex-hht-geo-nb-mean-weekly-hours-actually-worked-of-prime-age-emp 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于欧洲27个国家中黄金年龄段就业者的周均实际工作时长。数据通过ILOSTAT REST API直接提取,并依据ICLS(国际劳工统计学家会议)定义对原始调查微观数据进行统一协调。Electric Sheep Europe团队进一步将数据范围限定至欧洲ISO3国家代码,并重新打包为便于机器学习研究的格式。数据集共包含22,736条观测记录,时间跨度为2000年至2024年,涵盖性别、家庭类型及城乡地域等精细分类维度,为研究欧洲劳动力市场时空演变提供了标准化、可复用的结构化数据基础。
特点
该数据集具有显著的结构化与多维分析特性。首先,单一核心指标——黄金年龄段就业者周均实际工作时长——通过性别(总计、男性、女性)、家庭类型及城乡区域进行交叉分解,形成层次清晰的分类体系。其次,27个欧洲国家长达25年的年度面板数据,支持跨国家、跨时期的纵向比较与时间序列分析。再者,数据标注了来源编码及可靠性状态字段,便于研究者追溯数据质量与进行敏感性分析。此外,所有分类变量均以标准化枚举值呈现,避免了多语言歧义,提升了跨数据集联用的便捷性与准确性。
使用方法
该数据集通过HuggingFace Datasets库实现即用式加载,用户仅需调用`load_dataset`函数即可获取完整的训练集,并将其转换为Pandas DataFrame进行后续分析。典型应用场景包括:针对特定国家(如德国)子集筛选以进行国别研究;按时间排序后绘制核心指标的时序趋势图;通过透视表将数据重塑为国家×年份的矩阵形式,便于进行面板数据回归或聚类分析。研究者亦可依据性别、家庭类型等分类变量进行细分探索,或结合外部经济数据开展因素关联分析。数据集格式规范,缺失值与质量标注清晰,适合直接用于统计建模与机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT统计数据库创建,并由Electric Sheep Europe团队在HuggingFace平台上重新整理发布,专注于欧洲27国2000至2024年间壮年就业者按性别、家庭类型及城乡区域划分的周均实际工作时长。作为全球劳动力统计的权威来源,ILOSTAT数据库整合了来自各国劳动力调查、家庭收支调查及行政记录的数据,并依据国际劳工统计学家会议(ICLS)标准进行统一协调,为劳动经济学、人口学及社会政策研究提供了坚实的数据基础。该数据集的核心研究问题在于揭示欧洲不同社会群体在劳动时间上的差异化模式,其跨年度、跨国别与多维度细化特征,显著提升了区域劳动力市场比较分析的精度与纵深感,对理解欧洲内部工作强度变迁、性别差异及家庭结构对劳动供给的影响具有不可替代的学术价值。
当前挑战
该数据集面对的领域挑战在于,现有劳动力统计数据常因各国调查方法与定义差异而难以直接比较,导致跨国分析中产生统计噪声;ILOSTAT虽致力于数据协调,但原生数据来源的异质性仍使得微观层面的工作强度衡量存在偏差,尤其是在区分实际工作时长与合同工时的模糊边界上,对精确建模提出了高要求。构建过程中,团队需从ILOSTAT的REST API中抽取特定指标(GED_PHOW_SEX_HHT_GEO_NB),并筛选欧洲ISO3国家代码,但原始数据中存在多个来源对同一国家—年份的观测值冲突,必须依赖ILO选定的“最佳来源”进行折中,这引入了主观判断的不确定性;此外,分类变量(如性别、家庭类型)中大量空值的出现,以及部分年份或国家观测稀疏导致的时间序列不完整,增加了数据清洗与插补的复杂性,使得最终数据集在保持统计代表性与数据连续性之间面临权衡。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,该数据集(欧洲黄金年龄就业者按性别与家庭类型划分的平均周实际工时数据)是分析欧洲劳动力市场运行规律的基石。其经典使用场景涵盖多维度的横向与纵向比较研究,例如借助性别、家庭类型及城乡地域的精细分层,系统考察不同社会群体在工时供给上的异质性模式。研究者可运用此面板数据开展固定效应回归或生存分析,以揭示家庭责任分配、性别角色分工以及地域发展差异如何塑造就业者的劳动时间决策。数据集覆盖27个欧洲国家长达24年的序列,使其成为评估经济周期、政策干预(如产假制度或弹性工作制)对劳动力供给长期动态影响的理想对象。
实际应用
在实际应用层面,该数据集展现出广泛的决策支持价值。国际劳工组织(ILO)及各成员国劳动部门可利用其精准追踪各国黄金年龄就业者的工时演变趋势,作为评估‘体面劳动’核心指标(如过度劳动或工时不足)进展情况的客观依据。对于欧盟层面而言,这套数据是监测《欧洲社会权利支柱》行动计划中关于性别平等与工作生活平衡政策执行效果的量化工具。此外,企业人力资源部门与行业协会可借助跨国工时基准,校准所在行业的标准劳动时间,优化全球供应链中的人力成本预测模型。在疫情后劳动市场重构的背景下,该数据还能辅助评估远程办公等新型工作模式对不同家庭类型就业者工时的实际冲击,为制定更具包容性的劳动力复苏策略提供科学锚点。
衍生相关工作
该数据集的发布催生了一系列具有深远影响的前沿研究工作。在方法论层面,其丰富的时间序列和分层结构为机器学习领域的时序预测与面板数据建模提供了优质的基准测试集,研究者已基于此开发出针对多国家多群体工时趋势的层级注意力网络(HAN)与混合频率回归模型,显著提升了在性别与家庭类型维度上的预测精度。在实证经济学领域,学者们利用该数据构建了‘欧洲工时弹性空间指数’,用以量化各国就业者应对经济冲击时的工时调节能力,该指数已被纳入多篇顶刊论文中用于分析劳动市场韧性的制度决定因素。此外,数据驱动的聚类分析揭示了欧洲内部独具特色的‘工时—家庭类型’区域簇,为拓展福利资本主义多样性理论提供了新的经验证据,有力推动了比较政治经济学与劳动社会学的跨学科融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务