遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ocu-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家就业人口平均每周实际工作时间数据,具体指标为“HOW_TEMP_SEX_OCU_GEO_NB”,即按性别、职业和城乡划分的就业人口平均每周实际工作时间。数据集涵盖38个欧洲国家,时间跨度为1992年至2025年,包含127,320个观察值。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性)、职业分类、城乡分类、观测年份、观测值、观测状态等列。数据来源于ILOSTAT的REST API,经过过滤仅包含欧洲国家,并采用ILO的最佳来源选择方法。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究欧洲劳动力市场提供机器学习就绪的数据。

This dataset contains data on mean weekly hours actually worked per employed person by sex, occupation, and rural/urban areas in Europe, sourced from the International Labour Organizations (ILO) ILOSTAT database, specifically the indicator HOW_TEMP_SEX_OCU_GEO_NB. It covers 38 European countries from 1992 to 2025, with 127,320 observations. The data is organized in tabular format, including columns such as country code, country name, data source, indicator code, indicator label, sex disaggregation (total, male, female), occupation classification, rural/urban classification, observation year, observed value, and observation status. The data is retrieved from the ILOSTAT REST API, filtered for European countries, and uses ILOs best source selection. It is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, providing machine learning-ready data for European labor market research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ocu-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Europe团队整理与重包装。数据通过ILOSTAT REST API直接拉取,指标代码为HOW_TEMP_SEX_OCU_GEO_NB,并依据欧洲ISO3国家代码进行过滤。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,数据来源在source.label字段中予以标注,确保每一条观测值均可追溯其原始调查类型与来源机构。最终形成覆盖38个欧洲国家、时间跨度从1992年至2025年的127,320条观测记录,以表格形式存储,便于后续分析与建模。
特点
该数据集聚焦于欧洲就业人口的周平均实际工作时长,按性别、职业技能水平及城乡地理区域进行细致分层,提供高度结构化的多维度聚合指标。核心变量obs_value为浮点型连续数值,适用于时间序列预测与回归任务。数据集中包含丰富的分类维度,如sex(总/男/女)、classif1(技能等级)与classif2(区域类型),支持灵活的群体对比分析。此外,数据附有obs_status状态标志与note_indicator注解,帮助用户识别不可靠观测值及指标定义细节,提升了数据的可解释性与研究应用价值。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,将其快速转换为pandas DataFrame进行后续处理。针对特定国家,可利用ref_area字段进行筛选,例如提取德国(DEU)的全部记录。对于时间序列分析,可基于indicator字段固定指标后按time排序,直接绘制obs_value随时间的变化趋势。用户还可运用pivot_table方法将数据重塑为国家×年份的矩阵格式,便于进行跨国比较或面板数据分析。数据集的标准化Schema与Parquet格式存储,确保了高效的读取与计算性能,充分适配机器学习和统计建模工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe机构重新整理后发布于2025年,聚焦于欧洲38个国家1992年至2025年间按性别、职业及城乡分类的就业人员平均每周实际工作小时数。作为ILOSTAT全球劳动统计数据库的核心子集,该数据集源于各国劳动力调查与行政记录,经由国际劳工统计学家会议(ICLS)定义统一化处理,为劳动经济学、就业政策及可持续发展目标(SDGs)中的体面劳动指标提供关键数据支撑。其精细的维度划分与跨时三十余年的纵向覆盖,使其成为研究欧洲劳动力市场演变、性别平等与职业结构变迁的重要基准资源。
当前挑战
该数据集所应对的领域问题在于:传统劳动统计常以国家宏观均值形式呈现,掩盖了性别、职业类型及城乡区域间的结构性差异,难以精准刻画就业质量的异质性。本数据集通过多维度分组聚合,为揭示工作小时数的差异化模式提供了可能,例如职业技能层级与城乡地区对劳动供给的交互影响。在构建过程中,挑战主要源自多源数据的一致性与可比性:各国调研方法、样本框架及统计口径各异,ILO需通过‘最优来源’筛选与ICLS定义校准来消弭偏差;此外,部分观测值标记为‘不可靠’需审慎剔除,且季/月度数据未能纳入,限制了高频分析的适用性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中关于欧洲38个国家1992年至2025年间就业人员每周实际工作小时数的详细观测数据,涵盖性别、职业技能水平和城乡地域等多重维度。作为一项结构化的面板数据资源,它最经典的用途在于支持劳动经济学的实证研究——研究人员可借此构建跨国家、跨时间的回归模型,系统分析欧洲各国劳动工时模式的长期变迁趋势与结构性差异。通过对不同性别、职业群体的分离统计,该数据为探究劳动供给弹性、性别就业差距以及技能分层对工作时间的影响等核心议题提供了可靠的数据基础。数据的高频率年度覆盖和标准化指标设计,使得时间序列分析得以平滑展开,从而支撑对欧洲劳动力市场运行规律的深入刻画。
衍生相关工作
基于该数据集的高质量结构化特征,它已催生了一系列具有典范意义的衍生研究工作。一方面,研究人员将其纳入经典的面板计量分析框架,发展了关于欧洲国家间工时收敛性检验与职业性别隔离度量的统计模型,部分工作进一步引入机器学习回归器来捕捉非线性的劳动供给行为。另一方面,该数据也被用于构建宏观经济预警系统,结合GDP增长率、失业率等宏观变量,对劳动市场紧张程度进行时空预测。在数据科学领域,该数据集因其清晰的分类轴(性别、职业、地域)和多年度跨度的特性,常作为时序预测与多标签分类算法的基准测试用例,特别是在评估模型处理高维分类型特征的能力方面。此外,它还被整合到说明性数据可视化应用与交互式仪表板中,成为劳动经济学教学中阐明时间效应与群体差异的经典素材。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲38国1992至2025年间,按性别、职业及城乡划分的就业者实际周均工时数据,为劳动经济学与时间利用研究提供了高分辨率面板数据。当前前沿方向包括:利用该数据量化远程办公兴起对传统工时模式的冲击,结合疫情前后波动揭示劳动力市场结构性重塑;通过性别与职业交叉分析,探究行业性别隔离与工时弹性化的动态关系,尤其关注服务业与零工经济中的非标准工时扩散。此外,城乡维度使研究者得以评估区域发展政策对劳动供给的异质性影响,为欧盟‘工作权利指令’等热点法案的实证评估提供关键证据。其ILOSTAT官方源与年度观测的时序稳定性,亦支撑着机器学习模型对欧洲劳动力市场的长期预测与政策模拟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务