遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-oc2-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计信息,专门针对欧洲37个国家,时间跨度为1992年至2025年。数据集核心指标为HOW_TEMP_SEX_OC2_NB,即按性别和职业(ISCO 2级)分类的就业人员实际平均每周工作小时数。数据集包含103,348个观测值,涵盖了就业人员工作时间的详细分类数据,按性别(总计、男性、女性)和职业类别进行分解。数据来源于各国劳动力调查等官方统计,经过ILO统一协调处理,以确保国际可比性。数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究人员和开发者提供欧洲劳动力市场的标准化、机器学习友好的数据层。

This dataset contains statistical information from the International Labour Organization (ILO) ILOSTAT database, focusing on 37 European countries from 1992 to 2025. The core indicator is HOW_TEMP_SEX_OC2_NB, which represents Mean weekly hours actually worked per employed person by sex and occupation - ISCO level 2. It includes 103,348 observations of detailed disaggregated data on working hours for employed persons, broken down by sex (total, male, female) and occupational categories. The data is sourced from official statistics such as national labour force surveys, harmonized by the ILO for international comparability. The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and is designed to provide a standardized, ML-ready data layer for European labour market analysis.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-oc2-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT权威统计数据库,通过REST API接口直接拉取指标代码为HOW_TEMP_SEX_OC2_NB的原始数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT对各国劳动力调查、家庭收入调查等微数据,依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,确保跨国可比性。数据来源的标注字段(source.label)为每条记录提供了可追溯的原始依据。Electric Sheep Europe团队进一步将数据重新打包为Parquet格式,并上传至HuggingFace平台,以机器学习就绪的格式呈现,简化了研究者的使用流程。
特点
本数据集收录了1992年至2025年间37个欧洲国家的103,348条观测记录,聚焦于按性别和职业(国际标准职业分类ISCO二级)分组的就业人员周平均实际工作小时数这一核心指标。数据按年度频率发布,并包含性别(总、男、女)这一细分维度。当同一国家年份存在多个数据来源时,数据集采用ILO选定的‘最佳来源’以确保数据质量。每条记录均附有观测状态标志和注释信息,便于用户评估数据的可靠性。整体而言,该数据集在时间跨度、地理覆盖和分类粒度上具有显著优势,为欧洲劳动力市场研究提供了珍贵的纵向资料。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并轻松转换为Pandas DataFrame进行后续分析。典型应用包括:按国家代码过滤以聚焦特定国家的时间序列;针对指标字段进行排序与可视化,揭示工作时间的历史演变趋势;利用透视表功能将数据重塑为国家×年份的矩阵形式,便于进行跨国比较或面板数据建模。数据集支持表格分类、回归以及时间序列预测等多种任务类型,适用于劳动经济学、社会学及公共政策领域的定量研究。使用时需遵循CC-BY-4.0许可协议,并正确引用原始ILO数据及Electric Sheep Europe的重新打包版本。
背景与挑战
背景概述
随着全球劳动力市场的复杂化与欧洲经济一体化进程的加速,精准捕捉不同国家、性别及职业层级的劳动时间投入对于制定科学就业政策、评估工作条件及预测经济走势至关重要。在此背景下,国际劳工组织(ILO)依托其权威的ILOSTAT数据库,并联合Electric Sheep Europe团队,于2025年创建了该数据集,汇聚了1992年至2025年间37个欧洲国家的103,348条观测数据。该数据集聚焦于“按性别和职业(ISCO-2级)划分的受雇人员每周实际工作平均小时数”这一核心指标,通过整合各国劳动力调查等官方数据来源,首次为跨国的劳动时间动态比较提供了高分辨率、结构化的量化基础。其发布极大地推动了劳动经济学、职业健康研究以及欧洲社会政策分析领域的实证探索,成为评估劳动力市场效率与性别平等进程的重要基准。
当前挑战
该数据集所解决的领域核心问题在于,欧洲各国在劳动时间统计口径、职业分类标准(如ISCO-08)的采纳程度以及调查方法上存在显著差异,导致跨国与跨时段的直接比较充满挑战。此外,原始数据常面临年度不连续、部分来源被标记为“不可靠”或“临时性”(如obs_status字段所示),增加了时间序列建模中的噪声与不确定性。在构建过程中,挑战主要源自ILOSTAT多源异构数据的统一整合:团队需从REST API获取原始数据后,过滤出欧洲国家子集,并协调不同来源(如劳动力调查与行政记录)间的定义冲突,同时处理观测值缺失、分类维度(性别、职业)的稀疏性问题。确保数据在保持细粒度(如ISCO-2级职业分类)的同时兼顾长时间跨度的可用性,亦是其构建中的重大难题。
常用场景
经典使用场景
在劳动经济学与跨国比较研究领域,欧洲各国按性别与职业分类的周均实际工时数据具有举足轻重的分析价值。该数据集汇集了1992年至2025年间37个欧洲国家的逾10万条观测记录,为研究者提供了罕见的细粒度纵向面板数据。最常见的应用场景包括利用时间序列模型追踪各国工时变迁的长期趋势,通过面板回归解析性别间工时差异的驱动因素,以及借助职业分类维度(ISCO-08二级编码)揭示不同职业群体在工作强度上的分化格局。基于这些数据,学者能够构建跨国比较框架,探讨欧洲一体化进程中劳动力市场制度的趋同与分异现象。
实际应用
在实际应用层面,该数据集是国际组织、国家统计机构及智库进行劳动力市场监测与政策评估的关键工具。例如,经济学家可利用其按性别和职业分解的工时数据,定期评估成员国在缩小性别就业差距方面的进展,并识别工时异常偏长的行业以优先开展职业健康干预。政策分析人员可将其与经济产出数据结合,计算单位工时的劳动生产率,为行业薪资谈判与工时立法调整提供量化支撑。此外,人力资源咨询公司可借助该数据构建跨国派遣人员的工时基准,优化员工福利与工作负荷管理策略,实现从宏观趋势到微观实践的转化应用。
衍生相关工作
围绕该数据集已衍生出多项标志性研究工作,典型代表包括利用ILOSTAT面板数据揭示东欧转轨国家市场化进程中工时分布的演变轨迹,以及基于职业分类维度分析自动化和机器人采用对不同技能群体周工作时间的替代或补偿效应。另有经典研究通过将性别与职业分层作为交互变量,解构欧洲‘第二班’现象(女性在职业工作与家务劳动间的时间分配)在国家间的异质性模式。在方法论层面,该数据集还催生了针对跨国面板中测量误差处理的工具变量策略,以及融合贝叶斯状态空间模型来平衡长时序数据在不连续采样下的推断一致性与预测精度的方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务