遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲劳动力市场数据,具体指标为按性别、公共/私营部门和婚姻状况划分的每个就业人员实际平均每周工作小时数。数据集涵盖13个欧洲国家(包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、瑞士、西班牙、英国、马其顿、法国、希腊、摩尔多瓦、黑山、塞尔维亚、斯洛伐克),时间跨度为1987年至2025年,共包含18,460个观测值。数据以表格形式组织,包含国家代码、来源、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值(平均每周工作小时数)等字段,适用于表格分类、回归分析和时间序列预测等机器学习任务。数据集由Electric Sheep Europe重新打包,采用CC-BY-4.0许可协议。

This dataset contains European labour market data from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Mean weekly hours actually worked per employed person by sex, public/private sector and marital status. It covers 13 European countries (including Albania, Austria, Bosnia and Herzegovina, Switzerland, Spain, United Kingdom, North Macedonia, France, Greece, Moldova, Montenegro, Serbia, Slovakia) spanning the years 1987 to 2025, with 18,460 observations. The data is organized in tabular format, including fields such as country code, source, indicator code, sex disaggregation (total, male, female), time (year), observed value (mean weekly hours worked), and is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Europe and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取指标‘HOW_TEMP_SEX_INS_MTS_NB’的原始数据,并依据欧洲ISO3国家代码进行筛选与地域限定。数据采集范围覆盖13个欧洲国家,时间跨度从1987年至2025年,共收录18,460条观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准化方法对各国劳动力调查微观数据进行协调处理,最终呈现为结构化表格数据。Electric Sheep Europe团队对原始数据进行重新封装,统一了数据模式并转换为Parquet格式,确保数据集的易用性与机器学习就绪性。
特点
该数据集的核心聚焦于‘按性别、公共/私营部门及婚姻状况划分的受雇者人均实际每周平均工作时长’这一单一指标,但提供了丰富的分类维度。数据包含性别(总、男性、女性)、制度部门及婚姻状况等精细分类变量,同时附有数据来源标签与观测状态标记(如‘不可靠’),便于用户进行质量筛查。时间序列覆盖近40年,使研究者能够捕捉长期劳动工时演变趋势。所有观测均采用年度频率,且当同一国家-年份组合存在多来源时,数据集仅保留ILO选定的‘最佳来源’,保证了数据一致性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,将其转换为pandas DataFrame进行后续分析。典型操作包括按国别代码过滤特定国家的时间序列、针对单一指标按时间排序并可视化其观测值,或利用pivot_table将数据重塑为国家×年份的二维矩阵以进行跨区域比较。数据集的列名和标签均遵循ILOSTAT标准命名规范,所有分类变量以代码和英文标签成对呈现,便于程序化处理与理解。研究者应当注意观测状态标记,对标记为‘不可靠’的数据审慎使用,并引用原始ILO数据及Electric Sheep的重新封装成果。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年整理并发布在HuggingFace平台。它聚焦于欧洲13个国家1987年至2025年间按性别、公共/私营部门及婚姻状况划分的受雇者周均实际工作小时数,共包含18,460条观测记录。作为ILOSTAT数据库的重要子集,该数据旨在为劳动经济学研究提供标准化的跨国时间序列数据,支持对欧洲劳动力市场结构、性别差异及工作模式的深入分析。其发布显著提升了欧洲劳动统计数据的可获取性与机器可读性,为政策制定者、经济学家和数据科学家提供了可靠的分析基础。
当前挑战
该数据集所应对的领域挑战包括:劳动经济学中跨国、跨时期工作小时数据的可比性不足,以及按性别和婚姻状况分层的微观数据缺乏系统性整合。传统劳动力调查常因定义差异(如不同国家对‘实际工作小时’的界定)导致研究结果偏差。构建过程中,数据清洗需面对多源调查的原始数据格式不一致、缺失值处理(如某些国家年份数据稀疏)以及ILO不同版本统计规则的兼容问题。此外,元数据标准化(如分类变量‘classif1’和‘classif2’的语义对齐)和数据质量标记(如‘obs_status’字段中的‘不可靠’标识)的准确解析也是关键难点。
常用场景
经典使用场景
该数据集的核心应用场景聚焦于劳动经济学与人口统计学领域的交叉研究,尤其适合探究欧洲各国劳动者平均每周实际工作时长的时空演变规律。凭借其覆盖1987年至2025年、横跨13个欧洲国家的丰富观测数据,研究者能够利用时间序列分析、面板数据回归或多层线性模型,深入解析性别、公私部门归属以及婚姻状况等维度对工作时长的异质性影响。经典用法之一是将性别与婚姻状况作为交互变量,构建解释性模型以揭示结构性差异;另一种典型应用是通过国家层面的固定效应模型,剥离宏观经济周期与劳动政策变迁对工作时长的净效应。由于数据经过国际劳工组织的标准化处理,使用者可直接进行跨国比较,避免因各国统计口径差异带来的偏误,为理解欧洲劳动力市场的动态演化提供了可靠基石。
衍生相关工作
围绕该数据集已衍生出多条具有影响力的研究路径与工具链。在方法论层面,研究者基于其多维度分层结构开发了缺失值插补算法与跨时间序列对齐技术,推动了劳动统计面板数据的清洗与标准化流程。在理论研究方面,一系列论文利用该数据验证了工作时间与生产率之间的倒U型关系,并量化了数字技术普及对欧洲各国法定工时与实际工时差距的缩小效应。在应用工具领域,开源社区借助该数据构建了若干交互式可视化仪表盘,允许政策制定者实时对比不同性别与婚姻状态群体的工时分布,例如欧洲劳动观察平台的核心模块即以此数据集作为底层支撑。值得关注的是,该数据还常与教育水平、行业分类等社会经济指标结合,催生了关于技能错配与工作时间损失之间的计量经济学新模型。
数据集最近研究
最新研究方向
在劳动经济学与时间利用研究的交汇地带,该数据集聚焦于欧洲13国1987至2025年间按性别、公私部门及婚姻状况划分的周实际工作小时均值,为解析后疫情时代工作模式演变与性别平等议题提供了高颗粒度时间序列证据。当前前沿方向集中于运用因果推断与面板数据方法,揭示数字技术渗透、远程办公常态化及劳动力市场制度变革对周工时的异质性冲击。尤其值得关注的是,该数据可支撑对“零工经济”与灵活雇佣安排如何重塑传统标准化工作周假设的实证检验,并在欧洲性别薪酬差距与工作—生活平衡政策评估中发挥关键作用。其覆盖近四十年跨周期波动的特性,亦为机器学习模型预测劳动力供给弹性及结构性失业风险提供了坚实训练基础,凸显出ILO国际可比统计框架在跨国比较研究中的不可替代价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务