遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1991年至2025年期间的460,293个观测值,主要指标为“按性别、职业和教育分类的每周实际平均工作时数”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集涵盖就业、工作时间等劳动统计信息,包括国家代码、年份、性别分类、职业和教育分类等维度,并提供了数据质量说明和使用示例。数据集以表格形式存储,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 460,293 observations of Mean weekly hours actually worked per employed person by sex, occupation and education across 38 European countries, spanning from 1991 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European countries. It covers labor statistics such as employment and working hours, including dimensions like country codes, years, sex disaggregation, occupation, and education classifications. The dataset provides data quality notes and usage examples, stored in tabular format, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
本数据集基于国际劳工组织(ILO)权威统计数据库ILOSTAT构建,通过其REST API接口直接抽取核心指标"HOW_TEMP_SEX_OCU_EDU_NB"(按性别、职业与教育划分的受雇人员周均实际工时)的原始数据,并依据欧洲ISO3国家代码进行地理区域筛选。在数据整合过程中,ILOSTAT依据国际劳动统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,同时保留源标签以追踪数据来源。最终由Electric Sheep Europe团队完成清洗、打包与重发布,形成包含460,293条观测记录的规整表格数据。
特点
该数据集汇聚了1991年至2025年间覆盖38个欧洲国家的长时间序列数据,聚焦于按性别、职业和教育程度分层统计的周均实际工时这一核心劳动力指标。数据架构清晰,包含国家、来源、指标编码、性别、两级分类变量、观测年份、数值及状态标记等关键字段,支持多维度交叉分析与时间序列建模。数据质量经过ILO质量认证,优先采用最优来源,并标记异常或不可靠观测值,确保研究的严谨性与可追溯性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数便捷加载数据集,并直接转换为Pandas DataFrame进行后续操作。支持按国家代码快速筛选子集,如独立分析德国(DEU)的工时演变;亦可针对单一指标按时间排序后绘制趋势图,或运用透视表构建国家×年份的数值矩阵,以进行跨区域横向比较或面板数据分析。这一设计显著降低了研究者获取和处理官方劳动力统计的门槛,适用于计量经济学、劳动社会学及政策评估等领域的实证研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Europe于2025年重新整理发布,聚焦于欧洲38个国家1991至2025年间按性别、职业与教育背景划分的就业者平均每周实际工作时长。作为ILOSTAT数据库的子集,该数据集依托ILO在劳动统计领域的权威地位,旨在为劳动经济学、社会政策与劳动力市场分析提供精细化的时间序列数据。其核心研究问题在于揭示不同人口特征群体在工作时间上的差异与演变趋势,尤其关注性别与技能结构对劳动供给的影响。通过整合国家劳动调查与行政管理记录,该数据集为跨国比较与纵向研究奠定了坚实基础,对理解欧洲劳动力市场动态、评估就业政策效果以及追踪可持续发展目标中的体面劳动指标具有重要推动作用。
当前挑战
该数据集面临的挑战首先源于劳动统计领域的复杂性:工作时间受经济周期、产业结构和制度政策等多重因素交织影响,而不同国家在调查方法、分类标准与数据质量上存在显著不均,使得跨国与跨时间序列的比较分析必须谨慎处理指标一致性与可比性问题。在构建过程中,数据整合面临从ILO的REST API抽取大量异构原始记录、依据ICLS定义进行规范化处理的艰巨任务,同时需应对缺失值、分类变量不一致(如职业与教育水平的编码差异)以及年度数据频率对揭示短期波动的限制。此外,对于部分国家与年份,数据来源的多重性与观测状态的标记(如不可靠或预估)进一步增加了模型训练与推断的不确定性,要求使用者具备扎实的数据清洗与验证能力。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集最为经典的使用场景是探究不同性别、职业与教育背景对实际周均工作时长的影响。研究者可借助其精细的分层维度,剖析各国劳动工时在数十年间的演变轨迹,从而揭示欧洲内部劳动力供给行为的异质性。通过时间序列建模或面板数据分析,能够追溯工时变化与宏观经济周期、政策调整之间的内在关联,为劳动经济学与人口统计学领域提供坚实的数据支撑。
实际应用
在实际应用层面,该数据集是国际组织、国家统计部门及政策智库制定与评估劳动法规的重要工具。例如,通过监测不同性别群体的工时波动,可为性别平等政策的效果评估提供量化依据;亦可用于行业联合会开展最低工时标准谈判时进行国际对标。此外,企业人力资源规划与跨地区劳动力资源调配也可借助该数据测算各国劳动力供给潜力,从而优化跨国用工策略。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作,其中最具代表性的是基于ILOSTAT数据构建的欧洲工资—工时联合供给模型,以及跨越国界的性别收入与工作时长差距的分解研究。此外,为应对其高维分类特征,部分研究者开发了专门的‘分类—回归’混合建模框架,并发表于劳动经济学顶级期刊。亦有团队将其与欧洲社会调查或欧盟统计局的收入数据结合,形成了更为完备的劳动力市场分析面板,推动了关联数据生态的成熟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务