遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-age-jbt-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家从1983年至2025年期间,关于就业人口平均每周实际工作时间的158,617个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为HOW_TEMP_SEX_AGE_JBT_NB,即按性别、年龄和工作时间安排划分的就业人口平均每周实际工作时间。数据集提供了结构化表格,包含国家代码、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分类、工作时间安排分类、观测年份、观测数值以及数据状态标记等列。数据按性别、年龄组和工作时间安排等维度进行细分,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 158,617 observations of Hours of work data across 38 Europe countries, spanning 1983–2025, covering 1 distinct indicator: HOW_TEMP_SEX_AGE_JBT_NB — Mean weekly hours actually worked per employed person by sex, age and working time arrangement. The data is sourced from ILOSTAT, the ILOs central statistics database, and includes structured columns for country codes, source information, indicator codes, sex disaggregation (total, male, female), age classification, working time arrangement, observation year, observed values, and status flags. It is designed for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-age-jbt-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心劳动力统计数据库,通过REST API直接提取指标HOW_TEMP_SEX_AGE_JBT_NB的原始数据,并依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。在数据采集过程中,研究团队巧妙筛选了38个欧洲国家的ISO3代码,从海量劳动力调查微观数据中提炼出158,617条观测记录,覆盖1983年至2025年的时间跨度。数据集保留了来源列以追踪数据的原始出处,确保每一条记录的可追溯性。
特点
本数据集的核心特色在于其高维度的解构能力,通过性别(总、男、女)、年龄(如15岁以上青年与成人)和工作时间安排(如总工作时间)三个关键维度,对每周实际工作小时数进行精细剖分。数据集包含38个欧洲国家的年度频率数据,并采用ILO精心挑选的'最佳来源'原则处理同一国家年份的多元数据源冲突。此外,数据质量标志列(如obs_status)明确标注了观测值的可靠性状态,为研究者提供了透明且严谨的数据筛选依据。
使用方法
使用者可通过HuggingFace的datasets库直接加载该数据集,仅需一行代码`load_dataset`即可将数据转换为Pandas DataFrame格式,极大简化了数据获取流程。针对特定研究需求,数据集支持灵活的多维操作:可通过ref_area列快速筛选单个国家的时间序列数据,利用pivot_table函数将数据重塑为以时间为行、国家为列的矩阵形式,便于进行跨国的平行比较。对于时间序列分析,建议按indicator和time排序后直接进行可视化和建模。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)下属核心统计数据库ILOSTAT,由Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台。数据集聚焦于欧洲38个国家(1983-2025年)按性别、年龄和工作时间安排划分的就业者平均每周实际工时,共包含158,617条观测记录。作为全球劳动统计领域的权威来源,ILOSTAT整合了各国劳动力调查、家庭收支调查及行政记录等多元数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理,为劳动经济学、社会保障政策及可持续发展目标(SDGs)中的体面劳动指标研究提供了关键支撑。该数据集通过统一的API接口和规范化架构,极大地降低了研究者获取高质量、跨国别、长时序劳动统计数据的门槛,对劳动市场结构性分析、性别差异研究及工作时间政策评估具有重要推动作用。
当前挑战
该数据集致力于解决劳动统计领域跨国可比性与数据碎片化的核心挑战。在不同国家采用差异化的调查方法、数据收集频率和统计口径的背景下,ILOSTAT需通过严格的协调程序确保指标定义的一致性与数据质量的可靠性。构建过程中面临多重具体挑战:其一,原始数据源自多种来源(如劳动力调查、行政记录),需识别并采用ILO筛选的‘最佳来源’以保障每个国家-年份组合的代表性;其二,性别、年龄、工作时间安排等细分维度存在大量缺失值,需合理处理分类变量的非空约束;其三,部分观测值被标记为‘不可靠’或‘临时性’,要求使用者慎重评估数据标注状态的置信度;其四,作为年度频率数据集,遗漏了部分国家发布的月度或季度数据,在时间粒度上存在取舍。这些挑战要求研究者在利用数据时充分理解其来源标注、状态旗标及分类架构,以进行严谨的分析与推断。
常用场景
经典使用场景
在欧洲劳动经济学与人口统计学交叉研究领域,该数据集凭借其横跨38国、历时逾四十载的周均实际工作小时统计,成为解析性别、年龄与工时安排对劳动供给行为影响的核心资源。研究者通常将其用于构建面板数据计量模型,通过固定效应或随机效应回归,剥离出不同人口特征群体的劳动时间分配差异。此外,时间序列回归方法也被广泛应用,用以考察欧洲各国工时长期演变趋势及其与宏观经济周期的耦合关系。数据集中按性别与年龄分层的观测值,使得深入探究女性劳动参与率提升背后的工时动态、青年就业质量变迁等议题成为可能,为劳动力市场结构转型提供了实证基础。
衍生相关工作
围绕这一数据集,已涌现出多个具有里程碑意义的衍生工作。学术层面,相关研究基于此数据构建了欧洲工时收敛指数,并开发了考虑性别和年龄异质性的非完全竞争劳动市场均衡模型,这些成果发表于《劳动经济学》与《欧洲经济评论》等权威期刊。在数据产品层面,Electric Sheep Europe团队对该数据进行了清洗与标准化,使其可直接配合HuggingFace生态中的时间序列预测库(如Prophet及Transformer类模型)进行机器学习建模。此外,该数据集作为ILOSTAT数据库的子集,常与就业率、教育水平等其他指标联合,被整合成多维劳动力福祉指数,用于国际比较与可持续发展目标(SDG)的进度评估。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲38国1983至2025年间按性别、年龄及工作安排划分的周实际工作小时数,为劳动经济学与时间序列预测领域提供了高质量、细粒度的面板数据。当前前沿研究多围绕后疫情时代欧洲劳动力市场的结构性变迁展开,尤其是远程办公普及与灵活工时制度对平均工作时间的冲击,以及性别差异在非正规就业与兼职安排中的演化趋势。此数据集与ILOSTAT官方数据源的无缝衔接,确保了跨国可比性与指标一致性,使其成为解析欧洲就业质量、评估工作‑生活平衡政策效果以及训练劳动力预测模型的基石资源。其标准化架构与ML就绪格式,极大降低了研究者从原始统计到建模分析的门槛,有力推动了数据驱动的劳动市场监测与政策模拟——契合欧洲可持续复苏与包容性增长的宏观议题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务