遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含54,446个观测值,涉及10个欧洲国家(包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、捷克共和国、希腊、意大利、北马其顿、摩尔多瓦、塞尔维亚和斯洛伐克),时间跨度为1993年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为工作时间,具体指标为按性别、职业和机构规模划分的员工每周实际平均工作小时数。数据集通过ILOSTAT REST API获取,并经过处理以仅包含欧洲国家数据。数据结构包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、职业分类、机构规模分类、年份、观测值、观测状态等列,提供了详细的元数据和分类维度,以便于分析和研究欧洲劳动力市场的工作时间趋势。

This dataset contains 54,446 observations across 10 European countries (including Albania, Austria, Bosnia and Herzegovina, Czech Republic, Greece, Italy, North Macedonia, Moldova, Serbia, and Slovakia), spanning the years 1993 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on Hours of work, with the specific indicator being Mean weekly hours actually worked per employee by sex, occupation and establishment size. The data is retrieved via the ILOSTAT REST API and filtered to include only European country codes. The dataset schema includes columns such as country code, country name, data source, indicator code, indicator name, sex disaggregation, occupation classification, establishment size classification, year, observed value, observation status, and more, providing detailed metadata and disaggregation dimensions for analyzing trends in working hours in the European labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于欧洲地区雇员每周平均实际工作小时数,并按性别、职业和机构规模进行细致划分。数据通过ILOSTAT REST API接口直接抓取,原始代码为HOW_XEES_SEX_OCU_EST_NB,随后依据欧洲ISO3国家代码进行筛选与整合。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动调查微观数据进行标准化处理,确保跨国家与跨时期数据的可比性。数据集共收录54,446条观测记录,覆盖1993年至2025年期间10个欧洲国家的年度数据,所有来源均在source.label字段中标注,便于用户追溯数据原始出处。
特点
本数据集以高维度细粒度拆解为突出特色,通过性别(男、女、总计)、职业技能等级及机构规模三个维度对每周实际工作小时数进行交叉分类,极大丰富了劳动经济分析的层次。数据集中包含丰富的元数据列,如观测状态标志(obs_status)、中断序列注释(note_indicator)等,为用户评估数据质量提供透明依据。此外,数据采用年度频率发布,并以ISO 3166-1 alpha-3国家代码标识地理位置,便于多国比较。整体数据结构经过Electric Sheep Europe团队的标准化重包装,以Parquet格式呈现,兼具科学研究的严谨性与机器学习的通用性。
使用方法
用户可通过HuggingFace的datasets库以一行代码加载该数据集:load_dataset("electricsheepeurope/europe-ilo-how-xees-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employee-by"),并直接将训练集转化为pandas DataFrame进行后续分析。典型操作包括按国家代码(ref_area)筛选特定国家数据,或针对单一指标(如HOW_XEES_SEX_OCU_EST_NB)按时间排序以绘制时间序列图。研究者亦可利用pivot_table函数将数据透视成国家×年份的矩阵格式,便于跨国家面板分析。数据集的列式设计使其适用于表格分类、回归及时序预测等多种机器学习任务,且所有字段均附有英文标签说明,降低使用门槛。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe于2025年重新整理并发布于HuggingFace平台。ILOSTAT是全球劳动统计领域的权威来源,汇集了来自200多个经济体的劳动力调查、行政记录等多源数据,经过国际劳工统计学家会议(ICLS)定义的标准进行协调统一。此数据集聚焦于欧洲10个国家(1993–2025年)的平均每周实际工作小时数,按性别、职业和机构规模进行细分,共计54,446条观测。其核心研究问题在于揭示不同人口属性与工作制度下的劳动时间差异,为劳动经济学、社会政策及可持续发展目标(SDG)中的体面工作指标提供实证基础。该数据集填补了欧洲区域精细尺度工时面板数据的空白,在学术研究、政策评估与国际比较中具有显著影响力。
当前挑战
该数据集在领域问题层面主要应对劳动时间异质性度量的挑战:不同国家间调查方法、统计口径与职业分类标准差异显著,导致跨国横向比较存在偏误;同时,工时数据受经济周期、产业结构变迁与政策干预的多重影响,分离结构性因素与周期性因素成为难点。在构建过程中,挑战集中于数据协调与质量控制:来自不同国家的原始调查数据需经过ILO繁琐的清洗与对齐流程,部分年份存在方法论修订导致的序列断点(如`note_indicator.label`标记的“Break in series”);缺失值、不稳定性标记(如`obs_status`中的“U”代表不可靠)以及多源数据冲突等问题要求严密的去重与最优源选择策略。此外,按性别、职业与机构规模细分产生的多维度交互,进一步加大了数据一致性与可追溯性的维护难度。
常用场景
经典使用场景
在劳动经济学与社会科学研究中,该数据集最经典的用途是开展跨国别、跨性别的工时差异对比分析。依托ILOSTAT官方统计框架,研究者可借助观测值中的性别、职业技能等级及企业规模等维度,系统刻画欧洲十国劳动者1993至2025年间每周实际工作时间的演变趋势。通过将原始数据重塑为时间-国家矩阵或按性别分类的面板结构,能够便捷地识别不同国家在劳动力市场制度、产业结构变迁与工作文化塑造下的工时模式异同。该数据集为验证工时收敛假说、评估灵活就业政策效果以及探究性别职业隔离对工作时长的影响提供了坚实的量化基础。
实际应用
在现实政策制定与商业决策中,该数据集展现出重要的应用价值。国际组织与各国劳工部门可利用其追踪并评估劳动保护政策对员工工作时长的实际影响,例如检验最高工时限制法规是否有效遏制了过度劳动现象,或评估弹性工时制度在制造业与服务业的执行差异。雇主联合会与工会可依据按性别和职业分层后的工时数据,协商更为公平的薪酬结构与排班制度。此外,跨国公司在制定欧洲区域用工策略时,能够借助各国不同企业规模下的工时特征,优化人力资源配置与合规风险管理,从而在保障劳动者权益的同时提升运营效率。
衍生相关工作
围绕该数据集衍生出的相关研究已形成较为丰富的学术生态。在方法论层面,学者们开发了基于该数据的缺失值插补算法与时间序列分解模型,用以处理ILOSTAT源数据中标注为‘不可靠’的观测值,提升了面板数据在政策评估中的稳健性。在实证层面,有多项工作利用此数据集检验了自动化技术对欧洲不同技能层次劳动者工时的挤出效应,以及新冠疫情前后远程办公普及对各职业类别工作强度的结构性重塑。此外,部分研究将本数据与ILO其他工资、就业指标相融合,构建了综合性的劳动力市场压力指数,推动了跨指标联合分析范式的成熟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务