遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和职业划分的雇员平均每周实际工作时间 | 欧洲 (ILOSTAT),包含51,388个观测值,覆盖39个欧洲国家,时间范围为1991年至2025年。核心指标为HOW_XEES_SEX_OCU_NB,即按性别和职业划分的雇员平均每周实际工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Electric Sheep Europe重新打包,以CC-BY-4.0许可证发布。数据集包含多个维度,如国家代码、数据来源、性别分类、职业分类、观测年份、观测值及状态标志等,适用于表格分类、回归和时间序列预测等自然语言处理任务。

The dataset is titled Mean weekly hours actually worked per employee by sex and occupation | Europe (ILOSTAT). It contains 51,388 observations across 39 European countries, spanning the years 1991 to 2025. The core indicator is HOW_XEES_SEX_OCU_NB, which represents Mean weekly hours actually worked per employee by sex and occupation. The data is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe, released under the CC-BY-4.0 license. It includes dimensions such as country codes, data sources, sex disaggregation, occupation classification, observation year, observed values, and status flags, suitable for tabular classification, regression, and time-series forecasting tasks in NLP.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)下属的ILOSTAT统计数据库,聚焦于欧洲地区雇员按性别和职业划分的实际周平均工作时间。数据通过调用ILOSTAT REST API直接抓取,筛选出欧洲39个国家的ISO3代码,并融合了各国劳动力调查、家庭收入调查及行政记录等多源数据。ILO统计局依据国际劳动统计学家会议(ICLS)定义对原始微观数据进行统一协调,在数据集中通过source.label字段标注数据来源,确保每一条观测的可追溯性。最终整合为包含51,388条观测、覆盖1991至2025年时间跨度的结构化表格,由Electric Sheep Europe团队重新打包为可供机器学习直接使用的格式。
特点
该数据集具有显著的时空广度与精细维度。在空间上涵盖39个欧洲国家,时间跨度长达35年,提供年度频率的连续观测,便于进行跨国家与跨时期的比较分析。核心变量为唯一的指标HOW_XEES_SEX_OCU_NB,但通过sex和classif1等分类维度实现多维度的数据拆分,sex包含总、男、女三种取值,classif1则涉及职业技能等级等细分。数据集还提供了丰富的元数据列,如观测状态标志(obs_status)、系列中断注释(note_indicator)及来源说明(note_source),有助于研究者评估数据质量与系列一致性。数据经ILO优选最佳来源后纳入,排除了同一国家年份的多源重复。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset()函数快速加载数据集,并转换为Pandas DataFrame进行探索性分析。针对国家层面的子集分析,可利用ref_area列进行过滤,例如筛选德国(DEU)的数据。对于时间序列分析,可按indicator和time列排序后绘制obs_value的变化曲线。如需构建多维面板数据,可通过pivot_table方法将数据重塑为以时间为行、国家为列的矩阵格式。该数据集兼容分类、回归和时间序列预测等多种任务,适用于劳动经济学中的工时趋势研究、性别差异分析以及职业结构变迁建模,为欧洲劳动力市场研究提供了即开即用的标准化数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年发布,依托其权威的ILOSTAT数据库,经Electric Sheep Europe重新打包发布至HuggingFace平台。数据集聚焦于欧洲39个国家1991年至2025年间按性别与职业划分的雇员实际周平均工时,共包含51,388条观测记录,以高效分析的表格格式呈现。其核心研究问题在于揭示不同性别与职业群体在工时投入上的差异与演变趋势,为劳动力市场分析、性别平等评估以及职业健康政策制定提供了关键的数据支撑。作为ILOSTAT中‘工时’主题的典型代表,该数据集在劳动经济学、社会学及公共政策研究领域具有重要影响力,尤其为跨国比较研究与时间序列分析奠定了坚实基础。
当前挑战
该数据集面临的挑战首先在于所解决的领域问题:不同国家与职业分类标准(如技能等级)的差异导致工时数据的跨国可比性不足,需要通过ILO的国际劳动统计学家会议(ICLS)定义进行协调统一,而数据来源标记(source.label)虽提升了可追溯性,但各国劳动力调查的抽样方法与统计口径仍存在隐性偏差。在构建过程中,数据整合需应对多源异构数据(如家庭调查、行政记录)的格式统一与缺失值处理,部分观测值的‘不可靠’状态标记(obs_status)也揭示了底层数据质量的不确定性。此外,年度频率限制了更高时间分辨率(如月度或季度)的分析,而ILO所选的所谓‘最佳来源’在部分国家与年份可能无法完全覆盖实际波动,为精准建模与预测带来挑战。
常用场景
经典使用场景
该数据集收录了1991年至2025年间39个欧洲国家按性别与职业划分的雇员每周实际工作小时数,共计51,388条观测记录。作为ILOSTAT官方统计数据的标准化重制版本,其经典使用场景集中于劳动力市场的时序分析与跨国比较研究。研究者常利用该数据构建面板数据模型,考察欧洲各国劳动时间的长期演进趋势,揭示性别与职业维度下的劳动供给差异,或结合宏观经济指标(如GDP、失业率)探讨工作时间的周期性波动特征。
衍生相关工作
该数据集直接衍生了一系列标志性学术产出与国际比较报告。ILO每年发布的《世界就业与社会展望》报告大量依赖此类数据刻画全球工时格局;学者在Labour Economics、European Journal of Industrial Relations等期刊上发表了基于ILOSTAT面板数据的实证论文,探讨工会覆盖率、技术变革与工时缩减的关系。此外,基于该数据训练的机器学习模型(如时序预测与分类模型)被用于预测劳动力市场变化,推动了计算社会科学领域工作条件分析的自动化与规模化发展。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲39个国家1991至2025年间不同性别与职业类别的雇员平均每周实际工时,为劳动经济学中的工时结构化差异研究提供了跨时跨国的精细化数据支撑。前沿研究方向正围绕后疫情时代工作模式的变革、性别间工时分布的不平等以及高技能与低技能职业之间的分化展开,尤其结合欧盟推出的《欧洲工作条件指令》等政策热点,通过时序分析与面板回归模型揭示工时缩减、远程办公常态化对劳动力结构的长远影响。数据集本身源于国际劳工组织(ILO)权威统计并经过高质量重整,为跨国比较与机器学习驱动的工时预测任务奠定了坚实基础,推动着对欧洲劳动力市场韧性及职业健康体系的系统性评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务