遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为工作时间。具体指标为按性别、职业和企业规模划分的就业人员实际平均每周工作小时数(指标代码:HOW_TEMP_SEX_OCU_EST_NB)。数据集涵盖10个欧洲国家(包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、捷克、希腊、意大利、北马其顿、摩尔多瓦、塞尔维亚、斯洛伐克),时间跨度为1993年至2025年,共包含54,919个年度观测值。数据通过ILOSTAT REST API获取,并经过欧洲国家代码过滤。数据集包含国家代码、指标代码、性别分类(总计、男性、女性)、职业分类、企业规模分类、观测年份、观测值、数据状态等列,适用于表格分类、回归和时间序列预测等任务。数据已由Electric Sheep Europe重新打包为机器学习就绪格式。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database on the topic of Hours of work. The specific indicator is Mean weekly hours actually worked per employed person by sex, occupation and establishment size (indicator code: HOW_TEMP_SEX_OCU_EST_NB). It covers 10 European countries (including Albania, Austria, Bosnia and Herzegovina, Czechia, Greece, Italy, North Macedonia, Moldova, Serbia, Slovakia), spanning the years 1993 to 2025, with a total of 54,919 annual observations. Data was pulled from the ILOSTAT REST API and filtered to Europe ISO3 country codes. The dataset includes columns for country code, indicator code, sex disaggregation (total, male, female), occupation classification, establishment size classification, observation year, observed value, data status flags, and is suitable for tasks like tabular classification, regression, and time-series forecasting. It has been repackaged by Electric Sheep Europe into a machine-learning-ready format.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ocu-est-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT统计数据库构建,通过其REST API直接提取指标代码为HOW_TEMP_SEX_OCU_EST_NB的原始数据,并依据ISO3国家代码筛选出涵盖10个欧洲国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义框架对各国劳动力调查、住户收入调查及行政记录等微观数据进行统一协调与标准化处理,确保了跨国数据的一致性与可比性。数据集以年度频率呈现,由Electric Sheep Europe团队重新打包为机器学习友好的格式,每条观测均附带来源标识以实现溯源。
特点
该数据集包含54,919条观测,覆盖10个欧洲国家,时间跨度从1993年至2025年,核心指标为按性别、职业和单位规模划分的受雇人员每周实际工作平均小时数。数据通过丰富的维度进行解聚,包括性别(总、男性、女性)、职业技能等级以及单位规模分类,支持多角度分析。其Schema设计完整,包含地区、来源、指标、分类变量及观测状态等字段,并采用CC-BY-4.0许可协议开放,兼具高地域集中度与长时间序列特性,为欧洲劳动市场的时间序列分析与面板数据研究提供了坚实的数据基础。
使用方法
该数据集可通过HuggingFace Datasets库直接加载,使用`load_dataset`函数获取后转为Pandas DataFrame进行操控。研究人员可按国家代码筛选特定地区数据,或利用'indicator'列针对单一指标按年份排序以进行时间序列分析与可视化。亦可利用Pivot操作将数据重塑为国家×年份的矩阵形式,便于进行跨国比较或面板数据建模。数据集在HuggingFace上以Parquet格式发布,一行代码即可完成加载,极大降低了劳动统计数据的获取与预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Europe重新封装后托管于HuggingFace平台,聚焦欧洲10个国家1993至2025年间按性别、职业及企业规模划分的就业者周均实际工作小时数。作为ILOSTAT数据库的子集,该数据源自国家劳动力调查与行政记录,严格遵循国际劳工统计学家会议(ICLS)定义进行整合,共计54919条观测,为劳动经济学、工时与生产率关系、性别就业差异及欧盟劳动力市场结构性变迁研究提供了高粒度的时序面板数据。其标准化的指标结构与跨年度、跨国别的覆盖,使其成为比较劳动政策效果与评估体面工作进展的重要基准资源。
当前挑战
该数据集面临的挑战呈现多维性:核心领域问题在于如何从宏观统计中剥离出工时变动的真实驱动因素——包括但不限于非正规就业的隐性工时、家庭照料责任对性别差异的扭曲以及企业规模与行业数字化程度对工作模式的异质性影响,这些交织因素使得基于聚合数据的回归分析极易陷入生态谬误。构建过程中,ILO虽采用ILO选定的“最佳来源”以消解同一国家同年份的多源冲突,但不同国家劳动力调查的调查框架、时点安排与定义偏差(如“实际工作小时数”对带薪休假与无薪加班的界定分歧)仍残存于标识列中;此外,部分年份缺失月度或季度序列,且职业与企业规模的分层编码在各调查间未完全对齐,这要求使用者必须自行处理断点衔接与分类归并工作。
常用场景
经典使用场景
该数据集聚焦于欧洲十国按性别、职业及企业规模划分的雇员平均每周实际工作小时数,涵盖1993年至2025年的年度观测数据,共计逾五万条记录。其最经典的用途在于构建时间序列预测模型,用以分析劳动力市场中工作时间的长期演变趋势与结构性波动。研究者可借助该数据集的细粒度分类维度(如性别、职业技能等级、企业规模)进行多组对比分析,进而揭示不同人群与行业间工作负荷的差异格局。此外,该数据也为区域劳动力政策的量化评估提供了基准时序依据,常用于面板数据回归、差分分析及因果推断等计量经济学方法。
解决学术问题
该数据集解决了劳动经济学与社会政策研究中一个核心痛点:跨国、跨年度且具备统一口径的工时微观统计数据的缺失。基于国际劳工组织(ILO)的标准化定义与各国劳动力调查,该数据使得研究者得以系统性地探索工作时间在性别之间的不平等演化、职业分层对工作时长的影响机制,以及企业规模在工时安排中的调节效应。这些分析为理解欧洲劳动力市场的结构性变迁、评估劳动法规与福利政策效果提供了坚实的实证基础,推动了关于工作强度、工作与生活平衡以及性别平等议题的跨国比较研究。
衍生相关工作
该数据集衍生的相关经典工作主要集中于基于ILOSTAT指标的跨国劳动力计量建模领域。依托此数据,研究者已构建了多种统计与机器学习模型,例如利用面板固定效应模型量化性别工资差距中工时差异的贡献度,或通过聚类分析识别欧洲各国工时模式的区域集群。在深度学习方面,长短时记忆网络(LSTM)等时序模型被用于预测特定职业群体的未来工时走势,并与经济景气指标进行关联分析。此外,该数据常被用作验证工资-工时替代弹性理论假说的实证基础,其细粒度的分类设计为后续开发异质性劳动供给模型提供了标准化的训练与测试基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务