遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲两个国家(摩尔多瓦和塞尔维亚)在2007年至2025年间,按性别、机构规模和残疾状况分类的就业人员实际平均每周工作时数(指标代码:HOW_TEMP_SEX_EST_DSB_NB)的劳动统计信息。数据集共372条观测值,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤至欧洲国家,由Electric Sheep Europe重新打包为机器学习就绪格式。数据集涵盖国家代码、年份、指标值、观测状态、数据来源及分类维度(如性别、机构规模、残疾状态)等字段,适用于表格分类、回归分析和时间序列预测等任务。

This dataset contains labour statistics on mean weekly hours actually worked per employed person, disaggregated by sex, establishment size, and disability status (indicator code: HOW_TEMP_SEX_EST_DSB_NB), for two European countries (Moldova and Serbia) from 2007 to 2025. It includes 372 observations sourced from the International Labour Organizations ILOSTAT database, retrieved via its REST API and filtered to European countries, and repackaged by Electric Sheep Europe into a machine learning-ready format. The dataset features fields such as country codes, years, indicator values, observation status, data sources, and disaggregation dimensions (e.g., sex, establishment size, disability status), and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Europe团队重新打包处理。原始数据通过ILOSTAT REST API接口直接抽取,提取指标代码为'HOW_TEMP_SEX_EST_DSB_NB'的观测值,并依据欧洲ISO3国家代码进行地理区域筛选。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调与标准化处理,每项观测均附带来源标签以确保可追溯性。数据集共包含372条记录,覆盖摩尔多瓦与塞尔维亚两个欧洲国家,时间跨度为2007年至2025年,并以CSV格式整理,便于直接加载至数据科学工作流。
使用方法
用户可通过HuggingFace Datasets库便捷调用该数据集,一行代码即可加载为pandas DataFrame格式进行探索。典型应用场景包括筛选特定国家的观测值以进行时序分析,或按指标分组后按时间与地区字段生成透视矩阵,便于可视化趋势与比较差异。由于数据已包含分类变量编码,研究人员可灵活运用分组聚合、绘图等工具开展统计建模。数据集字段设计清晰,支持直接用于表格分类、回归以及时间序列预测等机器学习任务。建议在使用时结合原始ILOSTAT指标定义注释,以正确解读obs_value列的单位与含义,确保分析结果的准确性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,其核心研究问题聚焦于欧洲地区不同性别、企业规模及残疾状态下的就业人员实际每周平均工作时间的差异性。数据集源自ILOSTAT数据库,该数据库作为全球劳动统计的核心资源,通过整合各国劳动力调查、行政记录等多源数据,提供了2007年至2025年间涵盖2个欧洲国家(摩尔多瓦和塞尔维亚)的372条观测值。数据集由Electric Sheep Europe在2025年重新封装,以标准化格式发布在HuggingFace平台上,旨在为劳动经济学、社会政策及时间序列预测等领域的研究者提供即开即用的机器学习就绪数据,显著降低了跨国家、跨维度劳动指标分析的数据获取门槛。
当前挑战
该数据集所解决的领域问题涉及劳动经济学中工作时间指标的精准分解与比较分析,复杂之处在于不同国家统计体系存在定义偏差(如对“实际工作时间”的核算口径差异)、数据来源异构(劳动力调查与行政记录间存在覆盖偏差),以及缺失值处理等统计推断难题。构建过程中面临的主要挑战包括:整合来自不同国家、不同调查频率的原始数据时需遵循ILO国际劳工统计学家会议的统一定义进行标准化;指标的多维度拆解(性别、企业规模、残疾状态)导致细粒度分层数据稀疏,易引发模型过拟合;此外,部分观测值被标记为“不可靠”(如2025年数据),增加了时序建模与预测的噪声处理压力。
常用场景
经典使用场景
该数据集提供了欧洲国家按性别、企业规模及残疾状况细分的就业者实际周均工时数据,常用于劳动经济学领域的分类与回归任务,以及时间序列预测分析。研究者可借助其细粒度的分类维度,构建模型以探究不同人口特征群体的劳动供给行为差异。
解决学术问题
数据集解决了劳动时长分布异质性难以量化的问题,尤其填补了残疾人群工时参与研究的空白。通过对国际劳工组织标准化数据的重包装,它为检验性别平等政策效果、分析企业规模对工时的影响机制提供了可靠依据,推动了包容性劳动市场的数据驱动研究。
实际应用
在实际应用中,该数据集可辅助欧盟及各成员国劳动部门监测工时标准执行情况,评估就业质量。企业人力资源规划可基于不同性别与残疾状态员工的工时趋势优化排班策略,社会保险机构则能借助数据预测工伤风险与福利支出,提升政策制定精准度。
数据集最近研究
最新研究方向
在当前全球劳动力市场韧性议题备受关注的背景下,该数据集聚焦于欧洲地区按性别、企业规模及残疾状态分层的周均实际工时,为探究后疫情时代工作模式的异质性变迁提供了宝贵的微观证据。前沿研究方向已从传统的工时总量统计转向交叉性不平等分析,例如利用该数据揭示“残疾状态”与“性别”对工时分配的叠加效应,尤其关注残疾女性在小型企业中的工时波动。近期热点事件如欧盟《残疾人权利战略》的推进,使得基于此类细分数据的劳动力融入研究成为政策评估的焦点。该数据集的独特价值在于其跨年度时间序列(2007-2025)为纵向比较提供可能,其严谨的ILOSTAT方法论及多重维度分类(如企业规模)赋予了研究者剖析体面劳动目标进展的精密工具,对推动包容性就业政策的循证设计具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务