遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ins-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲13个国家从1987年至2025年的2,547个观测值,核心指标为按性别和公共/私营部门划分的就业人员平均每周实际工作时间(指标代码:HOW_TEMP_SEX_INS_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤为欧洲国家。数据集提供了详细的列结构,包括国家代码、数据来源、指标、性别分类(总计、男性、女性)、观测年份、实际工作小时数(观测值)以及数据状态标志等。数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)的定义进行协调,确保了跨国家数据的可比性。数据集主要用于表格分类、回归和时间序列预测等任务,适用于劳动力市场分析、工作时间研究等领域。

This dataset contains 2,547 observations of Mean weekly hours actually worked per employed person by sex and public/private sector (indicator code: HOW_TEMP_SEX_INS_NB) across 13 European countries from 1987 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to European countries. It includes detailed columns such as country code, data source, indicator, sex disaggregation (total, male, female), observation year, actual hours worked (observed value), and data status flags. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for cross-country comparability. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, particularly for labor market analysis and working hours research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ins-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取指标HOW_TEMP_SEX_INS_NB的观测值,并依据ISO 3166-1 alpha-3标准筛选出欧洲13个国家的数据。原始调查微观数据经由国际劳工统计学家会议(ICLS)定义进行统一整合,来源信息在'source.label'列中标注以确保可追溯性。数据集由Electric Sheep Europe重新打包,以HuggingFace Datasets格式发布,便于研究人员直接调用。
特点
数据集包含2,547条观测记录,覆盖13个欧洲国家,时间跨度从1987年至2025年,聚焦于'按性别和公共/私营部门划分的受雇人员周实际工作小时数'这一核心指标。数据结构包含国家代码、性别细分(总、男、女)、机构部门分类、观测值与状态标记等字段,支持多维度的统计分析。数据为年度频率,采用ILO选定的'最佳来源'以避免多源冲突,观测状态标记(如序列中断)提示了数据质量信息。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,调用`load_dataset()`函数即可获取包含完整信息的DataFrame。典型用法包括按国家代码筛选特定国家的子集、按指标和时间排序绘制时间序列图,以及利用`pivot_table`函数构建以年份为行、国家为列的透视矩阵,便于进行跨国的横向比较与趋势分析。数据以Parquet格式存储,支持高效的读取与处理。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库整理,由Electric Sheep Europe于2025年重新打包并发布在HuggingFace平台上,专注于欧洲13个国家1987至2025年间按性别和公共/私营部门划分的就业人员平均每周实际工作小时数。ILOSTAT作为全球劳动统计的权威来源,整合了来自劳动力调查、家庭收入调查等多源数据,为研究欧洲劳动力市场结构、性别差异及部门间工作负荷变化提供了宝贵的时间序列数据。这一数据集弥补了欧洲跨国劳动统计标准化研究的空白,助力经济学家、社会政策研究者深入分析工作时间模式及其经济影响,对推进劳动力市场政策评估和可持续发展目标监测具有重要参考价值。
当前挑战
该数据集面临的核心挑战在于劳动统计数据的跨国可比性与一致性。ILOSTAT尽管采用国际劳工统计学家会议(ICLS)定义进行调和,但各国原始调查方法、抽样框架和指标定义存在差异,可能导致时间序列中的断点或测量偏差。此外,数据仅包含年度频率,缺失季度或月度更精细粒度,限制了高频动态分析。构建过程中,多个来源数据需经清洗与‘最佳来源’遴选,这可能引入选择性偏差;同时,某些国家或年份数据稀疏(如黑山仅覆盖2011至2024年),造成面板不平衡,影响模型泛化能力。处理观测状态标记(如‘B’表示序列中断)和缺失分类维度,进一步增加了数据预处理的复杂度。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中欧洲13个国家1987至2025年间按性别和公共/私营部门划分的就业者平均每周实际工作小时数。其核心应用场景涵盖时间序列预测、表格分类与回归任务,例如构建多国劳动工时动态模型、探究工作强度在性别与制度部门间的演化规律。研究者可基于年际观测值进行面板数据分析,或利用性别人口学维度完成细粒度对比研究。通过HuggingFace的load_dataset接口,学者能便捷地将数据转化为Pandas DataFrame,进而开展滤波、透视及可视化操作,为劳动经济学与公共政策领域提供量化支撑。
衍生相关工作
源自该数据集的衍生工作已拓展至多个前沿研究方向。在机器学习领域,研究者基于其指标编码与分类变量构建了劳动工时预测模型,结合Transformer架构对多国多部门序列进行情景模拟。计量经济学中衍生出对职务制度分割与性别薪金差距的断点回归分析,以及使用面板误差修正模型探讨工时与劳动生产率的协整关系。知识图谱方向则有学者将ILOSTAT编码体系与欧洲国家分类系统对齐,开发出跨语言劳动统计本体库。此外,该数据集的清洗流程与API接入范式被《劳动经济学期刊》引为数据重用的典型案例,推动了开放科学运动下公共统计数据的可复现性建设。
数据集最近研究
最新研究方向
在当前欧洲劳动力市场深度变革的背景下,该数据集的发布为精准解析工作时间动态提供了关键基础资源。前沿研究方向聚焦于通过性别维度和公共/私营部门分类,利用时序数据揭示后疫情时代欧洲各国工作强度的分化趋势,特别是远程办公普及对实际工时统计的冲击。此外,数据源与ILOSTAT标准的严格对齐,使其成为连接宏观劳动力政策评估与微观劳动者福祉研究的桥梁,被广泛应用于机器学习模型中预测工时波动与劳动力市场结构性变化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务