遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-cct-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲按性别和公民身份划分的雇员实际平均每周工作小时数的数据集。数据集包含8,872个观测值,覆盖37个欧洲国家,时间跨度为1991年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是劳动统计的全球领先来源。数据集包含一个核心指标HOW_XEES_SEX_CCT_NB,即按性别和公民身份划分的雇员实际平均每周工作小时数。数据模式包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、公民身份分类、观测年份、观测值、观测状态等列。数据以年度频率发布,并经过ILO的协调处理,以确保定义的一致性。数据集适用于表格分类、表格回归和时间序列预测等任务。

This is a dataset on mean weekly hours actually worked per employee by sex and citizenship in Europe. It contains 8,872 observations across 37 European countries, spanning from 1991 to 2025. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, which is a leading global source for labour statistics. The dataset includes one core indicator HOW_XEES_SEX_CCT_NB, which represents the mean weekly hours actually worked per employee by sex and citizenship. The schema includes columns such as country code, country name, data source, indicator code, indicator name, sex classification, citizenship classification, observation year, observed value, observation status, etc. The data is published at annual frequency and is harmonized by the ILO to ensure consistency in definitions. The dataset is suitable for tasks like tabular classification, tabular regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-cct-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过调用其REST API接口获取原始指标数据,并依据欧洲ISO3国家代码进行地理范围筛选后重新封装而成。ILOSTAT对各国劳动力调查、住户收入调查及行政记录等原始微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理,以确保跨国可比性。数据集中每一观测值均附有来源标识(source.label),便于追溯数据出处。最终由Electric Sheep Europe团队整合为Parquet格式,发布至HuggingFace平台,供研究者便捷调用。
特点
该数据集囊括1991年至2025年间37个欧洲国家的8,872条观测记录,聚焦“按性别与公民身份划分的雇员周均实际工作小时数”这一核心指标。数据结构清晰,包含国家代码、性别分类(总/男/女)、公民身份类别、观测年度及相应的指标数值,并辅以观测状态标记与注释信息,用以标识数据的可靠性及方法论断点等质量特征。其时间跨度长、覆盖国家广泛,且以统一规范的多维分类维度呈现,为跨国劳动力市场的比较研究提供了扎实的数据基础。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset函数一键加载数据,并转换为Pandas DataFrame进行后续分析。例如,可依据国家代码(ref_area)筛选特定国家的子集,或针对单一指标按时间排序绘制时间序列图。亦可通过透视表功能构建以年度为行、国家为列的矩阵,便于开展面板数据分析。数据集以CC-BY-4.0许可发布,使用时需同时标注原始数据来源(ILO)及封装方(Electric Sheep Europe)。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT于2025年发布,经Electric Sheep Europe重新封装,聚焦于欧洲37个国家1991至2025年间按性别与公民身份划分的雇员每周实际工作平均时长。作为全球劳动力统计的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收入调查等数据,为理解欧洲劳动力市场结构提供了关键指标。该数据集涵盖8,872条观测记录,其价值在于通过时间序列与人口细分维度,揭示了移民与本地劳动力在工时上的差异,为劳动经济学、移民政策评估及社会不平等研究提供了基础数据支撑。
当前挑战
该数据集面临的挑战在于领域维度与构建过程两层。在领域层面,所解决的劳动工时统计问题长期受制于数据可比性——不同国家因调查方法、工时定义(如含不含加班)差异导致跨国对比失真,且移民身份数据的敏感性使得部分国家无法提供完整细分。在构建过程中,ILOSTAT面临多源数据融合难题:需从各国劳动调查、行政记录等异构来源中统一标准,处理因方法论修订导致的序列断裂(如标注‘Break in series’),并平衡数据时效性与质量,对不可靠或临时性观测值需附加标志(如‘Unreliable’),这增加了数据清洗与建模复杂度。
常用场景
经典使用场景
在欧洲劳动力市场分析领域,该数据集的核心应用之一是对不同性别和国籍身份的雇员每周实际工作小时数进行系统性建模与趋势分析。研究人员常利用其覆盖37个欧洲国家、跨越1991年至2025年的年度时间序列数据,构建面板数据模型以探究工作强度的宏观变化规律。该数据集的精细分类结构(包含总劳动人口、男性、女性以及按国籍划分的子组)使其成为分析劳动力供应弹性、性别工作差异及移民劳工市场融入程度的理想工具。通过结合ILOSTAT统一采编的权威来源与标准化指标定义,研究者得以开展跨国家、跨年代的纵向比较,揭示欧洲一体化进程中劳动市场的结构变迁。
解决学术问题
该数据集有效回应了劳动经济学中关于工作强度异质性的核心难题,特别是如何精确量化性别与公民身份对于工作时长的差异化影响。传统研究中,跨国可比数据的缺失常导致结论碎片化,而本数据集通过ILO严格的方法论协调(如国际劳工统计学家会议定义),提供了高度一致的观测值。其解决了如‘欧洲各国工作小时数收敛或发散趋势’、‘移民身份是否显著改变劳动供给行为’、‘金融危机或疫情对薄弱群体工作时间的非对称冲击’等关键学术问题。此外,细粒度的观测状态标签与来源注释使研究者能识别数据质量波动,提升因果推断的稳健性,从而为劳动力市场政策的制定提供更坚实的实证基础。
衍生相关工作
围绕该数据集,学术界已衍生出一系列经典研究路径与方法创新。基于其面板数据结构,学者们发展了多层次模型以分解国家层面与个体群体层面的方差,或利用差分广义矩估计方法控制未观测异质性。该数据集亦推动了时间序列联合预测模型的应用,如整合移动平均自回归与动态因子模型,以捕捉欧洲国家间工作时长的协同波动。在机器学习领域,分类与回归任务被用于预测未来年度的工作时长演变,而时间序列预测任务则催生了针对季节性调整与突变点检测算法的改进。此外,该数据集的公开可复现特性使其成为劳动经济学教学中的标准案例,支持学生复现经典研究并开发新的分析工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务