遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-age-ins-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和公共/私营部门划分的员工实际每周平均工作小时数 | 欧洲(ILOSTAT)”,是一个表格型数据集,专注于欧洲员工的工作时间统计。它包含37,711个观测值,覆盖13个欧洲国家(包括希腊、瑞士、西班牙、摩尔多瓦、奥地利、英国、法国、波黑、北马其顿、阿尔巴尼亚、斯洛伐克、塞尔维亚和黑山),时间跨度为1987年至2025年。数据集主要指标为“员工实际每周平均工作小时数”,按性别、年龄和公共/私营部门进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过统一处理以确保一致性。数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,提供了详细的列结构,如国家代码、来源、指标、性别分类、年龄分类、观察年份、观测值等,并包含数据质量说明(例如,数据为年度频率,使用最佳来源)。该数据集由Electric Sheep Europe重新打包发布,旨在为欧洲提供统一的、机器学习就绪的数据层,方便研究人员和开发者快速使用。

This dataset is named Mean weekly hours actually worked per employee by sex, age and public/private sector | Europe (ILOSTAT) and is a tabular dataset focusing on working hours statistics for employees in Europe. It contains 37,711 observations covering 13 European countries (including Greece, Switzerland, Spain, Moldova, Austria, the United Kingdom, France, Bosnia and Herzegovina, North Macedonia, Albania, Slovakia, Serbia, and Montenegro), spanning the years 1987 to 2025. The primary indicator is mean weekly hours actually worked per employee, disaggregated by sex, age, and public/private sector. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via REST API and harmonized for consistency. The dataset is suitable for machine learning tasks such as tabular classification, tabular regression, and time-series forecasting, offering detailed column structures like country codes, sources, indicators, sex classifications, age classifications, observation years, observed values, and more, along with data quality notes (e.g., annual frequency, use of best sources). Repackaged and published by Electric Sheep Europe, it aims to provide a unified, ML-ready data layer for Europe, facilitating quick usage by researchers and developers.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-age-ins-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,该数据库是全球劳动统计领域的权威来源。数据集通过调用ILOSTAT提供的REST API接口,获取指标‘HOW_XEES_SEX_AGE_INS_NB’的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。ILO统计部门依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家计调查及行政记录等微观数据进行协调与标准化处理,确保了指标在不同国家间的可比性。数据集中‘source.label’字段清晰标注了每条观测值的数据源,为数据溯源提供了可追溯的路径。最终,数据集由Electric Sheep Europe团队进行重新封装与整理,以Parquet格式存储,便于机器学习领域直接调用。
使用方法
该数据集已被集成至HuggingFace Datasets生态系统,研究者可通过简洁的Python代码快速加载。推荐的方法是直接使用`load_dataset`函数一键读取,并将数据转换为Pandas DataFrame格式进行后续分析。应用场景丰富多元:可针对单一国家(如德国)进行过滤,研究其工作时间长期趋势;也可基于特定指标绘制完整时间序列图,直观展示跨年波动规律。更进一步,通过透视表操作,可以轻松将数据重塑为国家×年份的矩阵形式,便于进行面板数据回归或跨国的比较静态分析。数据集的标准化Schema设计,使得基于性别、年龄等维度的筛选与聚合操作极为便捷,极大降低了劳动经济学研究的编程门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年发布,经Electric Sheep Europe团队重新整理后发布于HuggingFace平台,旨在提供欧洲13个国家1987至2025年间按性别、年龄及公共/私营部门划分的雇员实际周均工作小时数。作为ILOSTAT核心数据库的重要组成部分,该数据集汇集了来自劳动力调查、家庭收入调查及行政记录等多元来源的37,711条观测记录,解决了劳动经济学与社会政策研究中长期存在的跨国家、跨时段、跨维度的工作时间数据碎片化问题。其精细的分层结构——涵盖性别二分、年龄分段与机构部门分类——使研究者能够深入剖析欧洲各国劳动力市场的结构性差异与演变趋势,为国际比较劳动统计提供了标准化、可复用的基础数据资源,对推动体面劳动监测、性别平等评估及劳动力弹性分析等领域的研究具有显著影响力。
当前挑战
该数据集所解决的领域核心挑战在于劳动统计研究中数据异质性与可比性不足的问题。不同国家的工作时间定义、调查方法及分类标准存在差异,导致跨区域对比时常陷入数据口径不一致的困境。ILOSTAT通过统一采纳国际劳动统计学家会议(ICLS)定义进行数据协调,但原始调查的断点、方法修订(如标注为“Break in series: Methodology revised”)及部分观测值可靠性存疑(如标注“Unreliable”)仍构成分析隐患。在构建过程中,面临的挑战包括从多源异构数据中筛选并整合ILO选定的“最佳来源”,处理同一国家-年份组合中多源数据冲突,以及确保包含13个国家、跨度近40年的时序数据在分类维度(如年龄分组)上的连贯性与空值处理的一致性。此外,将年度频率数据与更高频的月度或季度系列割裂,也可能限制对短期波动影响的捕捉能力。
常用场景
经典使用场景
该数据集收录了1987年至2025年间欧洲13个国家关于员工实际工作周均时长的官方统计观测值,共计37,711条记录。其经典使用场景集中于劳动经济学领域的跨时间与跨空间比较研究,研究者可依据性别、年龄组别及公共/私营部门等维度进行精细化切片分析。通过将时间序列与分类变量相结合,该数据为解析欧洲各国劳动力市场结构性变迁、性别工时差异演化趋势以及公共政策对工作时间的影响提供了坚实的数据基石。
解决学术问题
在学术层面,该数据集系统性地回应了若干关键研究议题。它使研究者得以追踪欧洲各国在数十年间劳动供给行为的变化,尤以性别工时差距的收敛或扩散为核心关切。同时,数据中公共与私营部门的分类属性为探究制度性因素——如劳动法规、社会福利体系——对工时分布的影响提供了实证支持。此外,它还是检验经济周期波动与劳动力调整模式之间动态关系的宝贵素材。
实际应用
在实际应用领域,该数据集的价值超越了纯学术的边界。国际组织与各国劳动部门可籍此监测工时长期趋势,并评估性别平等政策或就业调控措施的实效。对企业而言,跨国工时基准数据有助于优化人力资源配置与跨国薪酬策略的制定。对公众与媒体来说,这份数据是洞察不同国家、不同群体劳动强度差异的透明窗口,能够为更理性的社会对话提供支撑。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲多国劳动者平均每周实际工作时间的精细化解构,按性别、年龄及公共/私营部门进行分层,为劳动经济学中的工时异质性研究提供了高分辨率面板数据。当前前沿方向集中于利用该时序数据(1987–2025年)构建动态面板模型,以揭示数字平台经济崛起、远程办公普及及欧盟《工作时间指令》修订等热点事件对不同人群工时模式的差异化冲击。此外,结合ILOSTAT的标准化定义,该数据可支撑跨国比较分析,助力评估性别工时差距演变及非正规就业影响,其价值在新冠后劳动力市场弹性研究中尤为凸显。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务