遇见数据集

electricsheepeurope/europe-ilo-how-xees-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含434,371个观测值,记录了38个欧洲国家从1991年至2025年期间,按经济活动和职业划分的雇员实际平均每周工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集包含一个核心指标HOW_XEES_ECO_OCU_NB,表示按经济活动和职业划分的雇员实际平均每周工作时间。数据列包括国家代码、国家名称、数据来源、指标代码、指标标签、分类变量(如经济活动和职业)、观测年份、观测值(以小时为单位)、观测状态标志以及相关注释。数据为年度频率,涵盖多个欧洲国家,适用于表格分类、回归分析和时间序列预测等机器学习任务。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于使用Hugging Face的`load_dataset()`加载。

This dataset contains 434,371 observations of mean weekly hours actually worked per employee by economic activity and occupation across 38 European countries from 1991 to 2025. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via the REST API and filtered to European ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. It features one primary indicator HOW_XEES_ECO_OCU_NB, which represents Mean weekly hours actually worked per employee by economic activity and occupation. Columns include country codes, country names, data sources, indicator codes, indicator labels, classification variables (e.g., economic activity and occupation), observation year, observed values (in hours), observation status flags, and related notes. The data is annual in frequency and covers multiple European countries, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Europe in Parquet format for easy loading with Hugging Faces `load_dataset()`.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT数据库构建,后者作为全球劳动统计的核心权威来源,系统整合了各国劳动力调查、家庭收入调查、企业调查及行政记录等多源微观数据。数据通过REST API从ILOSTAT直接拉取,筛选出38个欧洲国家的ISO3国别代码对应的观测记录,并采用国际劳工统计学家会议(ICLS)定义进行标准化处理。最终汇聚为434,371条年度观测值,涵盖1991年至2025年的时间跨度,每个观测均附有来源标签以供溯源。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据集,使用load_dataset()命令即可将数据转换为Pandas DataFrame格式,便于后续处理。典型操作包括按国别过滤(如筛选德国数据)、按时间序列排序并可视化特定指标的趋势,或利用透视表构建国家与年份的矩阵以进行横向比较。数据集兼容表格分类、回归及时间序列预测等多种机器学习任务,为劳动经济学、政策评估及跨国比较研究提供了即用型数据基础。
背景与挑战
背景概述
劳动工时数据是洞察劳动力市场动态、衡量工作强度与生活质量的关键指标,对于制定劳动政策、评估经济效率以及追踪可持续发展目标(SDG)中体面工作议程的进展具有不可替代的价值。在此背景下,国际劳工组织(ILO)统计司依托其核心数据库ILOSTAT,整合了来自各国劳动力调查、行政记录等多源数据,构建了覆盖全球200多个经济体的劳工统计体系。该数据集由Electric Sheep Europe于2025年重新打包发布,聚焦欧洲38个国家,时间跨度为1991年至2025年,包含434,371条观测记录,核心研究问题聚焦于“按经济活动与职业划分的雇员平均每周实际工时”这一精细指标。该数据集通过标准化处理与便捷的HuggingFace接口,显著降低了劳动经济学、宏观政策评估及时间序列预测等领域研究者获取高质量欧洲工时数据的门槛,对促进跨国劳动市场比较研究与证据驱动决策具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于,劳动力市场研究长期受困于工时数据在跨国、跨职业与行业层面缺乏统一可比性,各国统计口径、调查周期与分类标准各异,导致细粒度分析难以开展。ILOSTAT通过遵循国际劳工统计学家会议(ICLS)定义进行数据协调,并标记数据来源以保障可追溯性,从而在方法论上应对了这一挑战。数据集构建过程中面临的主要挑战包括:整合来自38个国家、跨越35年、涉及多种经济活动和职业分类的异构数据源,需处理统计口径变更带来的序列断点(如方法论修订标记于数据集注释列中);在年度频率数据中识别并标注不可靠观测值(如`obs_status`字段标记为'U'),以确保分析结论的稳健性;以及平衡多源数据冲突时对ILO选定“最佳来源”的依赖,该选择策略虽保证了权威性,但也可能隐含因国家间调查质量差异导致的系统性偏差风险。
常用场景
经典使用场景
在劳动经济学与劳动力市场研究的广袤疆域中,基于国际劳工组织(ILO)官方统计数据库ILOSTAT构建的europe-ilo-how-xees-eco-ocu-nb-mean-weekly-hours-actually-worked-per-employee-by数据集,以其横跨38个欧洲国家、涵盖1991年至2025年长达三十余年的精细观测记录,成为剖析雇员实际周均工时演变轨迹的标杆性资源。该数据集最富盛名的应用场景当属时间序列分析与面板数据回归研究:学者们利用其按经济活动和职业分类提供的年均工时值,构建国家-年份双层结构的面板模型,进而识别经济周期波动、产业结构调整与劳动力市场制度变革对工作时长的异质性冲击。尤为值得一提的是,数据集中附带的来源标识与断点注释字段,为处理测量方法变更带来的结构性断裂提供了宝贵的质量控制线索。
解决学术问题
在学术探索的殿堂中,该数据集精准回应了劳动经济学领域长期悬而未决的多重议题。其一,它填补了跨国家维度下产业与职业工种叠加的工时统计空白,使得研究者能够突破单一国别案例的局限,在区域比较的框架内量化欧洲各国工时制度的趋同与分异。其二,通过提供长达三十余年的连续序列,数据集为破解工时长期趋势与短期波动之争提供了坚实的数据基础——例如区分技术进步的工时缩减效应与全球化分工带来的工时极化现象。其三,数据中所附的观测状态标记与来源变更记录,为方法论研究提供了第一手素材,促使学者深入评估调查制度变革对统计指标可比性的扰动程度,从而推动计量方法在面板数据质量矫正层面的迭代与创新。
实际应用
从现实世界的政策诊断到商业决策支撑,该数据集展现出跨越学术围墙的多元应用价值。在公共政策层面,国际组织与各国劳动部门可借助其对不同经济活动和职业群体的工时分布与演变态势进行动态监测,从而为最低工时立法、加班补偿标准设定以及工作与生活平衡政策的跨区域对标提供实证依据。企业界与行业研究机构亦能从中受益:通过解析特定产业或职业在多个欧洲国家间的工时差异,跨国公司能够更精准地评估不同市场的劳动力成本结构与潜在运营风险,进而优化跨境人力资源配置策略。此外,金融机构与宏观经济预测模型开发者可将其纳入先行指标系统,借助工时数据与经济产出之间的高频相关性,提升对欧洲区域经济周期拐点的预判能力。
数据集最近研究
最新研究方向
基于ILOSTAT欧洲雇员实际周均工时数据集的劳动经济学与时间序列预测研究正蓬勃兴起。该数据集覆盖38个欧洲国家长达34年(1991-2025年)的观测,按经济活动与职业分类精细刻画劳动时间,为后疫情时代工作模式变革、远程办公对工时影响、以及欧洲各国劳动政策效果评估提供了坚实的数据基石。结合欧洲近年来热议的“四天工作制”试点、弹性就业与数字劳工平台崛起等前沿议题,研究者正利用该数据集构建多国面板模型与深度学习时序预测框架,剖析工时波动与经济周期、产业升级的深层关联,成果直接服务于国际劳工组织体面劳动目标的监测与欧盟就业政策的优化调整。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务