遇见数据集

electricsheepasia/asia-ilo-how-xees-age-oc2-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲31个国家(1997年至2025年)的平均每周实际工作时间的表格型数据集,包含28,944条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家。主要指标为HOW_XEES_AGE_OC2_NB,即按年龄和职业(ISCO第2级)划分的每位员工平均每周实际工作时间。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、分类变量(年龄和职业)、观测年份、观测值等,适用于分类、回归和时间序列预测任务。数据为年度频率,ILO选择最佳来源,且分类列仅在指标发布细分数据时非空。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习使用。

This dataset is a tabular dataset containing 28,944 observations of Mean weekly hours actually worked per employee by age and occupation - ISCO level 2 across 31 Asia countries, spanning from 1997 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. The main indicator is HOW_XEES_AGE_OC2_NB, which represents mean weekly hours actually worked per employee by age and occupation at ISCO level 2. The dataset includes columns such as country code, country name, data source, indicator code, classification variables (age and occupation), observation year, observed value, etc., and is suitable for tabular classification, regression, and time-series forecasting tasks. The data is annual frequency, with ILO-selected best source used when multiple sources exist, and disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is repackaged by Electric Sheep Asia in Parquet format for easy machine learning use.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-age-oc2-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自ILOSTAT官方REST API,原始数据经由国际劳工组织(ILO)依据国际劳动统计学家会议(ICLS)定义进行统一协调与清洗,涵盖31个亚洲国家在1997至2025年间的观测记录。数据集在HuggingFace平台上由Electric Sheep Asia负责二次封装,通过自动化管道从ILO公开接口抽取原始指标代码为HOW_XEES_AGE_OC2_NB的数据,并筛选出亚洲地区ISO3国家代码所对应的子集。最终形成的28,944条观测值均保留了完整的元数据,包括来源标识与分类变量字段,便于追溯与验证。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据至Pandas DataFrame进行分析。典型应用场景包括按国家过滤样本以考察特定劳工市场趋势,或按指标代码提取完整的时序数据用于可视化与预测建模。此外,利用pivot_table操作可将数据结构重塑为国家×年份的面板矩阵,便于进行面板数据回归或聚类分析。数据集中附带的源名称与分类列,支持用户按调查类型或职业层级进行细粒度筛选,适配多样化的研究设计需求。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其ILOSTAT统计平台上发布,并由Electric Sheep Asia在2025年重新整理至HuggingFace,专注于亚洲31个国家1997至2025年间雇员每周实际工作小时数的均值,按年龄和职业(ISCO-08二级分类)进行细分。作为全球劳动统计领域的权威数据源,ILOSTAT整合了多国劳动力调查与行政记录,旨在提供跨经济体可比的工作时间指标。该数据集共包含28,944条观测值,覆盖亚洲主要经济体如土耳其、越南、柬埔寨及伊朗等,为区域劳动力市场分析、工作时间趋势研究及政策制定提供了标准化、机器可读的数据基础,尤其在劳动经济学与可持续发展目标(SDG)评估中具有重要应用价值。
当前挑战
该数据集面临的挑战集中在两个层面。在领域问题层面,其核心是解构亚洲各国因经济发展阶段、产业结构和非正规就业比例差异所导致的工作时间分布异质性,以及如何通过标准化指标揭示隐性劳动特征(如性别、年龄段与职业间的工时差异),从而为体面劳动目标提供精准量化依据。在构建过程中,挑战源自多源数据的融合与质量控制:ILO需从各国不同调查(如劳动力调查、家庭收入调查)中提取数据并统一至ICLS定义框架,同时处理方法论变更、指标断点和数据可靠性标记(如‘U’类状态),确保跨国家、跨时段的时序一致性;此外,Electric Sheep Asia在重封装时还需解决分类变量(如年龄分组、职业编码)的标准化与缺失值处理,以降低数据集在机器学习中的预处理负担。
常用场景
经典使用场景
该数据集聚焦于亚洲地区31个国家1997至2025年间按年龄与职业分类(ISCO二级编码)的雇员平均每周实际工作时长统计,适用于劳动经济学中的时域与截面分析。研究者可借助这28,944条观测值构建面板数据,以剖析亚洲劳动力市场在不同经济发展阶段下的工时演变规律,同时结合年龄分层与职业细目,挖掘人口结构与产业变迁对工作时长的差异化影响。其时序属性也为预测建模提供了坚实基础,支持从趋势外推到结构性断点检验的多元化探索。
解决学术问题
在学术层面,该数据集有效填补了亚洲区域工时微观比较研究的空白,尤其解决了跨国产出交叉验证数据稀缺的难题。它使得学者能够系统评估国际劳工组织(ILO)工时标准在亚洲各国的落地差异,量化经济增长、人口老龄化与工时缩短之间的内在关联,并为探讨灵活就业、性别分工及非正规经济规制等议题提供经验证据。通过揭示不同年龄群体与职业层级间的工时异质性,该数据有力地支撑了关于劳动供给弹性及福祉权衡的理论推演,对推动体面劳动议程的实证研究具有深远意义。
实际应用
实际应用中,该数据集可被国际机构、国家统计部门及企业智库用于构建区域劳动监测体系。国际劳工组织可据此优化技术援助方案,协助成员国制定合理的工时上限与加班补偿政策;跨国企业能够评估目标市场的劳动成本与用工合规风险,从而优化供应链布局与人力资源规划。此外,政府部门可借助该数据诊断特定行业或年龄段的劳动过劳现象,设计针对性的职业健康干预措施,促进劳动力市场的结构性改革与可持续发展。
数据集最近研究
最新研究方向
在劳动经济学与可持续发展目标(SDG)监测的前沿,基于ILOSTAT权威数据源构建的“亚洲分年龄与职业(ISCO-2级)雇员周均实际工时”数据集,正成为剖析亚洲劳动力市场结构性变迁的关键工具。该数据集覆盖31个国家、近三十年(1997–2025)的时间序列,为研究后疫情时代“工时极化”现象——即高技能知识工作者工时延长与低技能服务业从业者工时缩减并存的趋势——提供了细粒度观测窗口。结合国际劳工组织(ILO)近年来推动的“体面劳动议程”与亚太地区日益严峻的“技能错配”挑战,研究者可利用此数据拟合混合效应模型或面板回归,量化职业分层、人口老龄化与宏观经济波动对工时分配的非线性影响。此外,作为CC-BY-4.0许可的机器学习就绪数据,它有力支撑了预测工人福祉的时序模型开发,为区域性劳动政策模拟与包容性增长评估奠定了实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务