遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-est-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲21个国家从2000年至2025年的8,690个观测值,聚焦于“按性别、企业规模和城乡划分的雇员实际平均每周工作时间”指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤至亚洲国家,涵盖了劳动统计中的工作时间维度。数据集提供结构化表格数据,包括国家代码、年份、指标值、性别分类、企业规模分类、城乡分类等字段,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,确保一致性和可追溯性,并附带数据质量说明,如年度频率、最佳来源选择和分类列的非空条件。

This dataset contains 8,690 observations across 21 Asia countries from 2000 to 2025, focusing on the indicator Mean weekly hours actually worked per employee by sex, establishment size and rural/urban areas. Sourced from the International Labour Organization (ILO) ILOSTAT database, it is extracted via API and filtered to Asian countries, covering labour statistics on working hours. The dataset provides structured tabular data with fields such as country code, year, indicator value, sex disaggregation, establishment size classification, and rural/urban classification, suitable for tasks like tabular classification, regression, and time-series forecasting. Data is harmonized by ILO for consistency and traceability, with caveats on annual frequency, best-source selection, and non-null conditions for disaggregation columns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-est-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的核心统计数据库ILOSTAT,聚焦于亚洲地区员工实际平均每周工作时长这一劳工关键指标。数据通过调用ILOSTAT REST API接口获取原始指标数据,并依据ISO3国家代码筛选出21个亚洲国家。ILO基于国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一协调,确保跨国可比性,同时通过source.label字段保留数据来源痕迹,实现完整的可追溯性。最终整理为包含8,690条观测值、覆盖2000至2025年时间跨度的结构化表格数据集。
特点
该数据集兼具跨国家、长时间序列与多维分类的特点,涵盖泰国、巴基斯坦、约旦等21个亚洲经济体,时间跨度长达25年。数据不仅按性别(男性、女性、总计)进行分解,还纳入了企业规模和城乡区域两个分类维度,为用户提供了精细化的微观劳动力分析视角。每个观测值均附有观测状态标识(如不可靠值)及序列断裂等说明性注释,有助于评估数据质量。所有字段均采用标准化英文标签,便于国际化研究和跨数据集整合。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,一行代码即可将数据转化为Pandas DataFrame格式以供分析。示例用法包括按国家筛选子集、对特定指标进行时间序列可视化,以及将数据透视为国家×年份的矩阵形式。数据集天然适用于分类、回归和时间序列预测等任务,研究人员可利用其丰富的性别、企业规模和城乡分类维度,深入探究亚洲地区工时模式的时空演变规律。
背景与挑战
背景概述
该数据集源于国际劳工组织(ILO)旗下的ILOSTAT统计数据库,由Electric Sheep Asia于2025年重新打包并发布至HuggingFace平台,聚焦亚洲21个国家2000至2025年间按性别、企业规模及城乡分类的雇员周均实际工作时长。作为全球劳动统计的权威来源,ILOSTAT通过协调各国劳动力调查与行政记录数据,为揭示亚洲地区劳动市场的时间配置模式提供了标准化基石。该数据集的出现,使得长期受限于数据碎片化的跨国产出与劳动强度研究得以突破,尤其为分析亚洲经济体的结构性就业特征、性别差异以及企业异质性对工作时长的影响提供了精细化视角,对劳动经济学、发展经济学及可持续发展目标(SDG)的监测评估具有显著推动作用。
当前挑战
该数据集在当前研究与应用中面临多重挑战。首要挑战在于数据质量与一致性:ILOSTAT虽然对原始调查微观数据进行了基于国际劳动统计学家会议(ICLS)定义的协调,但不同国家间的调查设计(如劳动力调查周期、问卷措辞)与数据采集频率差异仍可能导致观测值可比性下降,且部分年份或指标标注为不可靠(如'obs_status'为'U'),增加了模型对缺失值与异常值的处理难度。其次,构建过程中遇到的挑战在于数据整合与追溯:从ILOSTAT REST API批量抽取时需处理多源数据的衔接(如'best source'选择逻辑),同时需妥善管理因方法论修订(如'Break in series'标记)带来的序列不连续性,这对时间序列预测或面板数据分析造成潜在偏差。此外,限于年度频率而排除月度或季度数据,削弱了对短期劳动市场波动的捕捉能力,且分类维度(性别、企业规模)的非全量覆盖进一步限制了细分层面分析的完整度。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集为分析亚洲各国雇员平均每周实际工时数提供了宝贵的纵向面板数据。研究者可借助21个国家、逾八千条观测记录,构建时间序列回归模型,探讨工时与性别、企业规模、城乡属性之间的动态关联。例如,通过按性别拆分的工时数据,能够量化女性在非正规就业中的劳动负担;结合企业规模与城乡分类,则可评估不同产业结构下工时弹性的差异。其年度观测跨度(2000-2025年)支持长期趋势分析,尤其适合研究劳动力市场在全球化、技术变革或政策干预下的结构性变迁。
衍生相关工作
该数据集衍生了若干重要的学术与产业工作。在计量方法上,学者基于其面板结构开发了处理跨国产出可比性的贝叶斯分层模型,并推广至其他ILOSTAT指标(如工资、非正式就业)。在交叉领域,有研究将其与联合国人类发展指数(HDI)匹配,构建融合工作时间与福祉的多维增长框架。产业层面,Electric Sheep Asia团队围绕该数据构建了标准化ETL管道,形成可自动更新的亚洲劳动力市场指标仓库,激励了其他开发者基于该架构复现非洲与拉美的同类数据集,有力推动了区域劳动统计的开放科学生态。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲21国2000至2025年间按性别、企业规模及城乡维度划分的雇员周实际工作小时数,为劳动经济学与可持续发展目标(SDG 8.5)的实证研究提供了高分辨率面板数据。当前前沿方向集中于利用该时序数据构建异质性劳动供给模型,探索后疫情时代亚洲经济体工作时间的结构性变迁,尤其是性别差距在正规与非正规部门间的演变路径。结合ILOSTAT的标准化统计方法与区域比较优势,研究者可深入剖析巴基斯坦、泰国等劳动力密集型国家的劳动强度动态,以及城市化进程中微型企业雇员工时波动模式。该数据作为链接宏观劳动政策与微观就业质量的关键桥梁,正支撑起关于体面工作、生产率陷阱及社会保护体系韧性等热点议题的跨文化实证分析,其多层次分类属性更推动了机器学习在劳动市场时空预测与政策模拟中的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务