遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲24个国家从1997年至2025年员工实际平均每周工作小时数的5,062个观测值。数据按性别(总计、男性、女性)、公共/私营部门以及城乡区域进行细分,核心指标为HOW_XEES_SEX_INS_GEO_NB,即按性别、公共/私营部门和城乡区域划分的员工实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取并过滤为亚洲国家代码,使用ILO定义进行标准化处理。数据集包含多列信息,如国家代码、来源、指标、性别、分类变量、观测年份、观测值及其状态等,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于使用Hugging Face的`load_dataset()`函数加载和处理。

This dataset contains 5,062 observations of mean weekly hours actually worked per employee across 24 Asia countries from 1997 to 2025. It is disaggregated by sex (total, male, female), public/private sector, and rural/urban areas, with the core indicator HOW_XEES_SEX_INS_GEO_NB representing mean weekly hours actually worked per employee by sex, public/private sector and rural/urban areas. The data is sourced from the International Labour Organizations ILOSTAT database, pulled directly from the REST API and filtered to Asia ISO3 country codes, harmonized using ILO definitions. The dataset includes columns such as country code, source, indicator, sex, classification variables, observation year, observed value, and status flags, making it suitable for tabular classification, regression, and time-series forecasting tasks. It is repackaged by Electric Sheep Asia in Parquet format for easy loading with Hugging Faces `load_dataset()` function.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接提取了标识符为HOW_XEES_SEX_INS_GEO_NB的指标数据,并依据亚洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国原始调查微观数据进行协调统一,数据来源在source.label列中清晰标注,确保了数据的可追溯性与跨國可比性。Electric Sheep Asia团队对原始数据进行了重新封装与标准化处理,最终形成了包含5062条观测记录的整洁数据集。
特点
本数据集聚焦于亚洲地区,覆盖了24个国家自1997年至2025年的年度数据,以雇员平均每周实际工作小时数为核心观测指标。数据按性别(总计、男性、女性)、公共/私营部门以及农村/城市地区进行精细分层,提供了sex、classif1、classif2等多个维度的分类变量,便于研究者从多角度剖析劳动力市场的时空差异。此外,数据集还包含了观测状态标记与注释信息,如实反映了数据修订与序列中断等质量特征。
使用方法
研究者可通过HuggingFace Datasets库轻松加载数据,使用load_dataset('electricsheepasia/asia-ilo-how-xees-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employee-by')即可获取训练集并转换为Pandas DataFrame进行后续分析。数据支持按国家代码筛选特定地区的时间序列,也可通过pivot_table函数构建国家×年份的面板矩阵,便于进行横向比较与纵向趋势分析。对于时间序列预测任务,可直接利用obs_value列与time列构建预测模型。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,后经Electric Sheep Asia重新封装于HuggingFace平台,聚焦于亚洲24国1997至2025年间员工周均实际工作小时的统计。其核心研究问题在于揭示性别、公共/私营部门以及城乡区域等维度对劳动时间的影响,为劳动经济学、人口统计学及社会政策研究提供标准化时间序列数据。作为ILOSTAT数据库的衍生数据集,它承载了ILO在劳动力统计领域的权威性与全球范围数据协调的努力,尤其对亚洲地区的劳动力市场分析、国际比较以及可持续发展目标(SDGs)的监测具有重要推动作用,填补了该区域精细化工时数据的可获取性空白。
当前挑战
该数据集所应对的领域挑战在于劳动时间统计的复杂性,包括不同国家在定义“实际工作小时”时的口径差异、调查方法与数据采集频率的非标准化,以及按性别、行业、地域等多维度交叉分析时产生的数据稀疏性问题。构建过程中面临的困难则体现在:从多来源数据(如劳动力调查、行政记录)中提取并统一为ILO标准格式的技术复杂度;处理因方法论修订导致的时间序列断点(如obs_status.label中标记的‘Break in series’);以及确保跨国家、跨年份的观测值可比性,同时保留原始来源的可追溯性以维护数据透明度。
常用场景
经典使用场景
该数据集收录了1997年至2025年间24个亚洲国家雇员平均每周实际工作小时数,按性别、公共/私营部门及城乡区域进行了细致分层。研究者可利用这些观测数据构建面板结构,开展跨国劳动力市场的比较分析,譬如考察不同制度环境下工作时长的异质性演变。也可将其嵌入时间序列预测框架之中,借助ILOSTAT标准化后的年度观测值,对特定国家或部门的劳动供给趋势进行建模推演。对于分类任务而言,基于性别或部门标签构造的断面数据,同样适用于探究工作时长模式的分组识别与判别分析。
实际应用
在实际应用层面,该数据集可为国际组织及国家劳动部门的政策评估提供实证基准。通过监测不同性别和部门间工作时长的动态变迁,政策制定者能够识别潜在的超时劳动风险,并评估劳动保护法规的实际覆盖效果。企业人力资源规划亦可借助这些历史均值,设定合理的行业用工时长参照。对于关注联合国可持续发展目标中体面劳动指标的倡导者而言,该数据是追踪亚太地区进展状况不可或缺的量化工具,有助于推动基于证据的社会对话与制度完善。
衍生相关工作
围绕ILOSTAT劳动统计数据库,学界已涌现大量衍生工作。不少研究者利用其标准化指标构建了跨国面板数据集,用以探究全球化、贸易开放与劳动标准之间的互动关系。Econometrica或Journal of Development Economics等刊物上,基于此类数据的实证论文常常涉及最低工资制度对就业时长的影响,或女性劳动参与率与该国产业结构升级的内在联系。部分文献还针对ILOSTAT中的分类变量设计了脆弱性指标体系,进而对非正规就业的时空分布展开系统性测度。该数据集在HuggingFace上的复现打包,进一步降低了计算可复现性的门槛,有望催生更多基于机器学习的亚太劳动经济学探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务