遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ins-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)的ILOSTAT数据库的统计数据,主题为按性别、公共/私营部门和残疾状况划分的就业人员平均每周实际工作时间,专注于亚洲地区。数据集涵盖17个亚洲国家,时间跨度为1997年至2024年,共1,851个观测值。核心指标为HOW_TEMP_SEX_INS_DSB_NB,表示按性别、公共/私营部门和残疾状况划分的平均每周实际工作时间。数据包括多个维度,如国家代码、国家名称、数据来源、性别分类(总计、男性、女性等)、机构部门分类、残疾状况分类、观测年份、观测值、数据状态标志等。数据来源于ILO的官方统计,通过ILOSTAT API获取,并经过标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains statistics from the International Labour Organization (ILO)s ILOSTAT database, focusing on Mean weekly hours actually worked per employed person by sex, public/private sector and disability status in Asia. It covers 17 Asian countries from 1997 to 2024, with 1,851 observations. The key indicator is HOW_TEMP_SEX_INS_DSB_NB, representing mean weekly hours actually worked per employed person disaggregated by sex, public/private sector, and disability status. Data includes dimensions such as country codes, country names, data sources, sex disaggregation (total, male, female, etc.), institutional sector classification, disability status classification, observation year, observed values, data status flags, and more. Sourced from ILO official statistics via the ILOSTAT API, the dataset is normalized and repackaged by Electric Sheep Asia for machine learning readiness, suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ins-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接抽取指标代码为HOW_TEMP_SEX_INS_DSB_NB的原始数据。数据经过严格过滤,仅保留涵盖亚洲17个国家的ISO3国家代码所对应的观测值。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查及行政记录中的微观数据进行统一协调与清洗,确保跨国可比性。数据集以Parquet格式重新封装,共包含1,851条观测记录,时间跨度从1997年至2024年,并提供详细的source.label列以追踪每一个观测值的原始数据来源,便于用户验证数据质量与溯源。
特点
该数据集的核心特点在于其精细的多维分层结构。它按性别(男性、女性、总人口及其它)、公共/私营部门以及残疾状态进行交叉分类,提供平均每周实际工作小时数的深度洞察。数据规范包含17个字段,如ref_area(国家代码)、time(年份)、obs_value(指标值)以及obs_status(数据可靠性标记),并附带了多个分类变量(classif1、classif2)及其标签,使得用户能够灵活地进行按部门、按残疾状况等子群体的分析。此外,数据集仅保留ILO选定的‘最佳来源’,有效避免了同一国家年份下多源数据冲突的问题,确保了数据的权威性和一致性。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集,一行代码即可获取包含全部观测的Pandas DataFrame。基于所提供字段,进行深入的时序分析和面板数据挖掘。例如,可按国家代码筛选特定区域(如印度尼西亚)的时变趋势,或利用pivot_table操作将数据重塑为以年份为行、国家为列的矩阵格式,便于跨经济体的横向比较。同时,结合sex、classif1等分类列进行条件筛选,研究者能够精准提取诸如‘女性在公共部门的周工作时长’等子样本,极大地简化了针对亚洲劳动力市场、性别差异及包容性就业等议题的实证分析流程。
背景与挑战
背景概述
亚太地区作为全球劳动力市场最具活力的区域之一,其工作时间模式对评估体面劳动与可持续发展目标具有关键意义。此数据集由国际劳工组织(ILO)统计司基于ILOSTAT数据库构建,并经Electric Sheep Asia于2024年重新整理发布,涵盖1997至2024年间17个亚洲国家的1,851条观测记录。核心研究问题聚焦于通过性别、公共/私营部门及残疾状况等维度,揭示亚洲劳动者平均每周实际工作时间的异质性。该数据集的发布为跨国劳动经济学比较、政策评估及时间序列预测提供了标准化、可复现的高质量基准,显著提升了亚洲劳动统计数据的可获取性与可分析性。
当前挑战
该数据集所解决的领域问题在于,亚洲各国统计数据在采集标准、时间跨度与分类维度上存在显著不一致性,阻碍了跨区域劳动力市场的系统量化分析。构建过程中面临多重挑战:首先,ILOSTAT原始数据来源多样,需整合不同国家的劳动力调查、住户调查及行政记录,并依据国际劳工统计学家会议标准进行一致性处理;其次,需识别并筛选最优来源以避免同一国家同一年份内多个数据源冲突;此外,分类维度(如残疾状况、机构部门)的缺失值处理与质量标记(如不可靠标识)的规范化,以及将年度频率数据与更高频序列的兼容性管理,也是构建中的技术难点。
常用场景
经典使用场景
在劳动经济学与社会科学计量领域,该数据集的核心价值在于对亚洲地区不同性别、行业及残疾状态劳动者的平均每周实际工时进行精细化描述与比较分析。研究者可依据国家、时间跨度及分类变量(如性别、公共/私营部门)展开多维度聚合与可视化,系统揭示亚洲各国劳动时长分布的异同及其历史演变轨迹。典型使用包括构建面板数据结构以追踪工时波动,或通过统计检验评估社会经济事件对不同群体的差异化影响。
实际应用
在实际应用中,该数据集为国际组织(如ILO)、各国劳动部门及政策智库提供了评估亚洲劳动力市场健康状况的关键工具。通过监控工时的跨年度变化,决策者能够及时发现极端超时工作或工时锐减的异常现象,从而制定针对性干预措施,例如调整劳动法规或推行弹性工作制度。同时,企业人力资源管理者可借助该数据对标行业基准,优化岗位设计与劳动负荷分配,促进员工权益与生产效率的平衡。
衍生相关工作
围绕该数据源衍生出了一系列具有重要影响力的学术工作,包括利用ILOSTAT面板数据构建的劳动投入指数研究,以及系统评估亚洲国家工时收敛性的实证论文。部分工作聚焦于性别不平等议题,通过分解工时差异解读女性劳动参与率提升背后的时间配置机制;另一些研究则将工时数据与生产率、失业率等宏观指标耦合,构建劳动市场联立方程模型。此外,基于该数据的机器学习试算工作也已展开,旨在利用时序模型预测区域工时趋势,为前瞻性政策制定提供分析支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务