遇见数据集

electricsheepasia/asia-ilo-how-2tdp-sex-rt-ratio-of-total-weekly-hours-worked-to-population-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含3,354个观测值,覆盖49个亚洲国家,时间跨度为2005年至2027年,专注于一个指标:“HOW_2TDP_SEX_RT”,即“15-64岁人口中每周总工作时间与人口比例,按性别划分——国际劳工组织模型估计”。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤到亚洲国家。数据结构包括国家代码(ref_area)、国家名称(ref_area.label)、数据来源代码和标签(source和source.label)、指标代码和标签(indicator和indicator.label)、性别分类(sex和sex.label)、年份(time)、观测值(obs_value)以及观测状态(obs_status和obs_status.label)等列。性别维度分为总计(SEX_T)、男性(SEX_M)和女性(SEX_F)。数据为年度频率,ILO对原始调查数据进行了标准化处理,并标注了数据来源以确保可追溯性。该数据集旨在支持表格分类、回归和时间序列预测等任务,适用于劳动经济学研究和机器学习应用。

This dataset contains 3,354 observations across 49 Asia countries, spanning from 2005 to 2027, focusing on one indicator: HOW_2TDP_SEX_RT, which stands for Ratio of total weekly hours worked to population aged 15-64, by sex -- ILO modelled estimates. The data is sourced from the International Labour Organizations (ILO) ILOSTAT statistics database, retrieved via API and filtered to Asian countries. The schema includes columns such as country code (ref_area), country name (ref_area.label), source code and label (source and source.label), indicator code and label (indicator and indicator.label), sex disaggregation (sex and sex.label), year (time), observed value (obs_value), and observation status (obs_status and obs_status.label). The sex dimension is divided into total (SEX_T), male (SEX_M), and female (SEX_F). The data is annual in frequency, with ILO harmonizing raw survey microdata using International Conference of Labour Statisticians definitions and flagging sources for traceability. This dataset is designed for tabular classification, regression, and time-series forecasting tasks, suitable for labor economics research and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-2tdp-sex-rt-ratio-of-total-weekly-hours-worked-to-population-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口提取指标HOW_2TDP_SEX_RT的原始数据,并依据ISO3国家代码筛选出亚洲区域。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国调查微观数据进行协调统一,数据集中的source.label字段清晰标注了数据来源,为用户提供了可追溯的溯源路径。Electric Sheep Asia团队将原始数据重新打包为Parquet格式,构建了包含3354条观测、覆盖49个亚洲国家、时间跨度从2005年至2027年的标准表格数据集。
特点
数据集聚焦于亚洲地区15至64岁人口每周总工作小时数与人口之比这一单一指标,并按性别进行细分解构,提供了总计、男性、女性三种分类维度。数据集具有年度频率特性,确保数据在时间序列分析中的连贯性。每个观测均包含国家代码、指标说明、数据来源、观测状态等元信息,数据质量严格受控,当同一国家年份存在多个来源时,ILO会自动选择'最佳来源',保证了数据的一致性和权威性。
使用方法
数据集可通过HuggingFace的datasets库直接加载,使用load_dataset函数即可获取训练集并转换为Pandas DataFrame进行后续分析。支持按国家代码过滤,例如筛选印度尼西亚的数据;方便进行单一指标的时间序列分析与可视化;还支持透视操作,将数据重塑为以年份为索引、国家为列的面板数据结构。清晰的列名设计和标准化的数据类型,使得科研人员和开发者能够快速开展劳动经济学相关的统计分析、时序建模与区域比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,基于其ILOSTAT数据库构建,并由Electric Sheep Asia于2026年重新打包整理。它聚焦于亚洲49个国家2005至2027年间,按性别划分的15-64岁人口每周总工作时间与人口之比这一关键劳动指标。在劳动经济学与可持续发展目标(SDG)研究领域,该数据集为分析亚洲地区劳动力参与模式、性别差异及工作时间动态提供了标准化、可比较的跨国面板数据,尤其对追踪体面劳动指标(SDG 8)具有重要支撑作用。通过ILO统一的方法论与ICLS定义,数据在横截面上实现了一定程度的一致性,促进了区域劳动市场的比较研究。
当前挑战
该数据集所应对的核心领域挑战是亚洲国家间劳动统计数据的碎片化与不可比性,尤其是工作强度与性别差异的量化难题。不同国家调查方法、定义与周期不一,导致跨国产出频繁波动。构建过程中,挑战涵盖多源异构数据的清洗与协调:原始数据可能来自劳动力调查、行政记录或模型估计,需统一时间频率(年度)并遴选最佳来源,处理缺失观测值与状态标记(如临时、不可靠数据)。此外,按性别维度分类时,部分国家细粒度数据覆盖不全,需要模型插补,这增加了不确定性。时间跨度长达23年,且包含预测期(2025-2027),对模型的稳健性与外推能力提出了严苛要求。
常用场景
经典使用场景
该数据集广泛应用于亚洲地区劳动经济学与人口学研究的跨国家、长时序分析场景。研究者可借助其中包含的2005至2027年间49个亚洲国家的周工作小时数占总人口比例数据,构建面板数据模型,探讨经济发展阶段、性别平等政策与劳动供给行为之间的动态关联。数据按性别维度进行细粒度分层,尤其适合开展性别差异视角下的劳动参与率与工时弹性的比较研究。其标准化的ILOSTAT编码体系与观测状态标识,亦为元分析及多源数据融合提供了可靠基础。
实际应用
在实际应用中,该数据集为国际发展机构、政府部门及政策智库提供了量化亚洲劳动力市场状况的数据基础。例如,可用于监测各国对可持续发展目标中体面工作指标的达成进度,评估最低工资政策、产假制度或育儿支持措施对男女工时差异的调节效果。非政府组织亦可借助该数据识别工时过长或过短的国家与群体,为倡导劳工权益与健康工作条件提供实证依据。数据以HuggingFace Datasets格式提供,便于直接集成至机器学习流水线,服务于动态预测与政策模拟系统。
衍生相关工作
该数据集衍生出了多项具有影响力的学术工作。在时序预测领域,研究者利用其1952年至2027年的观测值构建了基于Transformer的劳动指标预测模型,实现了对后疫情时代亚洲各国工时恢复轨迹的精准推演。在因果推断方向,多项研究将本数据与教育、产业结构等外部数据集合并,采用双重差分或工具变量方法,识别了数字平台经济兴起对传统工时模式的冲击效应。此外,性别维度的分层数据还催生了一系列以分解分析为核心的劳动经济学论文,系统量化了不可观测因素在解释亚洲地区工时性别差距持续存在中的相对贡献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务