遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲32个国家从1997年至2025年间的359,636条观测数据,核心指标为平均每周实际工作时长(Mean weekly hours actually worked per employed person),按性别、经济活动和教育程度进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取,并过滤为亚洲国家代码。数据集采用表格形式,包含多个字段:国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source.label)、指标代码(indicator)、性别分类(sex)、经济活动和教育分类(classif1, classif2)、观测年份(time)、观测值(obs_value)以及数据状态标志(obs_status)等。该数据集适用于机器学习任务,如表格分类、回归分析和时间序列预测,可用于研究亚洲劳动力市场的工作时间趋势、性别差异、经济部门影响等。数据经过ILO harmonisation处理,确保符合国际劳工统计会议(ICLS)定义,并标注了来源以便追溯。数据集以Parquet格式发布,方便通过HuggingFace的datasets库直接加载使用。

This dataset contains 359,636 observations of Hours of work data across 32 Asia countries, spanning from 1997 to 2025. The primary indicator is Mean weekly hours actually worked per employed person by sex, economic activity and education (HOW_TEMP_SEX_ECO_EDU_NB). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Asia ISO3 country codes. The dataset is structured in tabular format with columns including country code (ref_area), country name (ref_area.label), data source (source.label), indicator code (indicator), sex disaggregation (sex), economic activity and education classifications (classif1, classif2), observation year (time), observed value (obs_value), and observation status flags (obs_status). It is designed for machine learning tasks such as tabular classification, regression, and time-series forecasting, enabling analysis of labor market trends, gender disparities, and sectoral impacts in Asia. Data is harmonized using ICLS definitions and includes source traceability. The dataset is packaged as Parquet and accessible via HuggingFace Datasets for easy integration.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
在劳动统计领域,工作时长是评估劳动力市场状况与劳动者福祉的重要指标。该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,经由Electric Sheep Asia团队从ILOSTAT REST API直接提取并重新打包而成。原始数据基于各国家劳动力量调查、家庭收入调查及行政记录等多元来源,并依据国际劳工统计学家会议(ICLS)定义进行统一化处理。筛选范围限定于32个亚洲国家的ISO3代码,覆盖1997年至2025年间共计359,636条观测记录。数据经过规范化模式整理并存储为Parquet格式,确保研究人员可通过标准化接口便捷调用。
使用方法
数据集的使用极为简便,依托HuggingFace Datasets库,用户仅需通过`load_dataset()`函数即可一键加载并转换为Pandas DataFrame格式,实现与主流数据分析工作流的无缝衔接。举例而言,可通过过滤`ref_area`列锁定特定国家(如印度尼西亚)的时序数据,或基于`indicator`列筛选核心指标后按年份排序进行可视化趋势分析。更高级的操作包括利用`pivot_table`构建国家×年份的观测矩阵,以便进行面板数据分析或横向比较。此类灵活的数据处理能力使得该数据集既适用于入门级的探索性分析,也足以支撑时间序列预测等复杂建模任务。
背景与挑战
背景概述
劳动时间作为劳动力市场运行的核心指标,直接映射了一国劳动者的工作强度、生产效率与就业质量,是国际劳动组织(ILO)长期追踪的关键统计变量。该数据集由国际劳工组织统计司(ILOSTAT)于2025年发布,经Electric Sheep Asia重新封装,聚焦亚洲区域,收录了1997年至2025年间32个亚洲国家的359,636条观测记录,核心研究问题在于揭示不同性别、经济活动部门与教育背景下的每周实际工作时长分布规律。作为ILOSTAT全球劳动统计体系在亚洲的精细化切片,该数据集为跨国比较劳动市场结构性差异、评估体面劳动进展以及验证人力资本理论提供了高分辨率的数据基础,在劳动经济学、发展经济学与国际比较研究领域具有重要的实证价值。
当前挑战
该数据集面临的核心领域挑战在于跨越经济发展水平悬殊的32个亚洲国家,如何准确捕捉并比较不同劳动力市场制度、非正规经济占比各异背景下的工时特征,尤其需要克服因各国调查频率、定义口径与数据质量控制标准不一致导致的统计异质性问题。在构建过程中,主要挑战包括:1)从ILOSTAT REST API中精准提取亚洲国家子集,需处理复杂的ISO3代码过滤与多指标嵌套字段;2)应对多源数据在相同国家—年份组合中的择优问题,即ILO选取的‘最佳来源’可能与研究者偏好存在偏差;3)对非标准化教育分类、临时工作状态等离散维度进行逻辑一致性校验,例如处理带有注释标记‘C3:2620’的特殊分类;4)将原始月度或季度数据统一归约为年度频次,过程中需权衡信息损失与可比较性,同时确保性别与经济活动交叉分组下的观测值完整性。
常用场景
经典使用场景
该数据集广泛应用于劳动力经济学与公共政策研究领域,尤其聚焦于亚洲各国劳动者平均每周实际工作时长的宏观测度。研究者可借助性别、经济活动部门与教育水平的三维分层结构,深入刻画不同社会群体在劳动供给行为上的异质性模式。经典使用方式是将‘obs_value’作为回归模型的目标变量,通过时间序列与面板数据分析,揭示经济发展阶段、产业结构转型与人力资本积累对工作时长演变的驱动机制。该数据集的年度频率和跨国可比性使其成为研究亚洲劳动力市场动态变迁的基石型资源。
解决学术问题
该数据集有效解决了亚洲地区缺乏跨国家、跨时段、分维度一致的工时统计数据的学术困境。传统研究中,各国统计调查口径与分类标准不统一常导致跨国比较结果失真。ILOSTAT基于国际劳工统计学家会议(ICLS)定义进行数据调和,使研究者得以控制性别、经济活动与教育层次等混杂变量,更精准地识别工时变化背后的结构性驱动因素。这一数据集推动了关于亚洲劳工权益、性别平等与教育回报率等议题的实证研究,为验证劳动力供给理论在不同经济发展水平国家的适用性提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集的精细化分层结构可直接服务于国际组织与国家政府的劳动政策评估与制定。通过按性别与教育背景分组的工时数据,政策制定者能够识别出特定弱势群体(如低教育水平的女性劳动者)的劳动负担状况,进而设计针对性干预措施,如加班保护法规或职业培训计划。对于跨国企业的人力资源规划而言,该数据有助于评估不同亚洲国家的劳动供给潜力,辅助供应链管理中的合规性审查与社会责任报告编制。此外,数据集可作为宏观经济模型中劳动要素投入的关键输入参数。
数据集最近研究
最新研究方向
该数据集聚焦于亚太地区就业人员实际周均工作时间的多维度解构,尤其通过性别、经济活动领域与教育水平的交叉分类,为劳动经济学与时序预测研究提供了精细化的微观数据支撑。在当前全球关于工作强度、性别平等与人力资本配置的热点讨论中,这一数据集的价值尤为凸显:它使研究者能够追踪亚洲32国近三十年间劳动力市场结构性变迁的轨迹,深入探讨不同教育层次女性在非正规经济与弹性用工模式下的工时变化,以及技术进步如何重塑行业间的工作负荷分布。凭借ILOSTAT标准化的调查方法与庞大的观测样本,该数据已成为分析后疫情时代亚洲劳动力恢复韧性、评估体面劳动政策效能以及构建跨国就业预测模型的关键基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务