遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-eco-ins-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含64,481个观测值,覆盖30个亚洲国家,时间跨度为1997年至2025年,专注于工作时间主题。核心指标为按性别、经济活动和公共/私营部门划分的就业人员实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过权威调查(如劳动力调查)收集并经过标准化处理。数据集为表格格式,包含国家代码、年份、性别分类、经济活动和机构部门分类、观测值及数据状态等列,适用于表格分类、回归或时间序列预测等机器学习任务。

This dataset contains 64,481 observations across 30 Asia countries, spanning from 1997 to 2025, focusing on the topic of hours of work. The key indicator is Mean weekly hours actually worked per employed person by sex, economic activity and public/private sector. Data is sourced from the ILOSTAT database of the International Labour Organization (ILO), collected through authoritative surveys (e.g., labour force surveys) and harmonized. The dataset is in tabular format, including columns such as country code, year, sex disaggregation, economic activity and institutional sector classifications, observed values, and data status flags, suitable for machine learning tasks like tabular classification, regression, or time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-eco-ins-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接抽取指标代码为HOW_TEMP_SEX_ECO_INS_NB的原始数据,并依据亚洲ISO3国家代码进行地域筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家计调查等微观数据进行协调与标准化,数据来源在source.label列中予以标注,确保了跨国的可比性与可追溯性。数据经Electric Sheep Asia二次封装后,以Parquet格式统一发布,研究者可直接调用HuggingFace的load_dataset()函数快速获取包含64,481条观测、覆盖30个亚洲国家、时间跨度从1997年至2025年的结构化面板数据。
特点
本数据集的核心特点在于其精细的多维分类结构。除了提供30个亚洲国家长达近三十年的“实际每周平均工作时长”指标外,数据还按性别(sex)细分为总、男、女及其他共四类,并结合经济活动部门(classif1)与制度部门(classif2)进行交叉分组。每一观测值均附有观察状态标记(obs_status),用以标识数据是否为初步估计或不可靠值,提升了数据应用的审慎性。数据为年度频率,且优先采用ILO选定的“最佳来源”,在国别与年份层面保证了数据质量,为劳动经济学的时间序列分析与面板数据建模提供了坚实可靠的基础。
使用方法
用户可通过Python的datasets库轻松加载数据:load_dataset('electricsheepasia/asia-ilo-how-temp-sex-eco-ins-nb-mean-weekly-hours-actually-worked-per-employed-per'),并转换为pandas DataFrame进行后续分析。典型应用包括按国别过滤(如df[df['ref_area'] == 'IDN'])以聚焦单一国家,或按指标排序后绘制obs_value随time变化的时间序列图。对于多国比较,可借助pivot_table将数据重塑为国家×年份的矩阵形式,便于构建面板数据模型或进行可视化探索。数据还支持按性别、经济活动等维度进行分组聚合,为研究亚洲地区工时差异及其结构化特征提供了便捷的编程接口。
背景与挑战
背景概述
在全球劳动市场格局深刻演变的背景下,工时数据作为衡量劳动力利用强度与就业质量的核心指标,对于揭示区域经济发展、性别平等及行业结构性变迁具有重要意义。由国际劳工组织(ILO)统计部门牵头建立、经Electric Sheep Asia于2025年重新整理并发布的该数据集,汇集了亚洲30个国家1997年至2025年间共64,481条观测记录,聚焦“按性别、经济活动及公共/私营部门划分的受雇人员平均每周实际工作小时数”这一单一指标。该数据集依托ILOSTAT这一全球劳动统计权威数据库,其数据来源覆盖全国劳动力调查、住户收支调查与行政记录,并采用国际劳工统计学家会议(ICLS)定义进行标准化处理,从而为跨国家、跨时期的比较研究奠定了坚实的数据基础。在亚洲区域经济一体化加速、非正规就业普遍存在以及性别劳动参与差异显著的背景下,该数据集为劳动经济学、政策评估和可持续发展目标(SDG)中的体面劳动监测提供了不可多得的纵向分析素材,有力推动了基于证据的区域劳动力政策研究与机器学习应用。
当前挑战
该数据集所应对的核心领域挑战在于:亚洲各国劳动统计体系发展不均衡,工时数据在跨国比较中面临定义差异、采集频率不一及质量参差不齐的困境。具体而言,不同国家采用的调查工具与抽样框架迥异,导致同一国家不同年份或不同国家间的数据可比性受到严重制约;同时,非正规经济领域中的工时信息往往难以获取,可能造成统计失真。在数据集构建过程中,挑战亦十分突出:原始数据从ILOSTAT的REST API获取,需对亚洲30个国家的ISO3代码进行精确筛选,并处理多源数据中因调查渠道不同而产生的数据冲突,最终仅保留ILO选定的“最佳来源”以保证一致性。此外,由于指标按性别、经济活动及体制部门进行多维细分解聚,分类变量(如sex、classif1、classif2)在不同观测中可能缺失,增加了数据清洗与结构规范的复杂性。鉴于部分年度的观测状态被标记为“不可靠”或“临时性”,如何在保持数据完整性前提下合理标注并指导用户审慎使用,亦是该数据集整理中的关键权衡。
常用场景
经典使用场景
在劳动经济学与发展经济学领域,该数据集最经典的使用场景是进行跨国、跨时期的亚洲劳动市场比较分析。通过整合30个国家近三十年、涵盖性别与经济行业分类的周均工时数据,研究者可以系统剖析亚洲各国劳动强度的时空演变规律,为理解不同发展阶段下的就业质量、劳动力利用程度与性别分工差异提供坚实的数据基础。
衍生相关工作
该数据集衍生出多项具有影响力的学术工作。在方法论层面,研究者利用其长面板特征开发了面向非平衡面板的劳动指标贝叶斯插值模型,填补了缺失数据下的跨国比较技术空白。在实证层面,基于该数据集的工作揭示了亚洲女性在非正规部门的隐性劳动时长问题,修正了传统统计对女性劳动力贡献的低估;另一分支则聚焦于工业化进程中的工时收敛假说,发现亚洲并未呈现简单的趋同模式,而是形成了差异化的劳动制度簇群。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区平均每周实际工作时长的跨国比较与时间序列分析,为劳动力市场监测提供了精细化的结构化数据基础。在当今全球劳动形态转型与‘零工经济’兴起的背景下,研究者正借助此类ILOSTAT标准化统计数据,深度剖析性别、经济活动部门与公共/私营体制对工作时长的差异化影响,尤其关注亚洲新兴经济体在数字化转型与产业政策调整过程中,工作时长分化对就业质量、生产力及劳动者福祉的多维映射。数据集覆盖1997年至2025年30国逾6.4万观测值,有力支撑了面板数据回归、时序预测及异质性分析等前沿计量方法的应用,为国际劳工组织推动的体面劳动议程与可持续发展目标(SDG 8)的量化评估提供了可靠证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务