遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含59,761个观测值,覆盖32个亚洲国家,时间跨度为1997年至2025年,主要指标为按性别和经济活动(ISIC 2位数)分类的就业人员平均每周实际工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家,涵盖了劳动力统计中的工作时间指标。数据集结构包括国家代码、年份、指标值、性别分类(总计、男性、女性、其他)、经济活动分类等列,并提供了数据来源、观测状态和相关注释。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲地区劳动力市场的工作时间趋势。

This dataset contains 59,761 observations across 32 Asia countries, spanning from 1997 to 2025, with the primary indicator being Mean weekly hours actually worked per employed person by sex and economic activity - ISIC level 2. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Asian countries, covering labour statistics on hours of work. The dataset structure includes columns for country code, year, indicator value, sex disaggregation (total, male, female, other), economic activity classification, and provides source information, observation status, and notes. It is suitable for tasks such as tabular classification, regression, and time-series forecasting, enabling analysis of working time trends in Asian labour markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ec2-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)旗下的ILOSTAT统计数据库,通过其REST API直接抽取了指标编码为HOW_TEMP_SEX_EC2_NB的原始数据,并依据亚洲ISO3国家代码进行地域过滤。ILOSTAT在数据整合过程中,基于国际劳工统计学家会议(ICLS)定义对各国劳动调查微观数据进行了统一协调与标准化处理,每个观测值的来源通过source.label字段加以标识,保证了数据的可追溯性与可比性。最终,由Electric Sheep Asia团队将上述清洗、筛选后的结果重新封装为Parquet格式,形成了包含59,761条观测记录的机器学习就绪数据集。
特点
该数据集聚焦于亚洲区域劳动市场的核心维度,覆盖了包括土耳其、塞浦路斯、越南在内的32个亚洲国家,时间跨度从1997年延伸至2025年,提供了近三十年的连续数据。数据集仅包含一个核心指标——按性别和经济活动分类的就业人员平均每周实际工作小时数(ISIC二级分类),并根据性别维度进行了细致拆分,涵盖总、男、女及其他人四种分类。此外,每条记录均附有观测状态标志与详细注释标签,便于使用者评估数据质量与潜在局限性,整体结构紧凑、指标纯粹,适合进行区域间横向比较与纵向趋势分析。
使用方法
使用者可通过HuggingFace的datasets库直接加载该数据集,调用load_dataset函数即可获取完整的训练集DataFrame。在此基础上,能够按国家代码筛选特定国别的子集,例如提取印度尼西亚的时序数据;也可以针对单一指标进行时间序列分析,利用pandas对观测值进行排序与可视化。进一步地,通过数据透视功能,可将数据重塑为国家×年份的矩阵形式,便于跨区域比较或作为机器学习模型的结构化输入。该数据集兼容分类、回归及时间序列预测等多种任务类型,能够灵活嵌入各类劳动经济学研究与社会统计分析的标准化工作流程中。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT平台发布,并由Electric Sheep Asia在HuggingFace上重新打包整理,旨在提供亚洲地区32个国家1997至2025年间按性别和经济活动分类的周平均实际工作时间数据。作为全球劳动统计领域的权威来源,ILOSTAT整合了各国劳动力调查、家庭收入调查等数据,为研究区域劳动力市场动态提供了标准化、跨国的面板数据。该数据集的核心研究问题聚焦于亚洲不同性别与产业部门间劳动时长的差异及演变趋势,对发展经济学、劳动经济学以及国际比较研究具有重要支撑作用,推动了亚太地区工时政策与可持续发展目标(SDG)的实证分析。
当前挑战
该数据集面临的主要挑战包括:一是领域内劳动时间数据的跨国可比性问题,由于各国统计调查方法、行业分类标准(如ISIC修订版本)及数据采集频率不同,导致指标口径存在差异,需要依赖ILO的统一协调与质量标记;二是构建过程中遇到的挑战,如来自不同年代和国家的原始数据存在缺失值、异常值及状态标记(如'不可靠'),需通过复杂的数据清洗与源选择(如'最佳源'优先)流程来保证序列连续性;三是时间序列分析中的非平稳性和结构性断点问题,尤其是亚洲各国经济转型期与疫情冲击导致的工时波动,对模型预测稳定性构成考验。
常用场景
经典使用场景
该数据集的核心应用场景在于劳动经济学与社会科学领域的跨时空比较分析。通过汇聚亚洲32个国家长达近三十年的周均工时数据,并按照性别与经济活动分类(ISIC第二层级)进行细致划分,研究者能够系统性地描绘亚洲劳动力市场的工作强度变迁图谱。经典用法包括构建面板数据模型,探究经济发展阶段、产业结构转型与工作时长之间的内在关联;亦可通过时间序列分解方法,识别周期性波动与长期趋势,为理解亚洲各经济体劳动力市场的异质性提供坚实的数据基础。
衍生相关工作
围绕该数据集已衍生出若干具有代表性的研究工作。其中,基于ILOSTAT体系结合经济周期指标的跨国比较分析,揭示了亚洲新兴经济体从农业向服务业转型过程中工时与生产率关系的动态演变。另一类经典工作则聚焦于性别差异,利用面板回归模型量化了教育水平、生育政策与女性非正规就业对周均工时的交互影响。此外,该数据还常被用于构建预测模型,结合宏观经济变量对短期劳动力市场波动进行情景推演,推动了计算社会科学与劳动经济学的交叉融合。
数据集最近研究
最新研究方向
围绕亚洲地区劳动者实际工作时间的跨国比较与分解,该数据集为劳动经济学与时间利用研究提供了高颗粒度的面板数据。前沿方向聚焦于利用长时序观测(1997–2025)与性别、经济活动类别等交叉维度,揭示后疫情时代亚洲各国工作模式的分化趋势——例如性别间工时差异的收敛或扩大、非正规就业与实际工作时间的关联,以及制造业与服务业之间工时弹性变迁。在国际劳工组织(ILO)推动体面劳动与可持续发展目标(SDG)的背景下,该数据为验证“工作时间与劳动生产率脱钩”假说、评估区域性劳动法规改革效果提供了可复现的实证基础,尤其支撑了对东南亚和西亚新兴经济体劳动市场调整机制的量化建模。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务