遇见数据集

electricsheepasia/asia-ilo-how-temp-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲28个国家从1997年至2025年(部分数据预测到2025年)的每周实际工作平均小时数数据,共有17,062个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,指标为HOW_TEMP_SEX_INS_MTS_NB,表示按性别、公共/私营部门和婚姻状况划分的每个就业人员每周实际工作平均小时数。数据集以表格形式组织,包含国家代码、年份、观测值、数据来源、分类变量(如性别、部门、婚姻状况)等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据经过ILO的统计部门标准化处理,覆盖亚洲多个国家,包括菲律宾、伊朗、柬埔寨等,并提供数据质量说明,如年度频率、最佳来源选择和缺失值处理。

This dataset contains 17,062 observations of Mean weekly hours actually worked per employed person across 28 Asia countries, spanning from 1997 to 2025 (with some data projected to 2025). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, with the indicator HOW_TEMP_SEX_INS_MTS_NB, which measures mean weekly hours actually worked per employed person disaggregated by sex, public/private sector, and marital status. Organized in tabular format, it includes columns such as country code, year, observed value, data source, and disaggregation dimensions (e.g., sex, sector, marital status). It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting. The data is harmonized by ILOs Department of Statistics, covers multiple Asian countries including the Philippines, Iran, Cambodia, and includes data quality notes on annual frequency, best source selection, and handling of missing values.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-temp-sex-ins-mts-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,依托其REST API接口直接抽取原始指标数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT本身基于各国劳动力调查、家庭收入调查及行政记录等多元来源,并遵循国际劳工统计学家会议(ICLS)定义进行数据协调与标准化。数据集收录了自1997年至2025年间,覆盖28个亚洲国家的17,062条观测记录,聚焦于“按性别、公共/私营部门及婚姻状况划分的受雇人员每周实际工作平均小时数”这一核心指标,数据年度频率保证了时间序列的连贯性。
特点
数据集具备多维精细的分解结构,通过性别(sex)、机构部门(classif1)和婚姻状况(classif2)等分类变量,支持对工作时间的交叉分析。每条记录均附带丰富的元数据,包括数据来源、观测状态标记及注释说明,提升了数据的可追溯性与质量透明度。值得注意的是,数据在遇到同一国家与年份存在多个来源时,采用ILO筛选的“最佳来源”,确保了统计结果的一致性和可靠性。此外,数据集覆盖了从土耳其到菲律宾、从1997年至今的广泛时空范围,为亚洲劳动力市场的纵向比较研究提供了宝贵素材。
使用方法
使用者可通过HuggingFace的datasets库以一行代码加载该数据集,并将其快速转换为Pandas DataFrame进行深入分析。针对特定国家或指标的聚焦研究,支持通过筛选ref_area或indicator列实现高效子集提取。对于时间序列分析,可依据时间列排序后直接绘制变化趋势。同时,借助pivot_table功能,用户能够轻松构建以年份为行、国家为列的观测值矩阵,便于进行跨国横向对比或面板数据建模。该数据集设计为机器学习就绪(ML-ready)格式,适用于分类、回归及时间序列预测等多种下游任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)基于其核心统计数据库ILOSTAT构建,由Electric Sheep Asia于2025年重新整理并发布至HuggingFace平台。数据集聚焦于亚洲地区劳动力市场中“按性别、公共/私营部门及婚姻状况划分的受雇人员每周实际平均工作小时数”这一核心指标,覆盖28个亚洲国家、1997至2025年间共计17,062条观测值。作为全球劳动统计的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收支调查及行政记录数据,为衡量亚洲地区工作时间的结构性差异与长期趋势提供了标准化、可比较的微观数据基础,对劳动经济学、性别平等研究及可持续发展目标(SDG)中体面工作指标的监测具有重要支撑价值。
当前挑战
该数据集首要应对的领域挑战在于,亚洲各国劳动力调查在问卷设计、样本框架、时点选取与统计口径上的高度异质性,使得跨国比较面临方法论层面的根本困难。ILO虽通过国际劳工统计学家会议(ICLS)定义进行数据协调,但观测值中的“不可靠”(Unreliable)状态标记及多源冲突(同一国家-年份存在多种调查来源)问题仍揭示了整合过程中的质量折衷。在构建层面,数据提取需通过ILOSTAT REST API过滤至亚洲国家代码,并处理分解维度(如性别、机构部门与婚姻状况)间组合产生的稀疏性,同时确保年度频率数据在缺失时间点上的可追溯性,这对数据管道的一致性与可复现性构成了工程化挑战。
常用场景
经典使用场景
该数据集汇集了ILOSTAT中关于亚洲地区劳动者每周实际工作小时数的官方统计数据,覆盖28个亚洲国家、长达近三十年的时间跨度(1997至2025年),并按性别、公共/私营部门以及婚姻状况等维度进行细致分层。研究者常将其作为时间序列数据分析的素材基础,用于追踪和比较不同国家间劳动工时随经济周期、政策调整或社会变迁的演变轨迹。通过pivot操作建立国家×年份的面板数据矩阵,可便捷地开展跨区域横截面比较或纵向动态分析,直观揭示亚洲劳动市场的时空异质性特征。
解决学术问题
在劳动经济学与社会科学研究领域,该数据集有效填补了亚洲地区高质量、长时序且可比性强的工时统计数据的空白。它使得学者能够围绕劳动供给弹性、性别工资差距与工作时间的不平等分配、公共与私营部门的工时分化、婚姻状况对就业行为的影响等核心议题展开量化实证研究。凭借ILO统一标准进行数据协调,研究者得以规避各国原始调查口径不一带来的比较偏差,从而更可靠地检验劳动力市场理论在亚洲语境下的适用性,深化对发展中经济体就业质量与体面劳动实现程度的理解。
衍生相关工作
基于这一数据资源,研究社区已衍生出多项具有影响力的学术与工程成果。典型工作包括构建亚洲国家工时收敛性的动态面板模型,考察经济一体化进程中各国工时标准是否趋于一致;开发面向劳动统计的交互式可视化仪表盘,使得非专业用户也能直观探索不同人口分组下的工时分布特征;此外,该数据集常作为基准用于训练和评估各类时间序列预测模型,如季节性分解、ARIMA及深度学习模型,以预测未来数年的工时走势。这些衍生工作不仅拓展了原始数据的分析深度,也促进了劳动统计数据在跨学科研究中的普及与应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务