遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,专注于亚洲地区33个国家从1996年至2025年员工实际平均每周工作小时数(按性别划分)。数据集共有1,080个观测值,涵盖一个独特指标(HOW_XEES_SEX_NB),该指标表示按性别划分的员工实际平均每周工作小时数。数据通过ILOSTAT REST API获取,并经过ILO使用国际劳工统计学家会议(ICLS)定义进行标准化处理,以确保一致性和可比性。数据集包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性、其他)、观测年份、观测值、观测状态和相关注释等列,适用于表格分类、回归和时间序列预测等任务。数据以年度频率提供,并包含数据质量说明,如使用ILO选择的最佳来源。

This dataset contains statistical data sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on the actual average weekly working hours of employees disaggregated by gender across 33 countries in the Asian region from 1996 to 2025. It consists of 1,080 observations, covering a unique indicator (HOW_XEES_SEX_NB), which represents the actual average weekly working hours of employees disaggregated by gender. The data was obtained via the ILOSTAT REST API and standardized by the ILO in accordance with the definitions set by the International Conference of Labour Statisticians (ICLS) to ensure consistency and comparability. The dataset includes columns such as country code, country name, data source, indicator code, indicator label, gender classification (total, male, female, other), observation year, observed value, observation status, and related annotations. It is applicable for tasks including tabular classification, regression, and time series forecasting. The data is provided at an annual frequency and includes data quality notes, such as the use of the best sources selected by the ILO.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集来源于国际劳工组织(ILO)旗下的ILOSTAT数据库,专注于亚洲地区雇员平均每周实际工作时间的统计。数据通过ILOSTAT REST API直接获取,原始指标代码为HOW_XEES_SEX_NB,并依据亚洲ISO3国家代码进行地域筛选。ILOSTAT遵循国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、住户收入调查等微观数据进行标准化处理,同时保留source.label字段以追溯数据来源,确保了统计口径的一致性与数据的可溯源特性。最终产出的数据集包含1080条观测记录,覆盖33个亚洲国家,时间跨度为1996年至2025年。
特点
该数据集以时间序列为核心组织形态,提供了年度频率的观测值(obs_value),并包含丰富的元数据列如obs_status(数据状态标识)与note_indicator(方法修订说明),便于研究者评估数据质量。在维度划分上,数据集支持按性别(sex)进行拆分,涵盖总人口、男性、女性及其他类别,为性别维度的劳动经济学分析提供了基础。同时,每一条记录都标明了数据来源(source)与具体国家代码(ref_area),使得多源比较与跨国研究成为可能。整体数据规模适中,格式规整,适合进行面板数据建模与趋势分析。
使用方法
研究者可通过HuggingFace的datasets库直接加载该数据集,例如执行from datasets import load_dataset; ds = load_dataset("electricsheepasia/asia-ilo-how-xees-sex-nb-mean-weekly-hours-actually-worked-per-employee-by"),随后转换为pandas DataFrame进行操作。针对单一国家的分析,可依据ref_area列进行过滤,例如df[df["ref_area"] == "IDN"]。若需开展时间序列建模,可按indicator筛选后按time排序,并使用pivot_table函数构建以时间为行、国家为列的面板矩阵,便于跨国家、跨时段的比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库构建,并由Electric Sheep Asia重新打包发布至HuggingFace平台,旨在提供亚洲33个国家1996年至2025年间按性别划分的雇员平均每周实际工作小时数。ILOSTAT作为全球劳动统计的权威来源,整合了各国劳动力调查、家庭收入调查等多源数据,经国际劳工统计大会定义进行统一协调。该数据集聚焦于工作时间这一核心劳动经济指标,为理解亚洲地区劳动力市场动态、性别差异及跨时空比较提供了结构化、机器可读的时序观测数据,对劳动经济学、公共政策及可持续发展目标监测具有重要支撑作用。
当前挑战
该数据集所应对的领域挑战在于,亚洲各国工作时间数据的采集标准与统计口径差异显著,原始调查质量参差不齐,导致跨国比较面临方法学障碍。ILOSTAT虽通过ICLS定义进行数据协调,但数据集内仍存在因方法论修订或调查更换引起的序列断裂问题(如'Break in series'标记),以及部分观测值被标记为临时性或不可靠(如'obs_status'字段)。构建过程中的挑战则源于数据源的异构性:需从ILOSTAT REST API抽取原始数据,并依据ISO3国家代码筛选亚洲区域,同时保留' source'列以追溯不同来源的调查类型,确保数据溯源清晰。
常用场景
经典使用场景
该数据集在劳动经济学与比较发展研究领域具有核心应用价值。基于国际劳工组织ILOSTAT的标准化框架,汇聚了1996至2025年间33个亚洲国家雇员实际周均工作小时数的性别细分数据,共计1080条观测记录。经典的使用场景包括:构建跨国的性别劳动投入面板数据模型,评估亚洲各国男女就业者在工时贡献上的差异与演变趋势;利用时间序列分析方法追踪特定国家(如印尼、韩国、土耳其)的工时变动规律,识别金融危机、疫情冲击等外生事件对劳动力市场的结构性影响;为全球劳动标准研究提供亚洲区域视角下的实证基础,支撑比较制度分析。
解决学术问题
该数据集着力回应了劳动经济学中若干关键学术议题。其一,通过长时段且跨国的性别分解工时数据,解决了传统宏观数据难以细致描绘女性劳动参与强度与质量的问题,为研究性别工资差距、职业隔离以及“时间贫困”现象提供了可靠的代理变量。其二,数据覆盖了亚洲各国从工业化中期到后疫情时代的完整周期,使学者能够考察经济发展阶段、劳动力市场政策(如带薪休假、最低工时立法)与工时结构之间的复杂因果联系。其三,ILOSTAT的数据同质化处理流程(遵循ICLS定义)保证了跨国可比性,从而消弭了因统计口径差异导致的分析偏误,显著促进了亚洲区域劳动市场比较研究的科学性和可信度。
衍生相关工作
围绕该核心数据集,学界与工业界已发展出一系列衍生的经典工作。在学术层面,研究者常将其与ILOSTAT的其他模块(如薪资数据、失业率数据)进行耦合,构建劳动市场综合指标库,从而开展诸如“东亚模式下的工时-生产率悖论”或“性别弹性就业偏好与工时陷阱”等专题分析。在方法创新上,基于该数据集的时间格式与面板结构,催生了针对亚洲劳动市场的高精度时序预测模型(如Prophet与长短期记忆网络的变体),用于预测未来数年的平均工时趋势。数据工程领域同样受益于此,例如通过公共数据管道(如Electric Sheep Asia的预处理流程)实现了多源异构劳动统计数据的标准化、归并与版本控制,进而形成一个可复用的、机器学习就绪的亚洲劳动数据集族,深刻推动了区域劳动经济大数据生态的建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务