遇见数据集

electricsheepasia/asia-ilo-how-xees-sex-cct-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲地区按性别和公民身份划分的员工平均每周实际工作小时数的统计信息,源自国际劳工组织(ILO)的ILOSTAT数据库。数据集涵盖18个亚洲国家(如塞浦路斯、伊朗、文莱等),时间跨度为1999年至2024年,共775个观测值。核心指标为HOW_XEES_SEX_CCT_NB,表示按性别和公民身份划分的员工平均每周实际工作小时数。数据通过ILOSTAT REST API获取,并经过标准化处理,包括国家代码、指标代码、性别分类(总计、男性、女性)、观测年份、观测值等字段。数据集适用于表格分类、回归和时间序列预测任务,可用于分析亚洲劳动力市场的工作时间趋势。

This dataset contains statistical information on the mean weekly hours actually worked per employee by sex and citizenship in Asia, sourced from the International Labour Organization (ILO)s ILOSTAT database. It covers 18 Asian countries (e.g., Cyprus, Iran, Brunei) from 1999 to 2024, with 775 observations. The core indicator is HOW_XEES_SEX_CCT_NB, which represents Mean weekly hours actually worked per employee by sex and citizenship. Data is retrieved via the ILOSTAT REST API and normalized, including fields such as country codes, indicator codes, sex disaggregation (total, male, female), observation year, and observed values. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of working time trends in Asian labor markets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-how-xees-sex-cct-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标代码为HOW_XEES_SEX_CCT_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的一致性处理,来源信息在source.label列中完整保留,以确保数据可追溯。最终由Electric Sheep Asia团队重新打包为适用于机器学习的标准化格式。
特点
数据集涵盖18个亚洲国家,时间跨度从1999年至2024年,共计775条观测记录。核心指标为按性别和公民身份划分的雇员每周实际工作平均小时数,包含总计时、男性和女性三个细分维度。数据以年度频率发布,当存在多个来源时采用ILO选定的最佳来源,且只有发布该细分数据的指标才会填充对应的性别或分类列。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载数据,返回的DataFrame包含ref_area、time、obs_value等字段。支持按国家筛选、按指标进行时间序列分析,以及通过pivot_table构建国家×年份的矩阵视图。该数据集特别适用于劳动力市场的比较研究、性别差异分析及跨国时间趋势建模。
背景与挑战
背景概述
在全球劳动力市场的动态演化中,工作时间的精确测度对于评估劳动强度、生产效率及工作质量至关重要。该数据集由国际劳工组织(ILO)统计部门开发,经Electric Sheep Asia于2024年重新整理并发布至HuggingFace平台,聚焦于按性别与公民身份划分的亚洲雇员平均每周实际工作小时数。数据集涵盖18个亚洲国家,时间跨度从1999年至2024年,共包含775条观测记录,为研究者提供了来自ILOSTAT统一标准的年度聚合数据。其核心研究问题在于揭示亚洲地区不同性别的本地与外国雇员在工作时长上的结构性差异,进而为劳动力迁移与性别平等政策提供实证基础。该数据集填补了亚洲区域在劳动力时间使用方面精细化比较的空白,对劳动经济学、移民研究及可持续发展目标(SDG)的监测具有重要支撑作用。
当前挑战
该数据集面临的核心挑战首先源自所解决的领域问题:亚洲劳动力市场中,不同国籍与性别的劳动者工作时长受到制度环境、文化规范及经济周期等多重因素的交织影响,导致跨国的可比性构建尤为困难。ILO虽通过国际劳工统计学家会议(ICLS)定义进行数据协调,但各国调查口径、抽样方法与数据质量参差不齐,使得标准化过程存在偏差风险。其次,在构建过程中,数据集依赖于各国劳动调查与行政记录的年度数据,部分国家某些年份的观测值缺失严重,且数据来源标记为“不可靠”的比例较高,如示例中obs_status字段显示为U(不可靠),直接影响了模型训练的鲁棒性。此外,数据维度有限,仅包含性别的三分组(总、男、女)与单一公民身份分类,缺乏年龄、教育水平及行业等关键协变量,限制了深层因果推断的可能性。时间序列的非连续性与观测点稀疏(如不丹仅有2021年一条记录)进一步加剧了预测模型的泛化挑战。
常用场景
经典使用场景
该数据集基于国际劳工组织(ILO)ILOSTAT统计数据库中的核心指标‘HOW_XEES_SEX_CCT_NB’,即按性别和国籍划分的雇员每周实际平均工作小时数,覆盖1999年至2024年间18个亚洲国家的775条观测记录。其细粒度分类维度(性别与公民身份)使得研究者能够深入剖析亚洲劳动力市场中不同群体的劳动供给特征。在经典应用场景中,研究者可借助该数据集进行时间序列分析,追踪特定国家或地区劳动者工作时间的长期演变趋势;亦可利用面板数据结构,构建跨国比较模型,揭示亚洲各国在劳动强度与就业质量上的异质性。此外,通过分性别子集,该数据集为探讨劳动力市场中的性别差异提供了坚实的数据基础,尤其适合应用于劳动经济学中关于工作与生活平衡、非正规就业等议题的实证研究。
实际应用
在现实世界的应用场景中,该数据集为国际组织、政府机构及政策智库提供了宝贵的决策支持资源。通过跟踪亚洲多国劳动者每周实际工作时长的波动与趋势,劳工部门能够动态监测劳动力市场健康状况,识别潜在的工作条件恶化或过度劳动问题,并据此制定更加精准的劳动保护法规,如合理工时上限与加班补偿政策。同时,数据集所揭示的性别工时差异,可作为评估性别平等政策成效的客观指标,推动各国优化育儿假、灵活就业等制度安排。对于关注亚洲跨境移民劳动权益的非政府组织而言,该数据亦可用于评估移民工群体的劳动负担,从而有针对性地开展社会倡导与服务项目。此外,该数据的高时间频率与国家覆盖范围,使其在企业人力资源战略规划与跨国用工成本分析中也具有实用价值。
衍生相关工作
该数据集的存在与开放发布催生了若干具有影响力的衍生学术工作。基于其标准化的面板结构,研究者构建了亚洲区域劳动供给的时间序列预测模型,利用机器学习和计量经济学方法对未来工时变化进行推断,为劳动力市场预警系统提供核心输入。此外,以该数据为实证基础,部分学者开发了跨国劳动力性别不平等的综合评价指标体系,将工时数据与工资、劳动参与率等信息融合,形成多维度的性别劳动差距指数。在劳动健康经济学领域,研究者还利用该数据集分析了长时间工作与劳动者身心健康之间的统计关联,并探索不同国籍背景下的调节效应。这些衍生工作不仅拓展了原始数据的应用边界,也进一步巩固了ILOSTAT作为全球劳动统计权威来源的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务