遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-how-nb-employees-by-sex-and-weekly-hours-actually-worked

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲地区雇员统计的表格型数据集,专门用于分类、回归和时间序列预测任务。它包含了来自国际劳工组织(ILO)ILOSTAT数据库的9,453个观测值,覆盖37个亚洲国家,时间范围从1996年到2025年。核心指标是EES_TEES_SEX_HOW_NB,即按性别和每周实际工作小时数划分的雇员数量(以千计)。数据提供了详细的细分维度,包括性别(总计、男性、女性等)和工作小时数波段。数据集结构包含国家代码、国家名称、数据来源、指标代码、性别分类、观测年份、观测值(雇员数量)以及数据状态标志等列。数据经过ILO根据国际劳工统计学家会议(ICLS)定义进行协调处理,并标注了来源以便追溯。该数据集旨在为研究亚洲劳动力市场、就业模式和工作时间趋势提供机器学习就绪的数据支持。

This dataset is a tabular dataset focusing on employee statistics in Asia, designed for tasks like tabular classification, regression, and time-series forecasting. It contains 9,453 observations sourced from the ILOSTAT database of the International Labour Organization (ILO), covering 37 Asian countries from 1996 to 2025. The key indicator is EES_TEES_SEX_HOW_NB, which represents Employees by sex and weekly hours actually worked (in thousands). The data includes detailed disaggregation dimensions such as sex (total, male, female, etc.) and hour bands. The schema comprises columns like country code, country name, data source, indicator code, sex classification, observation year, observed value (number of employees), and observation status flags. The data is harmonized by the ILO using International Conference of Labour Statisticians (ICLS) definitions, with sources flagged for traceability. This dataset serves as a machine-learning-ready resource for studying labor markets, employment patterns, and working time trends in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-how-nb-employees-by-sex-and-weekly-hours-actually-worked 数据集图片
构建方式
该数据集以国际劳工组织统计数据库(ILOSTAT)为权威来源,通过其REST API接口直接提取指标EES_TEES_SEX_HOW_NB的原始记录,并依据亚洲ISO3国家代码进行系统筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行标准化调和,源数据标签列保留了可追溯的原始调查信息。经Electric Sheep Asia重新打包后,数据以Parquet格式发布,涵盖37个亚洲国家、1996至2025年间共计9,453条观测,构建过程兼顾了数据来源的权威性与机器学习的易用性。
特点
数据集聚焦于亚洲地区按性别及实际周工作时间分组的雇员人数统计,时间跨度近三十年,覆盖37个国家,拥有9,453条观测记录。其核心特点在于多维 disaggregation 设计,通过sex、classif1等分类变量支持性别、小时波段等维度的细分分析,并附有观测状态标志和详细的注释标签以标识数据可靠性及方法变更。数据以年度频率发布,结构整洁,包含ISO国家代码、指标编码、源调查信息等元数据,便于跨国比较和时序建模。
使用方法
使用者可通过HuggingFace datasets库以一行代码加载数据,并转换为Pandas DataFrame进行灵活操作。例如,筛选特定国家(如印度尼西亚)或单一指标(EES_TEES_SEX_HOW_NB)后按时间排序,可绘制时间序列图;利用pivot_table函数可快速生成国家×年份矩阵,服务于面板数据分析。该数据集适用于表格分类、回归及时间序列预测等任务,加载后即可开展统计探索或机器学习建模,显著降低数据预处理成本。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的标准化与传播,其核心数据库ILOSTAT汇集了来自各国劳动力调查、家庭收入调查及行政记录等多源数据,经国际劳工统计学家会议(ICLS)定义体系协调后形成跨国可比指标。在此背景下,Electric Sheep Asia于2025年基于ILOSTAT REST API提取并重新封装了亚洲地区雇员按性别与每周实际工作小时数统计的数据集,覆盖37个亚洲国家、1996至2025年间共9,453条观测记录。该数据集为劳动经济学、性别研究及工作时间政策分析提供了精细化的时序面板数据,有力支撑了亚洲区域劳动力市场动态的实证研究。
当前挑战
该数据集所回应的领域问题在于:如何以跨国可比的方式刻画亚洲地区雇员实际工作时间的性别差异及其时序演变。传统劳动统计往往受制于各国调查口径、工作时长定义及数据发布频率的异质性,难以直接进行跨国比较。在数据构建过程中,主要挑战体现为:ILOSTAT原始数据中部分国家存在调查方法修订导致的序列断裂,需借助观测状态标志与注释字段加以甄别;不同国家在工作小时分组标准上存在非标准化处理,须依赖分类注释进行协调;部分观测值被标记为不可靠或临时性,影响时序建模的稳健性。此外,数据仅涵盖年度频率,缺失月度或季度信息,且性别维度中其他类别(SEX_O)的样本极为稀疏,制约了细粒度分析的可行性。
常用场景
经典使用场景
在劳动经济学与时间利用研究的宏大脉络中,该数据集凭借其跨37个亚洲国家、纵贯1996至2025年的9453条观测,为刻画雇员周实际工作小时数的性别差异与国别异质性提供了不可替代的微观截面。研究者常将其作为面板数据回归的核心被解释变量,用以检验经济发展阶段、产业结构转型与劳动法规强度如何塑造男性与女性雇员的实际工作时间配置,亦可用于构建时间序列模型预测亚洲区域劳动力供给弹性的长期演变轨迹。
衍生相关工作
围绕该数据集,学界已衍生出若干颇具影响力的经典研究:其一为基于面板固定效应模型的亚洲性别工时收敛性分析,揭示了工业化进程对女性劳动时间的非线性影响;其二为将工作时长与工资数据匹配后开展的收入分解研究,量化了工时差异对性别收入不平等的解释份额;其三为面向可持续发展目标8的体面劳动监测报告,利用该数据构建了区域工时贫困指数,持续推动着劳动统计与政策评估的交叉创新。
数据集最近研究
最新研究方向
在国际劳工组织体面劳动议程与联合国可持续发展目标第八项“体面工作与经济增长”的宏观背景下,该数据集凭借其跨越近三十载、覆盖三十七个亚洲经济体的九千余条高频观测记录,正成为劳动经济学与性别研究交叉领域中极具潜力的实证资源。近期前沿研究愈发聚焦于性别维度的周工作时间异质性如何折射出亚洲劳动力市场结构性变迁,学者们借助面板回归与时序预测模型,试图揭示女性雇员实际工时波动与宏观经济周期、非正规就业扩张及数字化转型之间的动态耦合关系。与此同时,亚洲区域一体化进程中劳动标准趋同与国别制度差异的张力,使该数据集成为比较制度分析与政策效应评估的关键证据来源,其精细化性别分类与来源标注体系亦为提升劳动统计透明度及跨国可比性提供了重要支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务