遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-ocu-ins-nb-employees-by-sex-occupation-and-public-private-sec

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲地区员工统计数据的表格型数据集,包含40,566个观测值,覆盖33个亚洲国家,时间跨度为1997年至2025年。数据集核心指标为EES_TEES_SEX_OCU_INS_NB,即按性别、职业和公私部门划分的员工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并筛选亚洲国家代码。数据集包含多个维度的分类信息:如性别(总计、男性、女性、其他)、职业分类(按技能水平)、机构部门(公私部门)等。数据结构包括国家代码、国家名称、数据来源、指标代码、分类变量、观测年份、观测值、观测状态标志以及相关注释列。数据为年度频率,ILO使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,数据源在source.label列中标注以确保可追溯性。数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Asia重新打包为Parquet格式,便于直接通过HuggingFace的`load_dataset`函数加载使用。

This dataset contains 40,566 observations of Employees data across 33 Asia countries, spanning 1997–2025, covering 1 distinct indicator: EES_TEES_SEX_OCU_INS_NB — Employees by sex, occupation and public/private sector (thousands). Data is sourced from ILOSTAT, the ILOs central statistics database, pulled via REST API and filtered to Asia ISO3 country codes. It includes disaggregation dimensions such as sex (SEX_T, SEX_M, SEX_F, SEX_O), occupation classification, and institutional sector, with columns for country codes, source information, indicator details, time, observed values, status flags, and notes. The data is annual frequency, harmonized using ICLS definitions, and repackaged by Electric Sheep Asia for ML-ready usage on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-ocu-ins-nb-employees-by-sex-occupation-and-public-private-sec 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标EES_TEES_SEX_OCU_INS_NB的原始数据,并依据ISO3国家代码筛选出亚洲地区33个国家的记录。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行统一 harmonization,以确保跨国可比性。最终由Electric Sheep Asia重新封装为HuggingFace数据集,包含1997至2025年间共计40,566条观测值,每条记录均标注来源代码与标签,便于溯源。
特点
数据集聚焦于亚洲地区按性别、职业及公共/私营部门分类的雇员人数(单位:千人),涵盖33个国家、跨越近三十年,具有显著的面板数据特征。其核心维度包括性别(总计、男性、女性及其他)、职业分类(基于技能水平)和机构部门(总计、公共、私营),并附有详细的观测状态标志与注释信息,如数据可靠性、序列断裂等。数据以表格形式组织,包含分类变量与连续型观测值,适合进行分组统计与趋势分析。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载数据,并转换为Pandas DataFrame进行灵活操作。典型用法包括:按国家代码筛选特定经济体的记录,或针对单一指标提取时间序列以绘制趋势图,亦可利用透视表生成国家×年份的观测值矩阵。数据支持表格分类、回归及时间序列预测等任务,所有字段均提供明确的类型定义与示例,便于直接用于统计分析或机器学习建模。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力调查数据,成为劳动经济学与政策研究的基石。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中亚洲地区雇员数据进行了重新打包,发布了涵盖33个国家、1997至2025年间40,566条观测的记录。该数据集聚焦于按性别、职业及公共/私营部门分类的雇员人数,填补了亚洲区域劳动市场细分数据的空白,为探究性别职业隔离与部门就业结构变迁提供了关键支撑,对推动区域劳动政策制定与学术研究具有显著影响力。
当前挑战
该数据集所应对的领域问题在于劳动统计中性别、职业与部门维度的精细交叉分析,此类细分数据长期面临跨国家可比性不足与口径差异的困扰。构建过程中,ILOSTAT需协调各国劳动力调查的异质性,统一至国际劳工统计学家会议(ICLS)定义,并处理数据缺失、序列中断及不稳定性标记等质量问题。此外,部分国家仅在特定年份发布细分数据,且公共/私营部门分类标准不一,导致时间序列的连贯性受损。如何在高维度下保持统计效力并兼顾数据隐私与可靠性,亦构成持续挑战。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域,剖析就业结构的性别差异始终是核心议题。该数据集凭借其细致的性别、职业与公私部门三维度交叉分类,为刻画亚洲33国1997至2025年间雇员分布的动态演变提供了不可多得的微观基础。典型的使用场景包括构建时间序列模型以追踪女性在公共部门高技能职业中的占比变化,或利用面板数据回归分析公私部门就业性别隔离的国别差异。研究者可借助`load_dataset`接口快速载入数据,并通过透视表将原始观测值转化为国家×年份矩阵,进而实施趋势分解或跨国比较分析。
衍生相关工作
基于该数据集及其同源ILOSTAT系列,学术界与数据科学社区衍生出若干经典工作。一方面,研究者利用其构建亚洲性别就业差距指数,并发表于《国际劳动评论》等期刊,推动了区域比较研究。另一方面,Electric Sheep Asia将原始数据重新封装为机器学习就绪格式,催生了多项自动化表格预测与缺失值插补的基准实验。由此还带动了针对低收入国家数据质量的元分析,以及基于时间序列预测女性劳动参与率的开源性竞赛,进一步拓展了该数据集在计算社会科学中的影响力。
数据集最近研究
最新研究方向
在全球劳动力市场性别平等议题持续升温的背景下,该数据集以其覆盖33个亚洲国家、跨越近三十年的性别—职业—公私部门三维交叉的员工就业数据,为劳动经济学与发展经济学的交叉研究提供了独特的面板分析基础。当前前沿研究聚焦于利用此类高维分组数据,结合时间序列预测与因果推断方法,探究亚洲各国公共部门与私营部门中职业性别隔离的动态演变及其对薪酬差距的异质性影响。与此同时,国际劳工组织推动的体面劳动议程与非正规就业统计标准化进程,使得该数据集在监测可持续发展目标第八项中关于包容性就业的进展方面具有关键意义,为政策制定者识别结构性性别壁垒提供了实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务