遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-ocu-est-nb-employees-by-sex-occupation-and-establishment-size

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲国家按性别、职业和企业规模划分的雇员统计数据集,源自国际劳工组织(ILO)的ILOSTAT数据库。数据集包含44,856个观测值,覆盖25个亚洲国家,时间范围为2000年至2025年,涵盖1个核心指标:EES_TEES_SEX_OCU_EST_NB(按性别、职业和企业规模划分的雇员数,单位为千)。数据通过ILOSTAT REST API获取,并经过标准化处理,使用国际劳工统计学家会议(ICLS)定义进行统一。数据集模式包括国家代码、性别(总计、男性、女性)、职业分类、企业规模分类、年份、观测值等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据为单语种(英语),规模在10K到100K之间,采用CC-BY-4.0许可。

This dataset contains statistics on employees by sex, occupation, and establishment size across Asian countries, sourced from the International Labour Organizations (ILO) ILOSTAT database. It includes 44,856 observations covering 25 Asian countries from 2000 to 2025, with one core indicator: EES_TEES_SEX_OCU_EST_NB (Employees by sex, occupation and establishment size in thousands). Data is retrieved via the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The schema comprises columns such as country code, sex (total, male, female), occupation classification, establishment size classification, year, observed value, and more, making it suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is monolingual (English), falls within the 10K<n<100K size category, and is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-ocu-est-nb-employees-by-sex-occupation-and-establishment-size 数据集图片
构建方式
该数据集源起于国际劳工组织(ILO)的中央统计数据库ILOSTAT,其原始数据通过ILOSTAT的REST API接口(指定指标EES_TEES_SEX_OCU_EST_NB)直接获取,并依据亚洲ISO3国家代码进行筛选。ILOSTAT运用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查、机构调查及行政记录等原始微观数据进行协调与标准化处理,同时以source.label列标注数据来源以保证可追溯性。在此基础之上,Electric Sheep Asia对筛选后的亚洲区域数据进行了重新打包与规范化,最终形成涵盖25个亚洲国家、时间跨度为2000至2025年、共计44,856条观测记录的机器学习就绪数据集。
特点
该数据集聚焦于亚洲地区按性别、职业及机构规模分列的雇员人数(以千为单位),其核心特点在于多维度的 disaggregation 结构:sex维度包含总计、男性和女性三类取值,classif1与classif2则分别承载职业(按技能水平)和机构规模(聚合)的分类信息。数据以年度频率发布,覆盖日本、蒙古、土耳其、伊朗、泰国等25个亚洲国家,各国家的时间序列长度不一,最早可追溯至2000年,最晚至2025年。此外,数据集保留了源数据中的观测状态标志(如临时性、不可靠)以及分类、指标和来源层面的注释信息,为数据质量评估和情境理解提供了丰富的元数据支撑。
使用方法
研究者可通过Hugging Face的datasets库以一行代码加载该数据集,并利用to_pandas()方法转换为数据框进行后续分析。典型的使用场景包括:按ref_area列筛选特定国家(如印度尼西亚)的子集;针对单一指标代码EES_TEES_SEX_OCU_EST_NB按时间排序以绘制时间序列图;或通过pivot_table将数据重塑为国家×年份的矩阵形式,以便开展跨国比较或面板数据分析。该数据集适用于表格分类、表格回归及时间序列预测等任务,使用时需注意遵循cc-by-4.0许可协议,并同时引用国际劳工组织(ILO)的原始数据来源及Electric Sheep Asia的重新打包工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与可比化,其ILOSTAT数据库汇集了二百余个经济体的就业、失业、工资及职业结构等核心指标,为劳动经济学与政策研究提供了权威数据基础。该数据集由Electric Sheep Asia于2025年从ILOSTAT REST API抽取并重新封装,覆盖亚洲25个国家、2000至2025年间按性别、职业及机构规模分类的雇员人数观测,共计44,856条记录。其核心研究问题在于揭示亚洲地区就业结构的性别差异与职业分布特征,为劳动市场分层、体面劳动评估及可持续发展目标监测提供微观实证支撑,对区域劳动政策制定与比较研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于刻画亚洲各国雇员在性别、职业与机构规模三维交叉下的分布格局,此类细分统计对于识别劳动力市场中的性别隔离与职业分层至关重要。构建过程中的主要挑战包括:各国劳动力调查在职业分类与机构规模界定上存在显著的方法论差异,ILO虽依循国际劳工统计学家会议(ICLS)定义进行调和,但原始数据来源的异质性仍导致序列可比性受限;部分国家或年份数据存在方法修订所致的序列断点、观测值被标记为不可靠或临时性,以及分类维度非全覆盖等缺失问题,这些因素共同增加了跨时段与跨区域分析的复杂性。
常用场景
经典使用场景
在劳动经济学与就业结构分析领域,该数据集最为经典的应用场景在于刻画亚洲各国雇员规模在性别、职业类别及企业规模三个维度上的分布格局与动态演化。研究者借助44,856条年度观测记录,可构建跨国面板数据,系统考察不同性别劳动者在各类职业中的就业密度,以及企业规模对雇员吸纳能力的调节效应,进而揭示亚洲劳动力市场的结构性特征与变迁轨迹。
实际应用
在政策实践层面,该数据集为各国劳动部门、国际发展机构及企业战略研究者提供了决策参照。政府部门可据此监测女性就业参与率与职业分布均衡度,制定针对性就业促进政策;国际组织可评估区域体面劳动目标的实现进度;企业则可借助企业规模与职业构成的关联分析,优化人力资源配置与招聘策略,提升组织运营效率。
衍生相关工作
围绕该数据集已衍生出一系列经典研究工作,涵盖亚洲性别就业差距的时序分解、非正规就业规模的间接估算、以及企业规模与工资溢价的跨国比较分析等方向。部分研究进一步将其与ILOSTAT其他指标数据集进行链接,构建多维度劳动市场评估框架,亦有学者利用其职业分类信息检验技能错配假说,推动了劳动统计数据的二次开发与跨学科应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务