遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-age-ocu-nb-employees-by-sex-age-and-occupation-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲37个国家从1996年至2025年期间按性别、年龄和职业分类的雇员统计数据(以千计)。数据集共有201,657个观测值,涵盖一个核心指标(EES_TEES_SEX_AGE_OCU_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过劳动力量调查、家庭收入调查、机构调查和行政记录等多种来源收集。数据集包含详细的列结构,如国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性等)、年龄分类、职业分类、观测年份、观测值以及数据状态标志等。数据经过ILO根据国际劳工统计学家会议(ICLS)定义进行标准化处理,并标注了来源以便追溯。数据集适用于表格分类、表格回归和时间序列预测等任务,可用于分析亚洲地区劳动力市场的性别、年龄和职业结构变化。

This dataset contains employee statistics (in thousands) classified by gender, age and occupation for 37 countries in Asia from 1996 to 2025. It has a total of 201,657 observations and covers one core indicator (EES_TEES_SEX_AGE_OCU_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), and collected from multiple channels including Labor Force Surveys, Household Income Surveys, Establishment Surveys and administrative records. The dataset features a detailed column structure, including country code, country name, data source, indicator code, gender classification (total, male, female, etc.), age classification, occupation classification, observation year, observed value and data status flag, among others. The data has been standardized by the ILO in accordance with the definitions set by the International Conference of Labour Statisticians (ICLS), and the sources are annotated for traceability. The dataset is applicable to tasks such as tabular classification, tabular regression and time series forecasting, and can be used to analyze changes in the gender, age and occupational structure of the labor market in the Asian region.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-age-ocu-nb-employees-by-sex-age-and-occupation-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接提取指标EES_TEES_SEX_AGE_OCU_NB的原始数据,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia重新打包发布。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、住户收入调查等微观数据进行 harmonization,确保跨国可比性,且每条记录均标注来源以便追溯。
特点
数据集涵盖1996至2025年间37个亚洲国家的201,657条观测,聚焦于按性别、年龄和职业分类的雇员人数(以千计)。其核心特点包括:多维度分解(性别含总计、男性、女性及其他;年龄与职业分类通过classif1和classif2字段灵活标示),年度频率,并附带观测状态标志及来源注释,便于评估数据可靠性。整体以表格形式组织,支持分类、回归及时间序列预测等多类任务。
使用方法
使用者可通过HuggingFace的datasets库加载数据集,并转换为Pandas DataFrame进行灵活操作。典型用法包括:筛选特定国家(如df[df['ref_area']=='IDN'])、提取单一指标的时间序列并排序绘图、或透视生成国家×年份矩阵以分析趋势。数据集亦提供完整的引用信息,便于学术研究中规范标注来源。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的标准化与传播,其ILOSTAT数据库整合了各国劳动力调查、住户收入调查及行政记录等多源数据,依据国际劳工统计学家会议(ICLS)定义进行跨国调和。作为ILOSTAT在亚洲地区的专题化延伸,本数据集由Electric Sheep Asia于2025年重新封装发布,覆盖37个亚洲国家、1996至2025年间逾20万条雇员观测记录,按性别、年龄与职业维度细分。该数据集直接回应了亚洲劳动力市场中就业结构异质性与性别差异等核心研究议题,为比较劳动经济学、区域就业政策评估及SDG体面劳动目标监测提供了高颗粒度的基础数据支撑。
当前挑战
就领域问题而言,亚洲各国劳动力统计体系成熟度参差不齐,调查口径、职业分类标准与参考时段存在系统性差异,跨国可比性面临严峻挑战;部分国家数据缺失严重或仅覆盖非连续年份,且职业与年龄的交叉细分导致样本稀疏,对时序建模与因果推断构成障碍。在构建过程中,ILOSTAT虽采用ICLS标准进行调和,但原始调查中非标准职业分类、方法论修订导致的序列断裂以及观测状态标记(如不可靠)等问题,仍对数据清洗、缺失值插补与模型稳健性提出较高要求。此外,性别维度中其他类别(SEX_O)的稀疏性亦增加了交叉分析的复杂性。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域,解析就业结构的性别与年龄分层始终是核心议题。该数据集最经典的使用场景在于构建亚洲地区雇员规模的精细化面板,研究者可借助其按性别、年龄组及职业分类的多维交叉特征,系统考察不同人口群体的就业分布形态与演变轨迹。凭借覆盖三十七国、跨越近三十年的逾二十万条观测,该数据为刻画亚洲劳动力市场中性别鸿沟与年龄梯队效应提供了坚实的经验基底,尤其适用于面板回归、时间序列预测等量化分析范式。
解决学术问题
该数据集有效回应了跨国劳动统计中性别与年龄维度就业数据长期碎片化的困局。过往研究常受制于口径不一、时序断裂及分类粗糙等障碍,难以就亚洲区域内雇员结构的异质性展开稳健比较。此数据集依托国际劳工组织的标准化协调框架,将各国劳动力调查微数据统一至国际会议劳工统计学家定义的分类体系,从而化解了跨国可比性不足的学术难题。其意义在于为探究职业隔离、人口红利消长及劳动参与率变迁等议题提供了可复现的高质量证据基础。
衍生相关工作
围绕该数据集及其所属的ILOSTAT指标族,学术界与政策研究机构衍生出若干经典工作。譬如,多项比较亚洲各国女性劳动参与率收敛性的研究直接调用其性别分类数据;针对青年与成年雇员职业分布差异的年龄分层分析亦以此为主要数据源;此外,部分聚焦非标准就业与职业中断序列的方法论探讨,亦将该数据集作为检验统计协调质量的参照基准。这些工作共同拓展了亚洲劳动统计数据的学术影响力与政策相关性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务