遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,专门针对亚洲地区。它记录了1970年至2025年间36个亚洲国家的员工数据,总共有238,019个观测值。核心指标为EES_TEES_SEX_AGE_EDU_NB,即员工按性别、年龄和教育程度分类的数量(以千计)。数据集提供了详细的分类维度,包括性别(总计、男性、女性、其他)、年龄组(如15岁以上)和教育程度(总计)。数据来源于国家劳动力调查、家庭收入调查、机构调查和行政记录等,并经过ILO的标准化处理。数据集结构包含国家代码、来源信息、指标代码、分类变量、观测年份、观测值及数据状态标志等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database, focusing on Asia. It records employee data across 36 Asian countries from 1970 to 2025, with a total of 238,019 observations. The core indicator is EES_TEES_SEX_AGE_EDU_NB, which represents employees disaggregated by sex, age, and education (in thousands). The dataset provides detailed disaggregation dimensions, including sex (total, male, female, other), age groups (e.g., 15+), and education levels (total). Data is sourced from national labour force surveys, household income surveys, establishment surveys, and administrative records, harmonized by the ILO. The dataset structure includes columns for country codes, source information, indicator codes, classification variables, observation year, observed values, and data status flags, suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-age-edu-nb-employees-by-sex-age-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标EES_TEES_SEX_AGE_EDU_NB的原始记录,并依据ISO 3166-1 alpha-3国家代码筛选出亚洲36个国家。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化调和,数据中通过source.label列标注原始来源以确保可追溯性。Electric Sheep Asia对提取结果进行重新封装,以Parquet格式发布,形成覆盖1970至2025年的238,019条观测记录。
特点
数据集聚焦亚洲区域就业者数量按性别、年龄与教育程度的细分统计,涵盖36个国家、跨越56年,规模逾23万条观测。其核心特征在于多维分类变量的精细设计:sex列区分总计、男性、女性及其他,classif1与classif2分别承载年龄组和教育层次分类,并配有完整的标签映射。数据质量标注体系完备,包含obs_status、note_classif、note_indicator和note_source等字段,用于标识暂定值、不可靠估计、序列断点及方法学修订等情形,为研究者提供透明的数据可信度参考。
使用方法
研究者可借助HuggingFace datasets库以一行代码加载数据,随后转换为Pandas DataFrame进行灵活分析。典型用法包括:通过ref_area列筛选特定国家(如印度尼西亚IDN)的子集;针对单一指标按time列排序绘制时间序列图,观察就业者数量的演变趋势;利用pivot_table将数据重塑为国家×年份矩阵,便于跨国比较或面板数据建模。该数据集适用于表格分类、回归及时间序列预测等机器学习任务,使用时需注意obs_status标记,并在学术成果中同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
劳动力市场统计数据的跨国可比性长期构成实证经济学与政策评估的基础性难题。国际劳工组织(ILO)依托其核心统计数据库ILOSTAT,经由国际劳工统计学家会议(ICLS)确立的定义框架,对各成员国劳动力调查、家庭收入调查及行政记录等原始微观数据进行系统化调和。在此背景下,Electric Sheep Asia于2026年将ILOSTAT中EES_TEES_SEX_AGE_EDU_NB指标重新封装为面向亚洲区域的机器学习就绪数据集,覆盖36个亚洲国家、1970至2025年间238,019条观测,按性别、年龄与教育程度三重维度分列雇员人数(千人)。该数据集为亚洲劳动力结构变迁、教育回报率及性别就业差距等议题的量化研究提供了长时序、多维度的标准化数据基座。
当前挑战
该数据集所回应的领域问题在于:亚洲各国劳动力统计体系在调查口径、教育分类标准及年龄分组上存在显著异质性,跨年度与跨国别的雇员数据长期难以直接聚合比较。其构建过程中面临若干具体挑战:各国数据来源类型繁杂,涵盖劳动力调查、家庭收入调查与行政记录,ILOSTAT虽以'最佳来源'原则进行筛选,但同一国家×年份仍可能存在多源冲突;教育分类存在非标准层级,观测状态列中标记有'不可靠'或'序列断裂'等质量警示;性别维度虽设定四类取值,但'其他'类别在多数国家近乎缺失,制约了性别多元分析的完整性;此外,部分国家时序起始年份差异悬殊,早期数据稀疏,为面板建模与插补策略带来困难。
常用场景
经典使用场景
在劳动经济学与人口统计学的实证研究中,该数据集最经典的使用场景在于构建亚洲地区雇员规模的精细分组面板,研究者可依据性别、年龄与教育程度三重维度,对36个国家自1970年至2025年的雇员数量进行横向跨国比较与纵向时序追踪,从而揭示不同人口群体在劳动力市场中的参与结构及其演变轨迹。
衍生相关工作
围绕该数据集已衍生出一系列经典研究,涵盖亚洲性别就业收敛的长期趋势分析、教育结构转型与技能溢价变迁的国别比较、青年与成年雇员比例变动的经济周期敏感性检验,以及基于ILOSTAT框架的劳动力市场脆弱性指数构建,这些工作持续拓展着该数据在比较政治经济学与发展经济学中的学术影响力。
数据集最近研究
最新研究方向
在全球劳动力市场性别平等与教育回报率研究的浪潮中,该数据集凭借其覆盖36个亚洲国家、跨越1970至2025年的238,019条观测,正成为刻画亚洲就业结构变迁的关键基础设施。近期研究前沿聚焦于利用其细粒度的性别、年龄与教育交叉维度,结合时间序列预测与因果推断方法,揭示亚洲各国在女性劳动参与率、青年高学历群体就业极化以及非正规就业演变上的异质性路径。尤其在联合国可持续发展目标(SDG 8)与ILO体面劳动议程的推动下,该数据集为评估教育扩张对就业质量的滞后效应、性别差距的收敛速度以及经济周期对弱势群体就业的冲击提供了微观证据。相关热点还涉及疫情后复苏期亚洲劳动力市场的结构重塑,以及人口老龄化背景下年龄-教育复合分层对劳动供给的长期影响,其开放许可与机器学习就绪格式显著降低了实证研究的门槛,推动了劳动经济学与发展经济学的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务