遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-edu-geo-nb-employees-by-sex-education-and-rural-urban-areas-t

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为按性别、教育水平和城乡地区分类的雇员(千)| 亚洲。数据集涵盖29个亚洲国家,时间跨度为1970年至2025年,包含39,526个观测值。核心指标为EES_TEES_SEX_EDU_GEO_NB,即按性别、教育水平和城乡地区分类的雇员数量(以千为单位)。数据通过ILOSTAT REST API获取,并经过处理仅包含亚洲国家。数据集包含详细的元数据列,如国家代码、数据来源、指标代码、性别分类(总计、男性、女性、其他)、教育水平分类、城乡地区分类、观测年份、观测值(雇员数量)以及数据质量标志(如可靠性状态)。数据以年度频率提供,并经过ILO harmonisation处理以确保国际可比性。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Asia重新打包为机器学习就绪格式。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database on Employees by sex, education and rural / urban areas (thousands) | Asia. It covers 29 Asian countries from 1970 to 2025 with 39,526 observations. The core indicator is EES_TEES_SEX_EDU_GEO_NB, which represents the number of employees (in thousands) disaggregated by sex, education level, and rural/urban areas. Data is sourced via the ILOSTAT REST API and filtered to Asian countries. The dataset includes detailed metadata columns such as country code, data source, indicator code, sex disaggregation (total, male, female, other), education classification, rural/urban classification, observation year, observed value (number of employees), and data quality flags (e.g., reliability status). Data is provided at annual frequency and harmonized by ILO for international comparability. This dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and has been repackaged by Electric Sheep Asia into an ML-ready format.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-edu-geo-nb-employees-by-sex-education-and-rural-urban-areas-t 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT统计数据库,后者作为全球劳动统计的权威中枢,依托各国劳动力调查、家庭收入调查及行政记录等多源微观数据,经国际劳工统计学家会议定义统一调和后形成标准化指标。本数据集通过ILOSTAT REST API直接抽取指标EES_TEES_SEX_EDU_GEO_NB,再以亚洲ISO3国家代码为条件进行筛选,覆盖1970至2025年间29个亚洲国家的雇员统计,最终由Electric Sheep Asia重新打包为机器学习就绪的Parquet格式,并保留来源标签以支撑可追溯性。
使用方法
研究者可借助HuggingFace datasets库以单行代码加载数据并转换为Pandas数据框,进而开展过滤、排序与可视化分析。典型操作包括按ref_area筛选取特定国家子集,按indicator与time排序绘制时间序列趋势图,或利用pivot_table构建国家与年份的交叉矩阵以考察区域格局。数据以年度频率发布,使用时需留意obs_status与各家注释列所标记的方法论断点及非标准教育分类等质量提示,并依CC-BY-4.0协议同时引用ILO原始来源与Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力调查、家庭收入调查及行政记录,成为劳动经济学与政策评估的权威数据源。2025年,Electric Sheep Asia对ILOSTAT中“按性别、教育程度及城乡地区分列的雇员人数”指标进行系统爬取与亚洲区域筛选,覆盖29个亚洲国家、1970至2025年的39,526条观测,构建了本数据集。该数据集回应了亚洲劳动力市场中性别平等、教育回报与城乡差异等核心研究议题,为实证研究提供了跨时空的标准化面板基础。
当前挑战
该数据集所服务的领域问题——解析亚洲雇员结构的性别、教育与城乡差异——面临多重挑战:各国劳动力调查在抽样设计、变量定义及数据收集频率上存在显著异质性,致使跨国比较的效度受限;部分国家存在数据缺失、序列中断或观测状态标注为“不可靠”的情形,影响时序建模的稳健性。构建过程中,ILOSTAT虽依据国际劳工统计学家会议(ICLS)标准进行协调,但教育分类与城乡界定在不同国家间的操作化差异仍导致元数据复杂化;此外,仅纳入年度数据而剔除月度或季度序列,可能遗漏短期波动特征,为预测任务带来时序粒度损失。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉研究中,该数据集最典型的使用场景在于刻画亚洲地区不同性别、受教育程度以及城乡属性下雇员数量的分布格局与动态演变。研究者可借助其1970至2025年的长时序面板数据,构建多维度的劳动力供给结构分析框架,用以揭示教育扩张、城镇化进程与性别平等政策对就业结构的差异化影响,并支持跨国比较与区域异质性检验。
解决学术问题
该数据集有效回应了劳动统计学中关于就业结构分解与数据可比性的核心难题。它通过ILO统一协调的ICLS定义与来源标注,缓解了亚洲各国劳动力调查在性别、教育及城乡分类上的口径差异问题,为探究教育回报的性别鸿沟、城乡劳动力市场分割以及结构性失业等议题提供了标准化经验基础,对推动区域劳动计量研究的规范化具有显著意义。
实际应用
在政策分析与商业决策层面,该数据集可用于监测亚洲各国雇员结构的时序变化,辅助国际组织与政府部门评估教育投入和城乡就业政策的实施效果。同时,它亦能服务于企业选址、人力资源配置及市场进入策略的制定,通过识别不同受教育程度和城乡背景的劳动力供给特征,为劳动力密集型产业的区域布局提供量化依据。
数据集最近研究
最新研究方向
在亚洲劳动力市场性别平等与教育回报率的研究中,该数据集为探究城乡差异如何调节女性就业参与提供了关键证据。近期前沿方向聚焦于利用高分辨率面板数据,结合机器学习方法,识别教育水平对男女就业概率的非线性影响,并评估结构性转型(如数字化与自动化)对低技能女性劳动者的冲击。该数据集覆盖29个亚洲国家、时间跨度逾半个世纪,支持对性别就业差距的长期趋势与政策干预效果的因果推断。在可持续发展目标(SDG)框架下,其与ILO体面劳动议程紧密关联,为监测亚太区域性别平等进展、制定包容性劳动力市场政策提供了实证基础,推动了从描述性分析向预测性建模的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务