electricsheepasia/asia-ilo-ees-tees-sex-age-geo-nb-employees-by-sex-age-and-rural-urban-areas-thousan
收藏数据链接:
官方服务:
资源简介:
该数据集包含49,478个观测值,涵盖30个亚洲国家,时间跨度为1970年至2025年,涉及一个独特指标:按性别、年龄和城乡区域划分的雇员数据(以千计)。数据源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤到亚洲国家,包括国家代码、指标、性别分类、年龄分组、观测年份和数值等列,适用于表格分类、回归和时间序列预测等自然语言处理任务。
This dataset contains 49,478 observations across 30 Asia countries, spanning from 1970 to 2025, with one distinct indicator: Employees by sex, age and rural/urban areas (in thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asian countries, and includes columns such as country code, indicator, sex classification, age groups, observation year, and values, suitable for tabular classification, regression, and time-series forecasting tasks.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集派生自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接抽取指标EES_TEES_SEX_AGE_GEO_NB的原始记录,并依据ISO3国家代码筛选出亚洲30个经济体的观测数据。原始微观调查数据经ILO统计局依照国际劳工统计学家会议(ICLS)定义进行标准化调和,源调查类型与名称以source.label字段标注,确保数据来源可追溯。Electric Sheep Asia对抽取结果进行模式规范化并以Parquet格式重新打包发布,形成涵盖1970至2025年、共计49,478条观测的即用型数据层。
特点
数据集聚焦于按性别、年龄组及城乡地区分组的雇员人数(以千计),时间跨度逾半个世纪,覆盖亚洲30个国家,具有显著的长时段与跨区域比较价值。核心变量包括国家代码、来源标识、指标编码、性别(总计、男性、女性及其他)、年龄分类、城乡分类、观测年份及数值,并附有观测状态与来源注释等质量标记。数据结构为整洁的表格型长格式,支持分类、回归与时间序列预测等多类任务,且以宽松的CC-BY-4.0许可发布,便于学术与商业再利用。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset()函数直接加载数据集,并借助to_pandas()转换为数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家、按indicator字段抽取单一指标序列、按时间排序绘制趋势图,以及利用pivot_table生成国家×年份矩阵以开展面板分析。数据集亦适用于构建性别与城乡维度的劳动力参与差异模型、进行时间序列预测或作为机器学习任务中的表格特征输入。使用时应留意obs_status所标示的暂定或不可靠观测,并在研究中同时引用ILO原始来源与Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库是劳动经济领域最权威的跨国数据源之一。该数据集由Electric Sheep Asia于2025年从ILOSTAT REST API提取并重新封装,聚焦亚洲30个国家1970至2025年间按性别、年龄及城乡区域分组的雇员人数(千人),共涵盖49,478条观测记录。其核心研究问题在于揭示亚洲劳动力市场中性别与年龄结构的时空分异,以及城乡二元格局对就业的塑造机制,为劳动经济学、人口学与区域发展研究提供高粒度面板数据,对监测可持续发展目标中的体面劳动议程具有重要支撑价值。
当前挑战
该数据集所应对的领域问题在于刻画亚洲范围内雇员分布的性别、年龄及城乡差异,此类多维交互分析长期受限于数据口径不一与覆盖不均。构建过程中,数据源自各国劳动调查与行政记录,原始微数据经ILO依据国际劳工统计学家会议定义加以调和,但仍面临若干挑战:部分国家时间序列存在断点,方法学修订导致指标不可比;城乡分类随国家统计实践而异,削弱跨区域可比性;某些年份观测状态标记为不可靠或临时,影响推断稳健性;性别维度中存在少量未分类类别,可能干扰精细化建模;高频季度或月度序列被剔除,限制了短期波动分析。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,针对性别、年龄及城乡地域维度的就业结构分析长期依赖跨国可比数据。该数据集源自国际劳工组织ILOSTAT的标准化统计,涵盖亚洲30个国家1970至2025年间近5万条雇员观测记录,其最经典的使用场景在于构建多维度面板数据,支撑按性别、年龄组与城乡属性的就业量时序建模与横截面比较研究,例如借助时间序列预测方法刻画不同国家青年与成年劳动者就业规模的演变轨迹,或利用表格分类与回归模型识别城乡就业差异的结构性特征。
实际应用
在政策制定与实务操作层面,该数据集为国际组织、国家统计部门及智库提供了评估就业政策成效的基础性依据。劳动市场监测机构可据此识别城乡与性别维度的就业缺口,为技能培训、农村劳动力转移及女性劳动参与促进等干预措施提供量化参照。企业与社会投资机构亦可利用该数据评估区域劳动力供给结构与潜在市场容量,辅助选址与人力资源规划。其年度频率与多国覆盖特性,使之成为可持续发展目标中体面工作指标监测的重要数据支撑。
衍生相关工作
围绕该数据集及其母体ILOSTAT系列,学界与开源社区衍生出多项经典工作。Electric Sheep Asia将其规范化为机器学习就绪的Parquet格式并统一数据卡,催生了亚洲劳动市场跨国比较的基准实验。相关研究利用该数据构建性别就业差距指数、城乡就业结构转型分类模型及青少年就业预测基准,部分工作进一步将其与世界银行发展指标及亚洲开发银行统计相融合,拓展至劳动迁移、非正规就业与教育回报等交叉议题,形成了以ILOSTAT为核心的区域劳动统计衍生研究群。
以上内容由遇见数据集搜集并总结生成



