遇见数据集

electricsheepasia/asia-ilo-emp-5emp-sex-age-nb-employment-by-sex-and-age-19th-icls-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家从2014年至2025年的就业统计数据,共1,722个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为EMP_5EMP_SEX_AGE_NB,表示按性别和年龄划分的就业人数(基于第19届国际劳工统计学家会议定义,单位:千)。数据集涵盖了国家、数据来源、性别(总计、男性、女性等)、年龄分类(如15岁以上)、观测年份、观测值及数据状态等信息,适用于表格分类、回归或时间序列预测任务。数据经过ILO的标准化处理,并遵循CC-BY-4.0许可协议。

This dataset contains employment statistics for 26 Asian countries spanning from 2014 to 2025, with 1,722 observations. Sourced from the International Labour Organization (ILO) ILOSTAT database, it focuses on the indicator EMP_5EMP_SEX_AGE_NB, which represents employment by sex and age based on the 19th International Conference of Labour Statisticians (thousands). It includes fields such as country codes, data sources, sex disaggregation (total, male, female, etc.), age classification (e.g., 15+), observation year, observed values, and data status flags. The data is harmonized by ILO and is suitable for tabular classification, regression, or time-series forecasting tasks, released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5emp-sex-age-nb-employment-by-sex-and-age-19th-icls-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标EMP_5EMP_SEX_AGE_NB的原始数据,并按照亚洲国家的ISO3国家代码进行过滤。数据经ILO统计部门采用第19届国际劳动统计学家会议(ICLS)定义进行统一协调,涵盖各国劳动力调查、家庭收入调查等原始微数据,并在source.label列中标注了数据来源,确保可追溯性。Electric Sheep Asia团队负责将数据重新打包为便于机器学习直接使用的Parquet格式,并在HuggingFace平台上发布。
特点
该数据集包含1,722条观测记录,覆盖26个亚洲国家,时间跨度从2014年至2025年,提供就业指标的年度数据。数据按性别(总、男、女)和年龄组进行细分,支持多维度的分类分析。每个观测值包含完整的元数据信息,如数据来源、观测状态标识和注释说明,有助于用户评估数据质量。数据集采用CC-BY-4.0许可协议,便于学术研究、政策分析和时序预测等场景的合规使用。
使用方法
用户可通过HuggingFace Datasets库使用load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。支持按国家代码筛选特定国家的子集,也可针对单一指标进行时序分析,利用sort_values和plot方法可视化观察值随时间的变化趋势。此外,还可以通过pivot_table函数将数据重塑为国家×年份的矩阵格式,便于进行跨国的比较研究或构建面板数据模型。数据加载后可直接用于表格分类、回归和时序预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并经Electric Sheep Asia重新封装,聚焦于亚洲26个国家2014至2025年间按性别与年龄分列的就业数据(单位:千人),共包含1,722条观测记录。数据集源自ILOSTAT数据库——全球劳动统计领域的权威来源,其核心研究问题在于揭示亚洲区域就业结构的性别与年龄差异,为劳动经济学、发展经济学及跨国比较研究提供标准化、可复现的数据基础。作为ILO第19届国际劳动统计学家会议(ICLS)定义的指标应用实例,该数据集在推动劳动统计方法论的跨国一致性方面具有显著影响力,尤其为跟踪亚洲地区可持续就业目标(SDG 8.5)的进展提供了关键量化支撑。
当前挑战
该数据集面临的核心挑战首先在于劳动统计领域固有的数据异质性问题,即各国调查方法(如劳动力调查、行政记录)和定义标准(如ICLS框架下的就业界定)的差异导致跨国可比性受限,数据集中通过‘source.label’列溯源但仍需用户谨慎解读,尤其对时间序列中断(如‘Break in series’标记)与调查方法变更的识别不足可能误导分析结论。其次,构建过程中面临的基础挑战包括26国数据获取的非均衡性——部分国家(如阿富汗、缅甸)历史数据稀疏或存在年份缺失,以及ILO需在多源数据中筛选‘最佳来源’时面临的主观权衡,这种源头优先级决策隐含了统计权威性与数据时效性之间的张力。此外,数据集仅提供年度频率,缺乏对月度或季度高频波动的刻画,限制了短期就业动态的精细建模能力。
常用场景
经典使用场景
该数据集收录了2014年至2025年间26个亚洲国家按性别和年龄分层的就业人数(以千计),共包含1722条观测记录,是研究亚洲劳动力市场结构性变迁的基石性资源。研究者可借助该数据进行跨国的就业规模比较、性别就业差距的时序演化分析,以及年龄结构对劳动力供给影响的建模。其经典使用场景集中于基于面板数据的计量回归和时间序列预测,例如通过固定效应模型识别经济发展水平与就业率的关系,或利用ARIMA等模型预测特定国家未来的就业趋势,为区域劳动经济学研究提供了标准化、可复现的数据基础。
实际应用
在实际应用中,该数据集为国际组织、政府部门及企业的人力资源分析提供了可靠的数据支撑。国际劳工组织可基于其发布的就业统计监测亚洲各国体面劳动目标的实现进度,并针对就业弱势群体(如女性及青年)制定差异化援助策略。各国劳动部门可利用该数据集进行国内就业形势的横向对标,优化劳动统计体系的建设。在商业领域,跨国企业可借助各国分性别与年龄的就业规模数据,评估区域市场的消费潜力和劳动力成本结构,辅助投资布局与人才招募战略的制定,充分释放数据在公共决策与市场分析中的实践价值。
衍生相关工作
该数据集的发布直接催生了一系列围绕亚洲劳动市场的衍生性研究范式。在方法论层面,研究者基于该数据开发了适配多国面板数据的就业预测模型,如结合社会经济协变量的贝叶斯层级模型,提升了缺失年份估计的准确性。在实证领域,衍生工作聚焦于性别工资差距的动态分解、新冠疫情对亚洲就业市场的冲击评估,以及产业升级背景下就业结构的演变路径。此外,该数据集常被用作基准测试集,用于检验劳动力迁移模型、最低工资效应模型等前沿计量方法的稳健性,构建起连接数据提供者与学术社区的桥梁,促进了劳动经济学在亚洲语境下的知识迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务