遇见数据集

electricsheepasia/asia-ilo-eap-5eap-sex-age-nb-labour-force-by-sex-and-age-19th-icls-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,731个观测值,涉及26个亚洲国家的劳动力数据,按性别和年龄分类,基于第19届国际劳工统计学家会议(ICLS)定义,时间跨度为2014年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了劳动力指标,如Labour force by sex and age -- 19th ICLS (thousands)。数据集以表格形式提供,包括国家代码、年份、性别分类、年龄分类等列,用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,731 observations of labour force data by sex and age across 26 Asia countries, spanning 2014–2025, based on the 19th International Conference of Labour Statisticians (ICLS) definitions, sourced from the International Labour Organizations ILOSTAT database. It includes indicators such as Labour force by sex and age -- 19th ICLS (thousands), provided in tabular format with columns for country codes, years, sex disaggregation, age classification, and more, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eap-5eap-sex-age-nb-labour-force-by-sex-and-age-19th-icls-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队重新打包处理。数据通过ILOSTAT的REST API接口直接获取,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT依据第19届国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查的微观数据进行统一协调与标准化处理,确保数据口径的一致性。原始数据来源在`source.label`列中予以标记,便于用户追溯数据根基。最终整合得到包含1,731条观测值、覆盖26个亚洲国家、时间跨度为2014年至2025年的结构化表格数据集。
特点
该数据集聚焦于劳动力这一核心指标,按性别(总、男、女、其他)与年龄组进行精细分层,提供了丰富的分类维度和元数据注释。每条记录不仅包含观测数值`obs_value`,还附带了数据来源、观测状态标志、分类变量及其标签,以及针对指标、来源和分类的详细注释,有助于用户理解数据质量与潜在断点。数据以年度频率呈现,并采用ILO选定的“最佳来源”处理同一国家年份的多源冲突,保证了数据内在的可靠性与权威性。
使用方法
该数据集可通过HuggingFace的`datasets`库轻松调用,仅需一行`load_dataset()`即可加载为Pandas DataFrame格式,便于后续分析与建模。用户可直接利用`ref_area`列按国家进行筛选,亦可依据`indicator`列提取特定指标进行时间序列分析。此外,借助`pivot_table`函数可便捷地构建国家×年份的数值矩阵,适用于面板数据回归或时空模式挖掘等任务。研究人员在引用时需注意同时标注ILO原始数据来源与Electric Sheep Asia的再打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)编制,经由Electric Sheep Asia在2025年重新封装并发布于HuggingFace平台,旨在提供亚洲地区按性别和年龄分列的劳动力数据。数据集涵盖2014年至2025年间26个亚洲国家的1731条观测值,核心研究问题聚焦于亚洲劳动力市场的结构性特征与动态演变,尤其关注性别与年龄维度下的劳动力参与差异。作为ILOSTAT数据库的重要子集,该数据集为劳动经济学、人口统计学及可持续发展目标(SDG)中体面劳动指标的监测提供了关键支撑,对区域劳动力政策制定与跨国比较研究具有显著影响力。
当前挑战
该数据集首要解决的领域问题在于劳动力统计数据的标准化与可获取性,尤其是克服亚洲各国在调查方法、数据口径及时间跨度上的巨大异质性,实现基于第19届国际劳动统计学家会议(ICLS)定义的有序整合。构建过程中面临的核心挑战包括:多源调查数据(如劳动力调查、家户收入调查)的衔接与统一,最佳数据源在相同国家与年份下的筛选策略;性别与年龄分类的精细粒度和缺失处理;以及数据质量标记(如‘序列中断’、‘方法修订’)的语义保留与后续分析的可追溯性,这些挑战对数据集生态的可靠性与复用价值构成持续考验。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,劳动力按性别与年龄的细分数据是剖析地区经济活力与人力资源结构的基础素材。本数据集聚焦于亚洲26个国家在2014至2025年间按第19届国际劳动统计学家会议(ICLS)标准定义的劳动力规模(以千计),为研究者提供了横跨十余载、覆盖广泛年龄划分与性别维度的面板数据。其最经典的用途在于支撑时间序列分析与跨国比较研究:学者可通过pivot操作将数据重塑为年份×国家的矩阵,进而运用固定效应模型或动态面板回归,探测亚洲各国劳动力参与模式的长期趋势与结构性差异。此外,该数据也是构建劳动力市场景气预测模型的理想输入,尤其适用于监督学习框架下的回归任务,用以揭示不同年龄—性别亚群对经济冲击的响应弹性。
衍生相关工作
围绕该数据源已涌现出一系列具有代表性的衍生研究。一些工作聚焦于构建劳动市场早期预警系统,例如通过提取劳动力规模序列中的结构断点(obs_status字段内含‘Break in series’标记),结合机器学习中的异常检测算法,自动识别各国劳动参与率的制度性突变时点。另有一脉研究将其与教育微观数据拼接,构建‘教育—劳动参与’匹配度指数,进而用聚类方法描绘亚洲各国的人力资本转化效率谱系。在开源生态中,该数据集已被整合至诸如‘ILOSTAT-Extractor’等自动化管道项目中,成为定期刷新亚洲劳动面板的元数据骨架。此外,在自然语言处理与表格数据跨模态研究里,它常被用作benchmark之一,测试预训练模型(如TabPFN)在小样本多分类设定下对区域劳动统计标签的泛化能力。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区劳动力人口按性别与年龄的精细分层统计,依据第19届国际劳工统计学家会议(ICLS)标准进行规范化处理,为区域劳动力市场分析提供了高度可比的时序数据。当前研究前沿围绕劳动参与率的性别差异演化、青年与成人就业结构变迁,以及后疫情时代劳动力供给的恢复动态展开。结合ILO推动的体面劳动与可持续发展目标(SDG 8),该数据成为量化亚洲新兴经济体非正规就业转型、老龄化社会中的劳动供给瓶颈等热点议题的基石工具。其跨年度、多国别的面板结构,支持了劳动力经济学中的固定效应分析与动态面板建模,对揭示亚洲劳动力市场的结构性矛盾与政策干预效能具有重要实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务