遇见数据集

electricsheepasia/asia-ilo-emp-temp-sex-ind-ste-nb-employment-by-ilo-sector-and-sex-and-status-in-emp

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲34个国家从2000年至2025年的62,839条观测数据,主要指标为“按ILO部门、性别和就业状况划分的就业人数(千人)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、就业状况分类、观测年份、观测值、数据状态标志等字段,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的标准化处理,确保与ICLS定义一致。

This dataset comprises 62,839 observational records from 34 Asian countries over the period 2000 to 2025. Its core indicator is the number of employed persons (in thousands) categorized by ILO sector, gender and employment status. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), acquired via API and filtered to retain only Asian country codes. The dataset includes fields such as country code, country name, data source, indicator code, gender category, employment status category, observation year, observed value, and data status flag. It is suitable for tasks including table classification, regression and time series forecasting. The data is published at an annual frequency and has undergone standardization by the ILO to ensure consistency with the ICLS definitions.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-temp-sex-ind-ste-nb-employment-by-ilo-sector-and-sex-and-status-in-emp 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口,直接获取了标识符为EMP_TEMP_SEX_IND_STE_NB的就业指标原始数据。随后,依据亚洲地区ISO 3166-1 alpha-3国家代码进行地理范围过滤,最终整合了34个亚洲国家从2000年至2025年的观测记录。Electric Sheep Asia团队对原始数据进行了重新封装,统一了模式格式并以Parquet格式发布,确保了数据的机器学习就绪性。
特点
数据集包含62,839条观测记录,覆盖了34个亚洲国家跨越26年的年度就业数据,以性别、ILO行业部门以及就业身份三个维度进行精细拆分。每条记录均提供了观测值及其状态标记,并附带了详尽的来源注释与方法修订说明,便于用户追溯数据质量。数据集的独到之处在于其来源的权威性与一致性——所有数据均经过ILO依据国际劳动统计学家会议定义进行标准化处理,确保了跨国家和跨时间比较的可靠性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码筛选特定国家的时间序列数据,或按指标、性别等维度进行分组聚合。数据集支持表格分类、回归以及时间序列预测等多种任务场景,亦可方便地通过透视表操作构建国家×年份的矩阵,以开展跨国的面板数据分析与可视化。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年通过其官方API构建,并经Electric Sheep Asia团队重新封装,专注于亚洲34个国家和地区2000至2025年间按行业、性别及就业身份分类的就业数据(单位:千人)。作为全球劳动统计的权威来源,ILOSTAT依托各国劳动力调查、家庭收入调查及行政记录,采用国际劳工统计学家会议(ICLS)定义进行数据协调,为研究亚洲劳动力市场结构、性别就业差异及行业变迁提供了高粒度的时间序列基础。该数据集因其覆盖广度、标准化分类及开源特性(CC-BY-4.0),成为发展经济学、劳动社会学及区域政策评估领域的重要实证资源,尤其适合于跨国家、跨时期的比较分析与预测建模。
当前挑战
该数据集面临的核心挑战在于多源异构数据整合中的一致性与可靠性问题。不同国家采用差异化的调查方法与统计口径,即便经ILO协调,仍存在“最佳来源”选择带来的数据断点与修订标记(如‘Break in series: Methodology revised’),这给长期趋势分析引入结构不连续性。性别与行业细分维度中部分观测值因数据稀疏或标记为‘不可靠’(obs_status=U)而影响模型鲁棒性。构建过程中,ILOSTAT API的访问限制、年度频率数据与月度/季度序列的缺失,以及亚洲国家间数据覆盖时长不均(如日本自2000年起,印度始于2012年),均增加了时间序列预测与面板数据分析的复杂性,需要谨慎处理缺失值、异常值及异质性方差问题。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集为分析亚洲地区就业结构的时空演变提供了标准化基础。研究者可借助其涵盖34个国家、跨越25年的就业指标,按国际劳工组织定义的产业部门、性别及就业身份进行多维交叉剖析。常见的应用包括构建面板数据模型以揭示经济增长与就业弹性之间的关系,或利用时间序列方法追踪特定国家在全球化进程中的就业结构转型轨迹。数据的高颗粒度特征使其特别适合检验劳动力市场分割理论,以及评估性别平等政策在亚洲不同发展水平经济体中的实施效果。
衍生相关工作
围绕该数据集已衍生出一系列重要的学术贡献和工具创新。研究者在进行亚洲区域劳动力市场比较时,常将此数据与国际货币基金组织或世界银行的经济指标进行关联分析,构建了预测就业弹性的计量经济学模型。在数据科学社区,该数据集促进了面向劳动统计的机器学习流水线开发,例如自动检测就业数据断点或异常值的质量评估算法。基于其结构化特征,有学者构建了亚洲就业可持续性指数框架,将部门就业份额、性别平等和就业正规化程度纳入综合评价体系。同时,该数据被广泛用于验证经济危机与疫情冲击下就业韧性的时空差异假说。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区按国际劳工组织(ILO)行业、性别及就业身份划分的就业人数统计(单位:千),覆盖2000至2025年间34个亚洲国家的62,839条观测值,为区域劳动力市场分析提供了高颗粒度的时序数据基础。在当前全球关注后疫情时代就业复苏、非正规就业转型及性别平等议题的背景下,该数据集成为研究亚洲经济体就业结构演变、行业迁移与劳动参与率动态的前沿工具。尤其值得关注的是,它支持结合ILOSTAT标准化分类体系,对制造业与服务业就业分化、女性就业权益保障以及新兴灵活用工形态进行跨时期、跨国别的比较分析。其再包装后的结构化格式与Python接口的无缝接入,显著降低了经济学家、政策制定者及可持续发展目标(SDG)研究者开展大规模计量建模与趋势预测的门槛,对于推动亚洲区域劳动力市场的循证决策与学术探索具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务