遇见数据集

electricsheepasia/asia-ilo-emp-temp-sex-ind-dsb-nb-employment-by-ilo-sector-and-sex-and-disability-st

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的就业数据,专门针对亚洲地区。数据覆盖19个亚洲国家,时间跨度为2000年至2024年,共包含13,928个观测值。核心指标为EMP_TEMP_SEX_IND_DSB_NB,即按ILO部门、性别和残疾状况分类的就业人数(以千计)。数据集提供了详细的结构化信息,包括国家代码(ref_area)、数据来源(source)、指标代码(indicator)、性别分类(sex)、ILO部门分类(classif1)、残疾状况分类(classif2)、观测年份(time)、观测值(obs_value)等列。数据通过ILOSTAT REST API获取,并经过标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。数据集还包含数据质量说明,例如数据为年度频率,并使用ILO的最佳来源选择方法。

This dataset contains employment data from the International Labour Organization (ILO) ILOSTAT database, specifically for Asia. It covers 19 Asian countries from 2000 to 2024, with 13,928 observations. The core indicator is EMP_TEMP_SEX_IND_DSB_NB, representing employment by ILO sector, sex, and disability status (in thousands). The dataset provides structured details including columns for country code (ref_area), data source (source), indicator code (indicator), sex disaggregation (sex), ILO sector classification (classif1), disability status classification (classif2), observation year (time), observed value (obs_value), and more. Data is sourced via the ILOSTAT REST API and normalized for machine learning tasks such as tabular classification, regression, and time-series forecasting. It also includes data quality notes, such as annual frequency and use of ILOs best source selection.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-temp-sex-ind-dsb-nb-employment-by-ilo-sector-and-sex-and-disability-st 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据平台,是全球劳动力统计领域的权威数据源。数据通过ILOSTAT REST API直接获取,限定为亚洲地区的ISO3国家代码,并经过Electric Sheep Asia团队的重新封装与标准化处理。ILOSTAT平台依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行一致性处理,使得不同国家来源的劳动力量表、家庭收入调查、机构调查及行政记录等多元数据得以统一。数据集最终以13928条观测记录、覆盖19个亚洲国家、时间跨度为2000年至2024年的形式呈现,专注于“按ILO部门、性别和残疾状况划分的就业人数(千)”这一核心指标。
特点
本数据集最显著的特点在于其精细的多维分类结构,不仅按性别(男、女、总计)进行分解,还纳入了ILO部门分类和残疾状况双重维度,为研究劳动市场中的弱势群体提供了珍贵视角。数据变量除了核心的观测值(obs_value)外,还包含来源标记(source.label)、观测状态标志(obs_status)以及断点说明(note_indicator.label),便于用户识别数据质量与统计口径变化。数据以年为单位,覆盖长达四分之一世纪的时间范围,为进行时间序列分析和跨国产出比较提供了坚实基础。所有记录均以Parquet格式标准化存储,可直接与Python数据处理生态无缝衔接。
使用方法
使用该数据集极为便捷,首先通过HuggingFace Datasets库的load_dataset函数即可一键加载,并获得一个可直接转为Pandas DataFrame的训练集。用户可通过ref_area字段按ISO国家代码筛选特定国家,例如筛选印度尼西亚数据。对于时间序列应用,可利用indicator字段过滤指标后,按time排序并直接绘图展示趋势。此外,借助pivot_table方法可将数据转为国家×年份的矩阵形式,适用于多国面板数据回归分析。数据集以cc-by-4.0许可发布,使用时需同时标注原始数据来源(国际劳工组织)及封装方Electric Sheep Asia,确保学术引用规范与数据溯源完整性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT统计数据库于2024年整理发布,并经Electric Sheep Asia团队重新封装,聚焦于2000年至2024年间亚洲19个国家的就业数据,涵盖按产业、性别及残疾状况细分的三万余条观测记录。作为全球劳动统计的权威来源,ILOSTAT通过整合国家劳动力调查、家庭收入调查及行政记录等多元数据,为理解亚洲劳动力市场的结构性特征提供了关键支撑。该数据集的核心研究问题在于揭示产业转型、性别平等与残疾包容性就业之间的动态关联,其对政策制定者、经济学家及社会学者评估可持续发展目标(SDG)中的体面劳动进展具有重要参考价值,尤其填补了亚洲地区在残疾人群就业统计方面的数据空白。
当前挑战
数据集面临的核心挑战在于应对多源数据整合过程中出现的定义差异与统计口径不一致问题,例如不同国家在产业分类、残疾认定标准及性别细分层级上的分歧,要求研究者设计稳健的归一化方法以确保跨国家可比性。构建过程中,ILOSTAT需从各国异构的原始调查数据中抽提一致指标,并借助国际劳工统计会议(ICLS)标准进行协调,但数据质量标注(如“不可靠”“方法修订”)揭示了历史序列断裂与观测值异常等隐患。此外,时序数据的年度频率限制了短期波动分析,而部分国家样本量稀疏(如马尔代夫仅178条记录)引发了对统计显著性的担忧,同时残疾状况子类别的缺失进一步压缩了细分群体的分析维度。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集最为经典的使用场景是开展亚洲地区残障人群就业状况的跨国比较分析。通过整合国际劳工组织标准化定义的就业指标,结合性别、行业及残障身份等多维分类变量,研究者能够系统刻画不同亚洲国家在残障包容性就业方面的差异与变迁。该数据集覆盖2000年至2024年的时序观测,为追踪残障劳动力市场融入的长期趋势提供了宝贵的数据基础,尤其适用于面板数据回归、生存分析以及不平等测度等量化研究方法。
解决学术问题
该数据集的核心学术价值在于回应了残障群体就业机会不平等这一长期被忽视的社会科学命题。通过提供跨国、跨时间且具备性别和行业细颗粒度的就业数据,它使研究者得以实证检验国际劳动标准在不同亚洲经济体的实施效果,并量化分析残障歧视、社会保护政策与劳动力市场结构之间的关系。数据集所揭示的就业差异模式,为评估联合国可持续发展目标中体面工作与经济增长指标的实现进展提供了关键证据,推动了劳动经济学、残障研究与发展政治经济学等领域的交叉创新。
衍生相关工作
该数据集已催生了一系列跨学科的研究工作,其中包括基于机器学习方法构建的残障就业率预测模型,以及将经济危机、突发公共卫生事件与残障就业波动关联起来的因果推断研究。部分学者利用该数据开发了量化残障就业性别鸿沟的标准化指数,并对比不同亚洲福利体制下残障包容政策的收敛与分化趋势。此外,也有研究通过该数据集与人口普查、教育统计等面板数据的联动,探讨残障者的人力资本积累如何影响其长期职业生涯轨迹,从而拓展了对劳动力市场边缘群体的系统性理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务