遇见数据集

electricsheepafrica/africa-ilo-ees-tees-sex-ocu-dsb-nb-employees-by-sex-occupation-and-disability-status

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的雇员数据,专注于非洲地区。数据集主题为按性别、职业和残疾状况分类的雇员(千计),覆盖39个非洲国家,时间跨度为1998年至2025年,共包含4,194个观测值。核心指标为EES_TEES_SEX_OCU_DSB_NB,即按性别、职业和残疾状况分类的雇员数量(以千计)。数据通过ILOSTAT REST API获取,并经过筛选和标准化处理,以确保一致性和可追溯性。数据集采用表格格式,包含多列,如国家代码(ref_area)、指标代码(indicator)、性别分类(sex)、时间(time)、观测值(obs_value)等,并提供了数据来源、质量注释和分类维度(如性别分为总计、男性和女性)。数据适用于表格分类、回归和时间序列预测等任务,可用于分析非洲劳动力市场的趋势和差异。数据集由Electric Sheep Africa重新打包,以方便机器学习研究使用。

This dataset contains employee data from the International Labour Organization (ILO) ILOSTAT database, focusing on Africa. The datasets theme is Employees by sex, occupation and disability status (thousands), covering 39 African countries from 1998 to 2025, with 4,194 observations. The core indicator is EES_TEES_SEX_OCU_DSB_NB, representing the number of employees (in thousands) disaggregated by sex, occupation, and disability status. Data is sourced via the ILOSTAT REST API, filtered for Africa, and harmonized using ICLS definitions for consistency and traceability. The dataset is in tabular format with columns such as country code (ref_area), indicator code (indicator), sex classification (sex), time (year), observed value (obs_value), and includes source information, quality notes, and disaggregation dimensions (e.g., sex with total, male, female). It is suitable for tasks like tabular classification, regression, and time-series forecasting, enabling analysis of labor market trends and disparities in Africa. Repackaged by Electric Sheep Africa for machine learning readiness.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ees-tees-sex-ocu-dsb-nb-employees-by-sex-occupation-and-disability-status 数据集图片
构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT),由Electric Sheep Africa团队在Hugging Face平台进行标准化元数据封装与重新发布。覆盖非洲39个国家,时间跨度为1998年至2025年,共计4194条观测记录。数据以性别、职业类别及残疾状况为维度,统计雇员人数(以千为单位),并以Parquet格式存储,便于高效读取与列式分析。数据集的构建遵循开放数据规范,保留原始发布者的版权归属,同时补充了发现性元数据与使用指引,使非洲劳动力市场数据更易于被研究者和分析师获取与复用。
特点
该数据集聚焦于非洲地区雇员在性别、职业与残疾状态交叉维度上的分布特征,具备鲜明的人口与劳动经济学属性。其核心特点包括:覆盖范围广泛,横跨39个非洲国家并纵贯近三十年;观测粒度精细,可支撑多维分组比较;数据以表格形式组织,兼具结构化与文本元数据,适配分类与回归任务。数据集体量适中,介于1K至10K行之间,适合作为探索性分析与可重复研究的基准材料。同时,数据集附有来源溯源说明与许可证信息,保障了使用的合规性与透明度。
使用方法
使用者可通过Hugging Face的datasets库以load_dataset函数直接加载该数据集,获取默认切分后查看特征结构与样本记录。对于表格分析场景,可将数据集转换为Pandas DataFrame,进而开展缺失值检查、变量分布概览及分组统计。建议在建模前核实变量定义、单位与地理编码,并利用显式的国家、年份及指标字段与其他Electric Sheep Africa数据集进行联接。分析过程中应保留缺失值,直至确立合理的插补规则,同时引用原始来源与Hugging Face仓库链接以增强研究可复现性。
背景与挑战
背景概述
国际劳工组织于1998年启动ILOSTAT数据库建设,旨在系统汇集全球劳动力市场统计指标。该数据集由Electric Sheep Africa团队于2026年重新封装发布,涵盖39个非洲国家1998至2025年间4194条观测记录,聚焦按性别、职业及残疾状况分列的雇员人数(千人)。作为非洲劳动市场性别平等与残障包容议题的关键实证基础,它为研究者提供了跨域、跨时段的可比性数据支撑,有力推动了非洲就业结构变迁与弱势群体劳动参与的政策探讨。
当前挑战
该数据集所应对的核心领域问题在于,非洲劳动力市场中按性别、职业与残疾状况交叉分类的就业统计长期存在系统性空缺,难以支撑残障群体与性别差异的精细化分析。构建过程中面临多重挑战:原始ILOSTAT数据在非洲各国的职业分类标准与残疾定义上存在显著异质性,汇集为统一可比面板的协调成本高昂;部分国家与年份的观测值缺失严重,需谨慎处理缺失机制以避免估计偏误;元数据中地理与上游发布者字段的缺省,进一步增加了溯源的复杂性。
常用场景
经典使用场景
在劳动经济学与残障就业研究的交叉领域,该数据集扮演着基础性观测载体的角色,其经典使用场景聚焦于依托国际劳工组织统计数据库的标准化框架,对非洲39个国家1998年至2025年间按性别、职业类别与残障状况分列的雇员规模进行多维度剖分。研究者通常以国别与年份为纵轴,以残障身份与性别交叉分层为横轴,刻画残障群体在各类职业中的就业分布形态,并借由观察值达4194条的时序数据,识别残障就业结构在非洲区域内部的异质性演变轨迹,从而为跨国比较分析提供可比口径的量化基底。
实际应用
在实际应用层面,该数据集为国际发展机构、非洲区域政策制定者及非政府组织提供了监测残障就业承诺落实情况的量化依据。依托其按性别与职业双重分层的雇员人数序列,使用者可识别残障者在高技能与低技能职业间的分布失衡,评估特定国家在残障融合就业目标上的进展,亦可将该数据与其他社会经济指标进行国别—年份联结,构建残障就业脆弱性指数,用以指导职业培训资源配置与反歧视立法的优先序设定,从而弥合统计数据与政策干预之间的转化鸿沟。
衍生相关工作
以该数据集为起点,衍生工作主要沿两条路径展开:其一,在Electric Sheep Africa元数据清单框架下,与非洲区域其他劳工统计数据集进行国别、年份与指标字段的横向联结,形成覆盖多指标的综合劳动市场分析库;其二,研究者借鉴其残障—性别—职业三维分层逻辑,将其作为基准数据扩展至非正式就业、工资差异等相邻议题,推动非洲残障劳动统计从单点描述向系统化证据基础设施演进,并为后续机器学习驱动的缺失数据插补与跨国预测模型提供可复用的训练素材。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务