遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-est-dsb-nb-employment-outside-the-formal-sector-by-sex-establ

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,761个观测值,涉及14个亚洲国家(包括蒙古、斯里兰卡、巴勒斯坦、亚美尼亚、印度尼西亚、老挝、柬埔寨、孟加拉国、黎巴嫩、缅甸、阿富汗、伊拉克、巴基斯坦、塔吉克斯坦)在2006年至2024年期间的非正规经济数据。核心指标为EMP_PIFL_SEX_EST_DSB_NB,即按性别、企业规模和残疾状况划分的非正规部门就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接提取并过滤为亚洲国家代码。数据集结构包括国家代码、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值等列,并包含数据来源和质量标志。该数据集适用于表格分类、回归和时间序列预测任务,旨在提供亚洲地区非正规就业的标准化、机器学习就绪的数据。

license: 知识共享署名4.0协议(CC BY 4.0) language: - en task_categories: - 表格分类 - 表格回归 - 时间序列预测 multilinguality: 单语言 size_categories: - 1000 < 样本数 < 10000 tags: - 表格数据 - 亚洲 - 国际劳工组织统计数据库(ILOSTAT) - 非正规经济 - 国际劳工组织(ILO) - 劳工 - 就业 pretty_name: "按性别、企业规模与残疾状况划分的非正规部门就业人数(千人 | 亚洲(ILOSTAT))" --- # 按性别、企业规模与残疾状况划分的非正规部门就业人数(千人 | 亚洲(ILOSTAT)) 🌏 **1761条观测样本** · **14个亚洲国家** · **2006–2024年** · *由[Electric Sheep Asia](https://huggingface.co/electricsheepasia)重新整理发布* ![rows](https://img.shields.io/badge/rows-1,761-blue) ![countries](https://img.shields.io/badge/countries-14-green) ![years](https://img.shields.io/badge/years-2006–2024-orange) ![indicators](https://img.shields.io/badge/indicators-1-purple) ![license](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 核心摘要 本数据集包含覆盖14个亚洲国家、时间跨度为2006至2024年的**非正规经济**相关数据,共计**1761条观测样本**,仅包含**1项核心指标**。 ## 数据来源说明 **国际劳工组织统计数据库(ILOSTAT)**是国际劳工组织(ILO)的核心统计数据库,也是全球领先的劳工统计权威数据源。该库整合了就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作目标等领域的指标,数据来源于全国劳动力调查、家庭收入调查、企业调查及行政记录。其覆盖范围涵盖200余个经济体,由国际劳工组织统计部门负责数据的标准化协调工作。 - **数据来源**:[国际劳工组织统计数据库(ILOSTAT)](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_EST_DSB_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[知识共享署名4.0协议(CC BY 4.0)](https://creativecommons.org/licenses/by/4.0/) - **研究主题**:非正规经济 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EMP_PIFL_SEX_EST_DSB_NB`拉取数据,并筛选出ISO 3166-1 alpha-3国家代码属于亚洲的样本。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行标准化处理;数据来源信息会在`source.label`字段中标记,以保证可追溯性。 ## 地理覆盖范围 覆盖14个亚洲国家,以下按样本行数降序排列的前若干条记录: | 国家 | 样本行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `MNG` | 685 | 2006 | 2024 | | `LKA` | 287 | 2018 | 2024 | | `PSE` | 155 | 2018 | 2022 | | `ARM` | 116 | 2008 | 2017 | | `IDN` | 105 | 2019 | 2023 | | `LAO` | 75 | 2017 | 2022 | | `KHM` | 74 | 2012 | 2019 | | `BGD` | 42 | 2022 | 2022 | | `LBN` | 41 | 2019 | 2019 | | `MMR` | 39 | 2015 | 2015 | | `AFG` | 38 | 2021 | 2021 | | `IRQ` | 35 | 2021 | 2021 | | `PAK` | 35 | 2021 | 2021 | | `TJK` | 34 | 2016 | 2016 | ## 指标说明(示例) - `EMP_PIFL_SEX_EST_DSB_NB` — 按性别、企业规模与残疾状况划分的非正规部门就业人数(千人) ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3国家代码 | `AFG` | | `ref_area.label` | `string` | 英文国家名称 | `Afghanistan` | | `source` | `string` | ILOSTAT来源代码(例如劳动力调查) | `BA:15715` | | `source.label` | `string` | 英文来源名称 | `LFS - 劳动力调查` | | `indicator` | `string` | ILOSTAT指标代码 | `EMP_PIFL_SEX_EST_DSB_NB` | | `indicator.label` | `string` | 英文指标名称 | `Employment outside the formal sector …` | | `sex` | `string` | 按性别划分的细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `Total` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、身份等) | `EST_AGGREGATE_TOTAL` | | `classif1.label` | `string` | — | `Establishment size (Aggregate): Total` | | `classif2` | `string` | 可选第二分类变量 | `DSB_STATUS_TOTAL` | | `classif2.label` | `string` | — | `Disability status: Total` | | `time` | `int64` | 观测年份 | `2021` | | `obs_value` | `float64` | 观测指标值(单位依指标定义而定) | `5949.625` | | `obs_status` | `string` | 观测状态标记(例如暂定、不可靠) | `U` | | `obs_status.label` | `string` | — | `Unreliable` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `Break in series: Methodology revised` | | `note_source` | `string` | — | `R1:3513_S3:8` | | `note_source.label` | `string` | — | `Repository: ILO-STATISTICS - Micro da…` | ## 数据细分维度 以下字段提供数据细分维度: - **`sex`**(共3种唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,但本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 仅当指标支持对应细分维度时,细分字段(`sex`、`classif1`、`classif2`)才不会为空值。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepasia/asia-ilo-emp-pifl-sex-est-dsb-nb-employment-outside-the-formal-sector-by-sex-establ") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家数据 python indonesia = df[df["ref_area"] == "IDN"] ### 单指标时间序列可视化 python sample = (df[df["indicator"] == "EMP_PIFL_SEX_EST_DSB_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EMP_PIFL_SEX_EST_DSB_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EMP_PIFL_SEX_EST_DSB_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{asia_ilo_emp_pifl_sex_est_dsb_nb_employment_outside_the_formal_sector_by_sex_establ_2024, title = {按性别、企业规模与残疾状况划分的非正规部门就业人数(千人 | 亚洲(ILOSTAT))}, author = {国际劳工组织(ILO)}, year = {2024}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_EST_DSB_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Asia}, howpublished = {url{https://huggingface.co/datasets/electricsheepasia/asia-ilo-emp-pifl-sex-est-dsb-nb-employment-outside-the-formal-sector-by-sex-establ}} } ## 许可证 本数据集采用[知识共享署名4.0协议(CC BY 4.0)](https://creativecommons.org/licenses/by/4.0/)发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源与Electric Sheep Asia的重新整理版本。 ## 关于Electric Sheep Electric Sheep Asia是Electric Sheep项目的组成部分,该项目旨在HuggingFace平台上打造一套统一的、适配机器学习的亚洲地区数据层。我们从权威开源数据源拉取数据,对数据schema进行标准化处理,以Parquet格式封装,并发布格式统一的数据集卡片,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据开发工作。浏览完整数据集集合:[huggingface.co/electricsheepasia](https://huggingface.co/electricsheepasia) --- _数据溯源:2026-05-26通过Electric Sheep数据管道摄入。源数据链接:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_EST_DSB_NB_

提供机构:
electricsheepasia
二维码
社区交流群
二维码
科研交流群
商业服务