遇见数据集

electricsheepasia/asia-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于亚洲全职等效就业的观测数据,按性别划分,基于国际劳工组织(ILO)的模型估计。数据覆盖49个亚洲国家,时间跨度为2005年至2027年,共有6,708个观测值,涉及一个独特指标(EMP_2FTE_SEX_JBF_NB),用于衡量全职等效就业人数(以千计)。数据来源于ILOSTAT(ILO的中央统计数据库),经过标准化处理,包括国家代码、来源、指标、性别分类、年份和观测值等列,适用于表格分类、回归和时间序列预测任务。数据集由Electric Sheep Asia重新打包,以促进机器学习应用。

--- license: CC BY 4.0 language: - 英语(en) task_categories: - 表格分类 - 表格回归 - 时间序列预测 multilinguality: 单语言 size_categories: - 1000 < 样本数 < 10000 tags: - 表格数据 - 亚洲 - ILOSTAT - 就业 - ILO - 劳动力 pretty_name: "按性别划分的全职当量就业人数——国际劳工组织(International Labour Organization,ILO)2025年11月建模估计值(单位:千)| 亚洲地区(ILOSTAT)" --- # 按性别划分的全职当量就业人数——国际劳工组织(International Labour Organization,ILO)2025年11月建模估计值(单位:千)| 亚洲地区(ILOSTAT) 🌏 **共6708条观测样本** · **覆盖49个亚洲国家** · **时间跨度为2005年至2027年** · *由[Electric Sheep Asia](https://huggingface.co/electricsheepasia)重新整理发布* ![数据行数](https://img.shields.io/badge/数据行数-6,708-blue) ![覆盖国家数](https://img.shields.io/badge/覆盖国家数-49-green) ![时间跨度](https://img.shields.io/badge/时间跨度-2005–2027-orange) ![指标数量](https://img.shields.io/badge/指标数量-1-purple) ![许可协议](https://img.shields.io/badge/许可协议-CC BY 4.0-lightgrey) ## 快速概览(TL;DR) 本数据集包含**6708条就业相关观测样本**,覆盖**49个亚洲国家**,时间跨度为**2005年至2027年**,仅包含**1项独立指标**。 ## 数据来源 **ILOSTAT**是国际劳工组织(International Labour Organization,ILO)的核心统计数据库,是全球领先的劳动力统计权威数据源。其收录的指标涵盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(Sustainable Development Goals,SDG)的体面工作目标等领域,数据来源于全国劳动力调查、家庭收入调查、机构调查以及行政记录。该数据库覆盖全球200余个经济体,由国际劳工组织统计司负责数据的标准化处理。 - **数据源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_2FTE_SEX_JBF_NB) - **发布方**:国际劳工组织(International Labour Organization,ILO) - **许可协议**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:就业 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EMP_2FTE_SEX_JBF_NB`拉取原始数据,并筛选出亚洲地区的ISO 3166-1 alpha-3国家代码对应的样本。ILOSTAT采用国际劳工统计会议(International Conference of Labour Statisticians,ICLS)制定的定义对原始调查微观数据进行标准化处理;数据来源信息将在`source.label`字段中标记,以确保可追溯性。 ## 地理覆盖范围 共覆盖49个亚洲国家,以下按数据行数排序展示部分国家示例: | 国家代码 | 数据行数 | 起始年份 | 终止年份 | |---------|-----:|-----------:|----------:| | `AFG` | 138 | 2005 | 2027 | | `ARE` | 138 | 2005 | 2027 | | `ARM` | 138 | 2005 | 2027 | | `AZE` | 138 | 2005 | 2027 | | `BGD` | 138 | 2005 | 2027 | | `BHR` | 138 | 2005 | 2027 | | `BRN` | 138 | 2005 | 2027 | | `BTN` | 138 | 2005 | 2027 | | `CHN` | 138 | 2005 | 2027 | | `CYP` | 138 | 2005 | 2027 | | `GEO` | 138 | 2005 | 2027 | | `IDN` | 138 | 2005 | 2027 | | `IND` | 138 | 2005 | 2027 | | `IRN` | 138 | 2005 | 2027 | | `IRQ` | 138 | 2005 | 2027 | | ... | 另有34个国家 | | | ## 指标示例 - `EMP_2FTE_SEX_JBF_NB` — 按性别划分的全职当量就业人数——国际劳工组织(ILO)2025年11月建模估计值(单位:千) ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国家代码 | `AFG` | | `ref_area.label` | `string` | 英文国家名称 | `阿富汗` | | `source` | `string` | ILOSTAT 来源代码(如劳动力调查) | `XA:2198` | | `source.label` | `string` | 英文来源名称 | `ILO - 建模估计值` | | `indicator` | `string` | ILOSTAT 指标代码 | `EMP_2FTE_SEX_JBF_NB` | | `indicator.label` | `string` | 英文指标名称 | `按性别划分的全职当量就业人数……` | | `sex` | `string` | 性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、就业状态等) | `JBF_FTE_FTE40` | | `classif1.label` | `string` | — | `全职当量:基于40小时工时……` | | `time` | `int64` | 观测年份 | `2027` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `7752.571` | | `obs_status` | `string` | 观测状态标记(如临时、不可靠) | `A` | | `obs_status.label` | `string` | — | `已调整` | ## 数据细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 细分维度字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分时才会包含非空值。 ## 使用方法 以下是使用示例代码: python from datasets import load_dataset ds = load_dataset("electricsheepasia/asia-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle") df = ds["train"].to_pandas() print(df.head()) ### 按国家筛选 python indonesia = df[df["ref_area"] == "IDN"] ### 生成单个指标的时间序列图表 python sample = (df[df["indicator"] == "EMP_2FTE_SEX_JBF_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EMP_2FTE_SEX_JBF_NB") ### 转换为国家-年份交叉矩阵 python matrix = (df[df["indicator"] == "EMP_2FTE_SEX_JBF_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 请使用以下BibTeX格式引用本数据集: bibtex @misc{asia_ilo_emp_2fte_sex_jbf_nb_full_time_equivalent_employment_by_sex_ilo_modelle_2027, title = {Full-time equivalent employment by sex -- ILO modelled estimates, Nov. 2025 (thousands) | Asia (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2027}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_2FTE_SEX_JBF_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Asia}, howpublished = {url{https://huggingface.co/datasets/electricsheepasia/asia-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle}} } ## 许可协议 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可协议发布。 原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源及Electric Sheep Asia的重新整理版本。 ## 关于Electric Sheep Electric Sheep是Electric Sheep使命的一部分:旨在构建一个统一的、可直接用于机器学习的亚洲地区数据层,托管于HuggingFace平台。我们从权威开源数据源获取数据,对数据模式进行标准化处理,打包为Parquet格式,并发布格式统一的数据集卡片,以便研究人员和开发者仅需使用`load_dataset()`即可在数秒内开始工作。 浏览完整数据集集合:[huggingface.co/electricsheepasia](https://huggingface.co/electricsheepasia) --- _数据溯源:2026年5月28日通过Electric Sheep管道获取。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_2FTE_SEX_JBF_NB_

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-2fte-sex-jbf-nb-full-time-equivalent-employment-by-sex-ilo-modelle 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Asia团队通过REST API直接提取并重新封装而成。原始数据遵循国际劳工统计学家会议(ICLS)定义进行统一处理,确保了跨国可比性。数据集聚焦于亚洲地区,涵盖49个国家的‘按性别划分的等量全职就业人数’指标,时间跨度为2005年至2027年,共计6708条观测记录。每个观测包含国家代码、性别分类、数据来源、观测值及其状态标志等字段,且原始调查微数据经过ILO规范化处理,数据来源标注于source.label列中,便于追溯。
特点
本数据集具有多维度颗粒度与权威性兼备的鲜明特点。它融合了时间序列、地理空间与性别维度:纵贯23年的年度数据揭示了亚洲劳动力市场的长期演变,横跨49个国家的覆盖范围勾勒出区域就业全貌,而性别分组(总计、男性、女性)使研究者能够深入挖掘性别差异。数据来源于ILO建模估计,提供从2005年历史值至2027年预测值的连贯序列,并附带观测状态标志(如调整值)以标示数据质量。此外,每个指标均配有英文标签与ILO内部编码,极大便利了跨数据集整合。
使用方法
研究者可通过HuggingFace Datasets库便捷加载数据,仅需一行代码即可将数据集转换为pandas DataFrame进行后续分析。典型应用包括:依据国家代码(如ref_area为‘IDN’筛选印度尼西亚数据)开展国别研究;对单一指标按时间排序后绘制趋势图,观察就业变化;或通过pivot_table构建国家×年份矩阵,实现跨国面板数据分析。数据集支持分类与回归任务,亦适用于时间序列预测,为劳动经济学、性别研究与亚洲发展议题提供了现成、可复现的数据基础。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDG)监测领域,按性别分列的就业数据是评估劳动力市场性别平等与体面劳动进展的核心指标。该数据集由国际劳工组织(ILO)统计司基于2025年11月发布的最新模型估算创建,并由Electric Sheep Asia于2026年重新封装为机器学习就绪格式,覆盖2005年至2027年亚洲49个国家的6,708条观察值。数据聚焦于全职等效就业的性别结构,依托ILOSTAT全球劳动统计数据库,整合各国劳动力调查与行政记录,经ILO统一校准后提供可比性极高的时序数据。该数据集填补了亚洲区域高分辨率性别就业数据的空白,为政策制定者、经济学家与AI研究者追踪就业模式变迁、构建预测模型提供了标准化基础,是推动区域劳动市场分析与国际比较研究的重要工具。
当前挑战
该数据集所应对的核心领域挑战在于劳动统计中性别维度的数据稀疏性与可比性不足——许多亚洲国家缺乏连续、规范的按性别划分的就业调查,ILO需通过模型估算填补跨国和跨年度的空缺,但估算本身依赖的假设与插补方法可能导致不确定性被隐含传递。构建过程中的挑战主要体现在多源数据的异质性处理:不同国家的调查定义、时间间隔与质量标注方式迥异,需在49个国家、23年跨度的时序内统一“最佳来源”选择逻辑,同时处理因个别指标存在的多种分解维度(如性别、劳动时间阈值)带来的数据完整性难题。此外,数据集虽采用CC-BY-4.0许可开放,但原始数据标注的“调整值”(如obs_status为'A')若未在建模时明确提示,可能诱发对预测区间的误判,成为应用层面的隐性风险。
常用场景
经典使用场景
该数据集汇集了亚洲地区49个国家2005年至2027年按性别划分的等效全职就业人数,由国际劳工组织(ILO)通过ILOSTAT模型估算得出。在劳动经济学与发展研究领域,研究者常将其用于跨国劳动力市场的比较分析,揭示亚洲各国在性别就业平等、劳动参与率变迁及经济发展阶段之间的内在关联。通过对时间序列数据的建模,可追踪全球金融危机、新冠疫情等重大事件对区域就业结构的冲击与恢复路径,为宏观劳动力政策的制定提供实证基础。
解决学术问题
这一数据集为解答性别经济学与劳动力市场研究中长期存在的难题提供了宝贵资源:如何系统量化亚洲各国女性就业的真实水平及其与经济增长的关系。传统统计往往低估非正规部门或兼职劳动中的女性参与,而ILO模型估算方法通过统一标准校正了测量偏差。借助该数据,学者能够检验性别平等的库兹涅茨假说、考察女性劳动供给与产业结构转型的互动机制,并评估国际劳工标准对就业质量的影响。其跨年度特性还支持面板数据分析,从而控制国家固定效应,更精准地识别性别就业差距的决定因素。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作,推动了劳动经济学的实证研究范式。一方面,研究者将其与ILO提供的职业伤害、社会保护及非正规就业数据相结合,构建了多维劳动力福祉指数,深化了就业质量的理解。另一方面,基于该数据的时间序列预测方法被纳入计量经济学教材,成为演示随机趋势与季节性分解的经典案例。此外,电羊亚洲团队(Electric Sheep Asia)对数据的规范化封装,使得工业界能够通过一行代码即加载模型就绪的表格数据,催生了多个面向亚洲劳动力市场的自动报告生成工具与决策支持系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务