遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2003年至2025年的非正规经济就业统计数据,具体指标为按性别和城乡区域划分的非正规部门就业人数(千)。数据集共有4,511个观测值,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过筛选处理。数据集包含国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等列,并提供了数据质量说明和使用示例,适用于表格分类、回归和时间序列预测等任务。

--- license: cc-by-4.0 language: - en task_categories: - tabular-classification - tabular-regression - time-series-forecasting multilinguality: monolingual size_categories: - 1K<n<10K tags: - tabular - europe - ilostat - informal-economy - ilo - labour - employment pretty_name: "按性别与城乡地区划分的非正规部门就业人数(千人)| 欧洲(ILOSTAT)" --- # 按性别与城乡地区划分的非正规部门就业人数(千人)| 欧洲(ILOSTAT) 🇪🇺 **4511条观测数据** · **31个欧洲国家** · **2003–2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新整理发布* ![数据行数](https://img.shields.io/badge/rows-4,511-blue) ![覆盖国家数](https://img.shields.io/badge/countries-31-green) ![时间跨度](https://img.shields.io/badge/years-2003–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## TL;DR 本数据集包含覆盖31个欧洲国家、时间跨度为2003至2025年的**4511条非正规经济相关观测数据**,涵盖**1项独立指标**。 ## 数据来源说明 **国际劳工组织统计数据库(ILOSTAT)** 是国际劳工组织(ILO)的核心统计数据库,也是全球领先的劳工统计权威来源。其收录的指标涵盖就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标体面工作相关目标等领域,数据来源于全国劳动力调查、家庭收入调查、机构调查以及行政记录。该数据库覆盖全球200余个经济体,由国际劳工组织统计司负责数据的标准化协调工作。 - **原始来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_GEO_NB) - **发布方**:国际劳工组织(ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:非正规经济 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口 `https://rplumber.ilo.org/data/indicator?id=EMP_PIFL_SEX_GEO_NB` 拉取数据,并筛选出欧洲地区的ISO3国家代码对应的数据。ILOSTAT采用**国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)**制定的定义对原始调查微观数据进行标准化协调;数据来源的标识将存储在`source.label`列中,以保证可追溯性。 ## 地理覆盖范围 31个欧洲国家,以下按数据行数排序展示前若干条记录: | 国家(ISO3代码) | 数据行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `MDA` | 207 | 2003 | 2025 | | `BIH` | 171 | 2006 | 2024 | | `CZE` | 164 | 2007 | 2024 | | `BGR` | 162 | 2007 | 2024 | | `FIN` | 162 | 2007 | 2024 | | `EST` | 162 | 2007 | 2024 | | `AUT` | 162 | 2007 | 2024 | | `GRC` | 162 | 2007 | 2024 | | `FRA` | 162 | 2007 | 2024 | | `PRT` | 162 | 2007 | 2024 | | `LVA` | 162 | 2007 | 2024 | | `ITA` | 162 | 2007 | 2024 | | `LUX` | 162 | 2007 | 2024 | | `IRL` | 162 | 2007 | 2024 | | `ESP` | 162 | 2007 | 2024 | | ... | _另有16个国家_ | | | ## 指标(示例) - `EMP_PIFL_SEX_GEO_NB` — 按性别与城乡地区划分的非正规部门就业人数(千人) ## 数据结构 | 列名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国家代码 | `AUT` | | `ref_area.label` | `string` | 英文国家名称 | `奥地利` | | `source` | `string` | ILOSTAT 来源代码(例如劳动力调查) | `BB:275` | | `source.label` | `string` | 英文来源名称 | `HIES - 欧盟收入与负债统计……` | | `indicator` | `string` | ILOSTAT 指标代码 | `EMP_PIFL_SEX_GEO_NB` | | `indicator.label` | `string` | 英文指标名称 | `按性别与城乡地区划分的非正规部门就业人数……` | | `sex` | `string` | 性别分组维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、身份等) | `GEO_COV_NAT` | | `classif1.label` | `string` | — | `区域类型:全国范围` | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `157.365` | | `obs_status` | `string` | 观测状态标记(例如临时、不可靠) | `U` | | `obs_status.label` | `string` | — | `不可靠` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `序列中断:方法学修订` | | `note_source` | `string` | — | `R1:3513_T2:85` | | `note_source.label` | `string` | — | `存储库:国际劳工组织统计数据库 - 微观数据……` | ## 数据分解维度 以下列提供数据分解维度: - **`sex`**(共3个唯一取值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个来源时,将采用国际劳工组织选定的“最优来源”数据。 - 分解维度列(`sex`、`classif1`、`classif2`)仅在指标支持对应细分时才会非空。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("electricsheepeurope/europe-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python germany = df[df["ref_area"] == "DEU"] ### 单个指标的时间序列数据 python sample = (df[df["indicator"] == "EMP_PIFL_SEX_GEO_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EMP_PIFL_SEX_GEO_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EMP_PIFL_SEX_GEO_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_emp_pifl_sex_geo_nb_employment_outside_the_formal_sector_by_sex_and_ru_2025, title = {按性别与城乡地区划分的非正规部门就业人数(千人)| 欧洲(ILOSTAT)}, author = {国际劳工组织(ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_GEO_NB}, publisher = {HuggingFace数据集,由Electric Sheep Europe重新整理发布}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。 原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始来源与Electric Sheep Europe的重新整理版本。 ## 关于Electric Sheep Electric Sheep Europe是Electric Sheep使命的一部分:该项目旨在在HuggingFace平台上构建统一的、适配机器学习的欧洲数据层。我们从权威开源数据源拉取数据,对其schema进行标准化,以Parquet格式打包发布,并采用统一的数据集卡片格式,使研究人员与开发者可以通过`load_dataset()`函数在数秒内启动工作。 浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) --- _数据溯源:2026年5月26日通过Electric Sheep管道摄入。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_PIFL_SEX_GEO_NB_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-geo-nb-employment-outside-the-formal-sector-by-sex-and-ru 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API端点直接抓取指标EMP_PIFL_SEX_GEO_NB的原始记录,并依据ISO3国家代码筛选出欧洲国家数据。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化处理,数据中保留了source.label等字段以追溯原始来源。Electric Sheep Europe在获取数据后,将其规范化为Parquet格式并发布至HuggingFace平台,最终形成覆盖31个欧洲国家、时间跨度为2003至2025年的4511条观测。
特点
数据集聚焦于非正规部门就业领域,按性别和城乡区域对就业人数进行细分,核心指标为EMP_PIFL_SEX_GEO_NB,以千人为计量单位。数据涵盖31个欧洲国家,具有显著的时序特征,年度频率观测跨越二十余年。模式中包含ref_area、source、indicator、sex、classif1、time、obs_value等字段,并提供obs_status等质量标志列以标示数据可靠性。性别维度包含总计、男性和女性三类取值,区域维度则区分全国、农村与城市,为分析非正规就业的性别差异与城乡分化提供了精细化的数据支撑。
使用方法
研究者和开发者可借助HuggingFace的datasets库,通过load_dataset函数直接加载该数据集,并利用to_pandas方法转换为数据框进行后续分析。在具体应用中,用户可按ref_area字段筛选特定国家,或按indicator字段提取单一指标的时间序列数据,亦可利用pivot_table方法将数据重塑为国家与年份的交叉矩阵。数据集支持表格分类、表格回归与时间序列预测等任务类型,适用于非正规就业规模的趋势分析、跨国比较及性别与城乡维度的差异性研究,使用时应遵循cc-by-4.0许可协议并引用原始来源。
背景与挑战
背景概述
非正规经济就业的测度长期以来构成劳动统计领域的核心议题,其数据稀缺性制约着对体面劳动实现程度的评估。国际劳工组织依托国际劳工统计学家会议(ICLS)决议框架,经由ILOSTAT数据库系统性地汇集各国劳动力调查与家庭收入调查等微观数据,构建了涵盖2003至2025年、31个欧洲国家、共4,511条观测值的非正规部门外就业数据集。该数据集由Electric Sheep Europe于2025年重新打包发布,以性别与城乡地域为双重分层维度,为监测欧洲非正规就业的性别差异与空间异质性提供了可复用的标准化数据基础,对劳动经济学与政策评估研究具有重要支撑价值。
当前挑战
该数据集所回应的领域问题在于,非正规就业的跨国可比测度长期受制于定义分歧、调查工具差异与覆盖偏差,构建统一且可追溯的时序面板数据面临显著困难。具体挑战包括:各国对非正规部门外就业的操作性界定存在异质性,ICLS标准的落地程度参差不齐;部分观测值标注为不可靠或存在序列断点,反映数据质量与口径调整带来的连续性障碍;性别与城乡维度的分层并非在所有国家与年份均可得,导致面板结构不平衡;此外,来源标注体系复杂,同一国家年份可能对应多重调查来源,甄别与协调成本较高。上述因素共同制约着跨时空比较分析的精确性与稳健性。
常用场景
经典使用场景
在劳动经济学与 Informal Economy 研究领域,该数据集最为经典的应用场景在于刻画欧洲非正规部门就业的性别差异与城乡分布图景。研究者借助 2003 至 2025 年间 31 个欧洲国家 4511 条观测记录,得以按性别(男性、女性、总体)与城乡区域类型进行细粒度比较,进而揭示非正式就业在性别维度和地域维度上的异质性模式。此类时序截面混合数据结构尤其适用于面板回归、双重差分以及时间序列预测等计量分析,为评估欧洲劳动力市场非正规化程度提供了可复用的标准化数据基础。
衍生相关工作
基于该数据集及其所依托的 ILOSTAT 体系,学界与政策研究机构衍生出一系列经典工作。其中包括对欧洲非正规就业决定因素的跨国计量分析、非正规经济与贫困及社会排斥关系的实证探讨、女性非正规就业脆弱性的专题报告,以及将 ILOSTAT 数据与欧盟劳动力调查(EU-LFS)相结合的比较研究。这些工作共同拓展了非正规部门统计在劳动经济学、发展经济学与社会政策领域的应用边界,并推动了非正规就业测量标准的持续完善。
数据集最近研究
最新研究方向
在全球非正规经济治理与体面劳动议程深化的背景下,该数据集所承载的欧洲31国2003至2025年非正规部门就业性别与城乡分布数据,正成为劳动经济学与发展经济学交叉领域的前沿研究对象。近期研究聚焦于运用面板数据与时间序列模型,辨析性别差异与城乡二元结构在非正规就业中的交互效应,并结合国际劳工组织体面劳动国别计划等政策热点,探讨非正规就业规模变动对社会保障扩面与劳动力市场制度改革的反馈机制。相关成果为欧盟就业政策协调、可持续发展目标中非正规就业监测指标的构建提供了实证基础,亦推动了跨国劳动统计数据的标准化与机器学习适用性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务