遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-edu-geo-nb-employment-outside-the-formal-sector-by-sex-educat

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2003年至2025年的非正式经济数据,共有23,075个观测值,覆盖一个核心指标:按性别、教育程度和城乡地区划分的正式部门外就业人数(千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过欧洲国家代码过滤处理。数据集提供了详细的分解维度,包括性别(总计、男性、女性)、教育程度和城乡地区类型,并包含国家代码、年份、观测值、数据来源和质量状态等信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 23,075 observations of informal economy data across 31 Europe countries, spanning 2003 to 2025, covering one key indicator: Employment outside the formal sector by sex, education and rural / urban areas (thousands). It is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European country codes. The dataset includes disaggregation dimensions such as sex (total, male, female), education, and rural/urban areas, with columns for country codes, year, observed values, data sources, and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-edu-geo-nb-employment-outside-the-formal-sector-by-sex-educat 数据集图片
构建方式
该数据集构建于国际劳工组织(ILO)的ILOSTAT中央统计数据库,该库以协调各国劳动力调查、家庭收入调查及行政记录而著称。数据经由ILOSTAT REST API直接抽取指标EMP_PIFL_SEX_EDU_GEO_NB,并筛查欧洲ISO3国家代码,形成涵盖31个欧洲国家、2003至2025年的23,075条观测。原始微观数据依据国际劳工统计学家会议(ICLS)定义进行统一协调,来源信息保留于source.label列以确保可追溯性,最终由Electric Sheep Europe重新打包发布为机器学习就绪的Parquet格式。
特点
数据集聚焦于正规部门以外的就业状况,以千人为单位,按性别、教育程度及城乡区域进行多维分解。其核心特征在于跨时空的广泛覆盖——横跨三十余国、逾二十年,提供年度频率的观测值,并包含性别(总计、男性、女性)等分层维度。数据附带观测状态标志与来源注释,可识别临时性或不稳定估计,为非正规经济领域的跨国比较与趋势分析提供结构化支撑。
使用方法
使用者可通过HuggingFace的datasets库以load_dataset函数加载数据集,并转换为Pandas数据框进行后续操作。典型分析路径包括:按ref_area列筛选特定国家(如DEU),按indicator列提取单一指标并依时间排序以绘制时序图,或利用pivot_table构建国家与年份的交叉矩阵。所有字段均采用标准化的列名与标签,便于直接用于表格分类、回归及时间序列预测等任务。
背景与挑战
背景概述
非正规部门就业长期以来是全球劳动力市场治理的核心议题,国际劳工组织(ILO)依托其ILOSTAT统计数据库,系统采集并协调各国劳动力调查数据,以刻画正式部门之外就业的规模与结构。该数据集由Electric Sheep Europe于2025年基于ILOSTAT的EMP_PIFL_SEX_EDU_GEO_NB指标重新封装发布,涵盖31个欧洲国家、2003至2025年间23,075条观测,按性别、教育程度及城乡区域多维分解。其核心研究问题在于揭示非正规就业的性别与教育梯度及区域异质性,为比较劳动制度、评估体面劳动进展提供细粒度实证基础。
当前挑战
该数据集所回应的领域问题,在于非正规就业本身定义模糊、跨国测量口径不一,且常与农业自雇、临时工等范畴交织,难以直接比较。构建过程中的挑战同样显著:各国劳动力调查的抽样设计、问卷措辞与参考期存在系统差异,ILO虽以国际劳工统计学家会议(ICLS)标准进行协调,仍不免出现序列断裂、观测状态标记为不可靠以及来源更替等情况;性别、教育、城乡三维交叉后部分单元格样本稀疏,导致估计值波动较大;此外,2003至2025年间部分国家数据缺失或仅覆盖较晚年份,加剧了面板不平衡,对趋势分析与跨国推断构成实质性约束。
常用场景
经典使用场景
在非正规经济部门就业的量化研究中,该数据集构成了一个不可或缺的实证基石。其经典使用场景聚焦于按性别、受教育程度及城乡地域对欧洲31国非正规就业人口进行系统性刻画。研究者可借此数据构建面板回归模型,用以识别不同教育层级与性别群体在非正规劳动力市场中的分布异质性,进而揭示城乡二元结构下就业形态的差异化演变轨迹。时间序列分析亦为常见路径,通过2003至2025年的连续观测值,可捕捉经济周期波动与制度变迁对非正规就业规模的动态冲击。
解决学术问题
该数据集有效回应了劳动经济学与发展经济学中长期存在的若干核心学术议题。其首要贡献在于为“非正规就业与教育回报的非线性关系”这一争论提供了跨国可比证据,使研究者得以检验受教育程度提升是否必然引致非正规就业比例下降,抑或存在结构性门槛效应。同时,数据对性别维度的细致区分,为探究劳动力市场性别分割理论在非正规经济领域的适用性提供了关键支撑。城乡地域分类则助力于检验空间错配假说,即城市化进程是否通过改变地域机会结构而重塑非正规就业的构成。这些问题的澄清对于完善劳动力市场分层理论具有显著的理论意义。
衍生相关工作
基于该数据集,学界已衍生出若干具有影响力的经典研究。其中,比较政治经济学领域的学者利用其构建了欧洲非正规就业的制度决定因素模型,将劳动市场规制强度、福利国家类型等宏观变量纳入解释框架。亦有研究聚焦于后社会主义转型国家,以该数据为依托分析市场化改革对非正规部门膨胀的短期与长期效应。在方法论层面,部分工作将其作为基准数据,开发了处理国际劳工统计中缺失值与测量误差的插补技术。这些衍生研究不仅拓展了非正规经济学的理论边界,也为后续跨国比较研究树立了数据规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务