遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-eco-ins-nb-employment-outside-the-formal-sector-by-sex-econom

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲4个国家(摩尔多瓦、波黑、北马其顿、塞尔维亚)从2003年至2025年的非正规经济部门就业数据,共9,938个观测值。核心指标为按性别、经济活动和公共/私营部门划分的非正规经济部门就业人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过欧洲国家代码筛选。数据集提供了详细的字段,包括国家代码、数据来源、指标代码、性别分类(总计、男性、女性)、经济活动和机构部门分类、观测年份、观测值等。数据为年度频率,当同一国家×年份有多个数据源时,使用ILO选择的最佳来源。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset contains 9,938 observations of informal economy employment data across 4 European countries (Moldova, Bosnia and Herzegovina, North Macedonia, Serbia), spanning from 2003 to 2025. The core indicator is Employment outside the formal sector by sex, economic activity and public/private sector (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to European country codes. The dataset provides detailed fields including country code, data source, indicator code, sex disaggregation (total, male, female), economic activity and institutional sector classifications, observation year, observed value, etc. The data is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. This dataset is suitable for tasks such as tabular classification, regression, and time-series forecasting, aiming to provide a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-eco-ins-nb-employment-outside-the-formal-sector-by-sex-econom 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,由Electric Sheep Europe进行标准化重封装。原始数据通过ILOSTAT REST API接口直接提取,并依据欧洲ISO3国家代码进行筛选,覆盖摩尔多瓦、波黑、北马其顿和塞尔维亚四国。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行统一协调,数据来源在source.label列中予以标注,确保可追溯性。最终以Parquet格式发布,便于机器学习工作流直接加载使用。
特点
数据集涵盖2003至2025年间9938条观测记录,聚焦非正规部门就业指标,按性别、经济活动及公共/私营部门维度进行细分。数据以年度频率呈现,包含国家代码、数据来源、指标代码、性别分类、经济活动分类、机构部门分类及观测值等字段,并附有观测状态与注释信息以标识数据质量。该数据集为单语言英语表格型数据,适用于分类、回归及时间序列预测任务,其分层结构支持多维度的劳动力市场分析。
使用方法
研究者可通过HuggingFace的datasets库调用load_dataset函数加载数据,并转换为Pandas数据框进行后续处理。典型操作包括按国家代码筛选特定国家数据、提取单一指标构建时间序列、或透视生成国家与年份的矩阵以进行跨国比较分析。数据既可用于描述性统计,也可作为机器学习模型的输入特征,用于预测非正规就业趋势或分析性别与经济部门的交互效应。使用时需遵循CC-BY-4.0许可,并同时引用ILO原始来源与Electric Sheep Europe的重封装工作。
背景与挑战
背景概述
非正规经济就业的测度长期构成劳动统计领域的核心议题,其数据质量直接关涉体面劳动议程的监测与实现。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)确立的定义框架,经由ILOSTAT数据库系统性地汇编各国劳动力调查与住户收入调查等微观数据,为全球非正规就业的跨国比较提供了权威基准。本数据集由Electric Sheep Europe于2026年从ILOSTAT REST API抽取并重新封装,覆盖摩尔多瓦、波黑、北马其顿与塞尔维亚四国,时间跨度自2003年至2025年,共9,938条观测,以性别、经济活动部门及公私部门属性为分类维度,刻画了正规部门之外就业规模的年度演变。该数据集为转型经济体非正规就业的长期趋势分析、性别差异研究及非正规经济与制度环境关联的实证探索,提供了结构规整且可直接调用的面板数据基础。
当前挑战
非正规就业的统计界定与度量本身即构成一项持久的学术难题。ILO所采纳的ICLS定义虽为跨国比较确立了共同基准,但各国劳动力调查在问题设计、抽样框与执行方式上的异质性,使得数据在跨国可比性上始终面临固有张力,观察值状态列中标注的“不可靠”或“序列中断”等旗帜正是这种测量不确定性的直接映射。就数据构建而言,Electric Sheep Europe的抽取流程需处理源头API中分类变量非均衡发布的问题——当某些指标未发布性别或部门细分时,分类列便会呈现空值,这为下游建模中的数据对齐与缺失机制识别带来了挑战。此外,数据集覆盖范围局限于四个西巴尔干及东欧国家,样本的地理代表性有限,难以支撑泛欧层面的推断。时间维度上,各国起始年份不一且部分国家存在序列中断,构建连续且可比的时间序列分析需对断点进行审慎处理,这构成了该数据集在因果推断与趋势预测任务中的核心制约。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集堪称刻画欧洲非正规就业性别差异的经典面板数据资源。其最典型的运用场景在于,研究者以年度时间序列为轴,按性别、经济活动部门和公私机构属性对非正规部门外就业规模进行多维分解,从而构建跨国比较分析框架。具体而言,可借助该数据考察摩尔多瓦、波黑、北马其顿与塞尔维亚四国在2003至2025年间非正规就业的性别结构变迁,识别女性在私营非正规部门中的集中趋势,以及公共部门正规化改革对不同性别劳动者的差异化吸纳效应。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的研究。部分学者将其与世界银行企业调查数据匹配,探讨非正规就业与企业生产率的关系;亦有研究结合欧洲社会调查微观数据,检验非正规就业对主观幸福感的长期影响。在方法层面,该数据集被用于训练时间序列预测模型,以评估转型经济体的非正规就业收敛趋势。Electric Sheep Europe将其标准化为Parquet格式并发布HuggingFace数据集卡片,进一步降低了机器学习研究者进入劳动统计领域的门槛,催生了若干面向政策模拟的表格数据建模工作。
数据集最近研究
最新研究方向
在全球非正规经济监测与体面劳动议程深化的背景下,该数据集凭借其按性别、经济活动部门及公私机构维度系统记录的欧洲四国非正规部门就业时序数据,为前沿研究提供了独特支撑。当前研究热点聚焦于非正规就业的性别差异如何随经济周期与结构性转型动态演变,以及公私部门在吸纳非正规劳动力方面的异质性角色。借助2003至2025年的连续观测,学者得以运用面板因果推断与时序预测模型,评估劳动市场规制改革对非正规就业规模的非对称冲击,并揭示性别包容性增长政策的实效。该数据集亦为追踪联合国可持续发展目标中体面劳动指标的进展、检验非正规经济与正式部门间的溢出效应提供了关键实证基础,对推动欧洲乃至全球劳动治理的数据驱动决策具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务