遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-eco-nb-employment-outside-the-formal-sector-by-sex-and-ec

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含33,056个观测值,覆盖34个欧洲国家,时间跨度为2003年至2025年,专注于一个指标:按性别和经济活动划分的正式部门外就业人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到欧洲国家,采用CC-BY-4.0许可证。数据集以表格形式组织,包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、经济分类、年份、观测值、观测状态等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的标准化处理,确保与国际劳工统计会议定义一致,并标注了数据来源和质量标志。

This dataset contains 33,056 observations of informal economy data across 34 Europe countries, spanning 2003–2025, covering 1 distinct indicator: Employment outside the formal sector by sex and economic activity (thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to European countries, and licensed under CC-BY-4.0. The data is structured in tabular format with columns including country code, country name, data source, indicator code, indicator name, sex disaggregation, economic classification, year, observed value, observation status, etc., suitable for tasks such as tabular classification, regression, and time-series forecasting. The data is harmonized by ILO using International Conference of Labour Statisticians definitions, with source flags and quality caveats for traceability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-eco-nb-employment-outside-the-formal-sector-by-sex-and-ec 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API接口直接提取指标EMP_PIFL_SEX_ECO_NB的原始数据,并依据ISO3国家代码筛选出欧洲地区记录。ILOSTAT对各国劳动力调查、家庭收入调查等微观数据进行统一协调,严格遵循国际劳工统计学家会议(ICLS)的定义标准,确保非正规经济部门就业统计的跨国可比性。Electric Sheep Europe在此基础上进行规范化封装,保留来源标签和注释字段,以Parquet格式发布,形成结构化的即用型数据资源。
特点
数据集涵盖2003年至2025年间34个欧洲国家的33,056条观测记录,聚焦于非正规部门就业的性别与经济 activity 细分。其核心特征在于多维度 disaggregation,包括性别(总计、男性、女性)和经济活动分类,同时提供详尽的来源标识、观测状态标记及注释信息,增强了数据溯源的透明度。时间跨度长、地理覆盖广,且以年度频率呈现,为分析欧洲非正规就业的长期趋势与性别差异提供了丰富的面板数据基础。
使用方法
研究人员可通过HuggingFace的datasets库以一行代码加载数据集,并转换为Pandas DataFrame进行灵活操作。典型用法包括按国家代码筛选特定国家的时序数据,或针对单一指标绘制时间序列图以观察演变趋势。此外,可利用透视表功能将数据重塑为国家与年份的矩阵形式,便于开展跨国比较或面板回归分析。该数据集亦适用于表格分类、回归及时间序列预测等机器学习任务,为劳动经济学与政策评估提供直接可用的数据支撑。
背景与挑战
背景概述
非正规部门就业长期是发展经济学与劳动经济学的核心议题,其规模与结构直接关系到社会保障覆盖、税收基础及体面劳动的实现程度。国际劳工组织(ILO)依托各国劳动力调查与住户收入调查等微观数据,构建了ILOSTAT这一全球权威劳动统计数据库,并以国际劳工统计学家会议(ICLS)定义对原始数据进行跨国标准化。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API采集并重新打包,覆盖欧洲34国、2003至2025年间33,056条按性别与经济部门分列的非正规部门就业观测,为跨国比较与时序分析提供了标准化、可直接调用的数据基础。
当前挑战
该数据集所回应的领域问题,在于非正规就业的界定标准与统计口径跨国差异显著,各国调查方法、抽样框架与分类体系的不一致使直接比较面临效度威胁。构建过程中,原始调查数据的频率不一致、部分国家年份缺失、边缘经济部门样本稀疏等问题增加了数据整合难度。观测状态标志所提示的不可靠估计与序列断裂,进一步要求使用者在建模前进行严格的数据质量甄别。此外,经济部门分类的粒度差异与性别维度的非全覆盖,也构成对分类与回归任务的现实挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集凭借其覆盖三十四国、逾二十年且按性别与经济部门分列的细致观测,成为刻画欧洲非正规就业规模演变的核心面板数据源。经典用法在于构建国别—年度二维矩阵,借助时间序列分解或面板回归,评估非正规就业在总就业中的占比趋势及其性别差异,亦可按经济部门细分,揭示农业、工业与服务部门非正规性的结构性异同。
解决学术问题
该数据集有效回应了非正规就业测量中跨国可比性与时序连续性的双重难题。依托国际劳工组织统一协调的ICLS定义与来源标注,研究者得以规避各国统计口径差异所引致的偏误,进而检验非正规就业与经济增长、劳动力市场规制、性别不平等之间的因果关联。其意义在于为比较政治经济学与劳动社会学提供了可重复、可追溯的量化基础,推动了非正规经济从边缘议题向主流学术议程的跃迁。
衍生相关工作
围绕该数据集,学界涌现出一系列经典衍生研究。部分工作将其与ILO工资、工时及社会保护指标链接,构建非正规就业的多维脆弱性指数;另有研究将其同世界银行发展指标或OECD就业保护立法数据库匹配,探究制度变量对非正规性的调节效应。在方法层面,该数据亦被用于训练面板预测模型与缺失值插补算法,催生了若干面向劳动统计的机器学习基准任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务