遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-ins-geo-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲非正规经济就业比例的数据,具体指标为“按性别、公共/私营部门以及城乡划分的非正规部门就业比例”。数据集涵盖3个欧洲国家(MDA、BIH、SRB),时间范围为2003年至2025年,共1,008个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤处理,以表格形式提供,包括国家代码、指标、性别分类、时间、观测值等列。数据集主要用于表格分类、回归和时间序列预测等任务,适用于劳动经济学研究。

This dataset contains data on the share of employment outside the formal sector in Europe, specifically the indicator Share of employment outside the formal sector by sex, public/private sector and rural/urban areas. It covers 3 European countries (MDA, BIH, SRB) from 2003 to 2025, with 1,008 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for Europe, presented in tabular format with columns such as country code, indicator, sex classification, time, and observed value. The dataset is intended for tasks like tabular classification, regression, and time-series forecasting, supporting labor economics research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-ins-geo-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
在国际劳工组织体面劳动统计框架下,非正规部门就业比重是监测劳动力市场结构的重要指标。该数据集由Electric Sheep Europe团队借助ILOSTAT REST API,以指标EMP_PIFL_SEX_INS_GEO_RT为锚点,系统抓取并筛选欧洲ISO3国家代码,最终凝聚为涵盖摩尔多瓦、波黑与塞尔维亚的观察记录。原始微观调查数据经国际劳工统计学家会议定义统一协调,来源标注于source.label字段以实现可追溯性,进而封装为便于机器学习调用的Parquet格式。
特点
数据集以千余条年度观测值勾勒出2003至2025年间欧洲三国非正规就业的演化轨迹,囊括性别、公私部门与城乡地域的多维分类。每条记录均携带指标代码、分类标签、观察状态及来源注释,为洞察非正规经济提供细粒度支撑。覆盖范围虽聚焦欧洲局部,却完整保留了原始协调逻辑与质量标记,兼具时序预测与分类回归的适用潜力。
使用方法
研究者可通过HuggingFace的datasets库便捷加载数据,调用load_dataset函数获取训练集并转换为Pandas数据框。依据ref_area字段可筛选特定国家,利用indicator与time列可绘制单指标时序曲线;借助pivot_table方法能重塑为年份×国家矩阵,便于跨国比较。观察值obs_value可作为回归或分类任务的目标变量,标注字段则辅助数据清洗与不确定性分析。
背景与挑战
背景概述
非正规经济就业的测度是发展经济学与劳动经济学长期关注的核心议题,其数据基础直接关系到体面劳动议程的监测与政策评估。国际劳工组织(ILO)依托其统计部门,通过整合各国劳动力调查、住户收入调查及行政记录,构建了ILOSTAT这一全球劳动统计的权威数据库,并以国际劳工统计学家会议(ICLS)定义对微观数据进行标准化调和。在此框架下,Electric Sheep Europe于2025年将欧洲地区非正规部门就业占比指标重新封装发布,覆盖摩尔多瓦、波黑与塞尔维亚三国2003至2025年间的1008条观测,按性别、公共/私营部门及城乡维度细分。该数据集为转型经济体非正规就业的长期比较研究提供了稀缺的标准化面板资源。
当前挑战
非正规就业统计面临概念界定与测量口径不统一的结构性难题,各国对非正规部门与非正规就业的操作化定义差异显著,直接威胁跨国可比性。数据构建过程中,样本仅涵盖三个欧洲国家且部分年份存在序列断点,观测值的可靠性受到调查方法修订与来源更替的影响;性别、机构部门与城乡等多重分类维度导致单元格稀疏,部分细分组合缺失或基于小样本推断。此外,非正规就业本身具有高度异质性与季节性波动,单一指标难以充分刻画其动态特征,对时间序列建模与分类任务构成实质性挑战。
常用场景
经典使用场景
在非正规经济与劳动力市场结构转型的研究领域中,刻画正规部门之外就业份额的演变轨迹始终是核心议题。该数据集汇聚了摩尔多瓦、波斯尼亚和黑塞哥维那、塞尔维亚三个欧洲国家自2003年至2025年间共计1008条观测记录,以性别、公共或私营部门以及城乡地域为多维分类变量,系统呈现了非正规部门就业占比的年度变化。研究者可依托该数据集开展时间序列建模、面板回归与跨国比较分析,揭示不同性别与地域群体在非正规就业中的异质性分布,进而为劳动力市场分层理论的实证检验提供精细化数据支撑。
解决学术问题
非正规就业的测度长期受制于定义分歧与数据碎片化,比较研究难以在统一框架下展开。该数据集依托国际劳工组织统计数据库,采用国际劳工统计学家会议所确立的标准定义,对各国劳动力调查微观数据进行调和处理,有效缓解了跨国可比性不足的困境。其性别与城乡维度的细分使研究者能够检验非正规就业中的性别鸿沟与城乡二元结构,回应了发展经济学中关于非正规部门异质性与脆弱性的学术争论。数据中附带的来源标签与观测状态标记进一步提升了分析的可追溯性与稳健性,为劳动经济学与经济社会学的交叉研究提供了可靠的经验基础。
衍生相关工作
基于该数据集,研究者已衍生出一系列与劳动力市场非正规化相关的经典工作。比较政治经济学领域涌现出关于后社会主义转型国家非正规经济扩张机制的国别研究,劳动经济学方向则产生了关于性别就业差距与城乡劳动力迁移的实证论文。部分研究将该数据与世界银行发展指标或欧洲社会调查相结合,构建多源面板以检验制度质量对非正规就业的影响。在方法论层面,该数据集亦被用于时间序列预测模型的基准测试,推动了小样本跨国面板插补与趋势估计方法的发展,为后续非正规经济数据库的建设提供了可复用的模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务