遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-geo-dsb-nb-employees-by-sex-rural-urban-areas-and-disability

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲30个国家按性别、城乡地区和残疾状况划分的雇员数量统计数据(以千计),时间跨度为2002年至2025年,共14,698条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖唯一的指标EES_TEES_SEX_GEO_DSB_NB,提供按性别(总计、男性、女性)细分的年度数据。数据集包含国家代码、国家名称、数据来源、指标代码、分类变量、观测年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 14,698 observations of employees data across 30 Europe countries, spanning 2002–2025, covering the indicator EES_TEES_SEX_GEO_DSB_NB (Employees by sex, rural / urban areas and disability status in thousands). The data is sourced from ILOSTAT, the ILOs central statistics database, and includes disaggregation by sex (total, male, female) with annual frequency. The dataset features columns such as country code, country name, source, indicator code, classification variables, time, observed value, and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-geo-dsb-nb-employees-by-sex-rural-urban-areas-and-disability 数据集图片
构建方式
该数据集以国际劳工组织(ILO)的核心统计数据库ILOSTAT为权威数据源,通过其REST API接口直接拉取指标EES_TEES_SEX_GEO_DSB_NB的原始记录,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲区域样本。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调与标准化处理,每条记录均在source.label字段中标注来源以保障可追溯性。最终由Electric Sheep Europe完成模式归一化并以Parquet格式重新封装发布,形成覆盖30个欧洲国家、时间跨度为2002至2025年的14698条观测。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数直接加载该数据集并转化为Pandas DataFrame进行后续分析。典型操作包括按ref_area列筛选特定国家子集,依据indicator与time列排序后绘制单指标时间序列曲线,或利用pivot_table方法将数据重塑为国家×年份矩阵以支持跨国比较与面板回归。数据集适用于表格分类、表格回归及时间序列预测等任务,使用时应结合obs_status及note字段审慎处理不可靠或非标准定义记录,并遵循CC-BY-4.0许可协议同时引用ILO原始来源与Electric Sheep Europe的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与可比性建设,ILOSTAT作为其核心统计数据库,汇聚了二百余个经济体的劳动力调查与行政记录数据。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API抽取并重新封装,覆盖30个欧洲国家、2002至2025年间14,698条观测,聚焦按性别、城乡地域及残疾状况细分的雇员人数。其核心研究问题在于揭示劳动力市场中弱势群体(女性、农村居民、残障人士)的就业参与差异,为欧洲就业平等政策与包容性增长研究提供量化基础,亦为时间序列预测与表格分类等多类机器学习任务提供了结构化基准。
当前挑战
该数据集所面对的领域问题在于,劳动力市场中的性别、城乡与残疾状况交叉维度统计长期存在定义不一致与报告缺失,难以支撑跨国可比分析。构建过程中,残疾定义的非标准化、调查方法修订导致的序列断裂、部分国家数据被标记为不可靠或临时性,以及城乡分类口径的国别差异,均对数据完整性与一致性构成挑战。此外,多源数据经ILO择优合并后,仍需借助来源标签与注释字段追溯口径差异,增加了建模时的预处理复杂度。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域,针对残疾群体就业状况的量化分析长期受制于数据碎片化问题。该数据集以性别、城乡地域及残疾状态三重维度为轴心,覆盖30个欧洲国家逾二十年的雇员规模观测值,其最经典的使用场景在于构建多维度面板数据模型,用以刻画残疾雇员在劳动力市场中的分布结构与动态演变。研究者可借助其分层标识,灵活实现跨国比较、性别差异测算以及城乡异质性检验,从而在宏观层面揭示包容性就业政策的实施成效。
解决学术问题
该数据集有效回应了残疾与就业研究中长期存在的可比性难题。过往学术探讨多囿于单一国家或横截面数据,难以剥离地域与性别交织的结构性效应。此数据集依托国际劳工组织的标准化协调框架,将不同来源的劳动力调查与家庭调查数据纳入统一分类体系,使得研究者能够控制数据来源差异,聚焦于残疾状态对雇员数量的边际影响。其意义在于为检验反歧视立法、社会保障覆盖与就业参与率之间的因果链条提供了可靠的经验基础,推动了比较劳动政策研究的实证转向。
实际应用
在政策制定与项目评估的实务场域,该数据集为政府机构、国际组织及社会企业提供了精准的决策参照。劳动部门可依据城乡与性别分项数据,识别残疾雇员在特定区域的集聚特征与供给缺口,进而优化职业康复资源配置与无障碍就业补贴的投放方向。非政府组织亦可借助时序趋势,监测公约履约进展并倡导针对性干预措施。此外,数据集的表格化结构适配机器学习流程,可支撑残疾就业预测模型的训练与验证,为动态调配就业服务提供数据驱动型工具。
数据集最近研究
最新研究方向
在全球劳动市场日益关注包容性与公平性的背景下,性别、城乡差异与残疾状况的交织影响正成为劳动经济学的前沿议题。该数据集依托ILOSTAT权威框架,覆盖30个欧洲国家2002至2025年的雇员数据,为解析残疾人士在城乡与性别维度上的就业分化提供了独特面板基础。当前研究趋势聚焦于运用时间序列预测与因果推断方法,评估欧盟残疾人就业战略等政策的实效,并借助可解释机器学习揭示结构性壁垒。其意义在于推动精准社会政策制定,助力实现联合国可持续发展目标中的体面工作与减少不平等,为构建无障碍劳动力市场提供实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务