遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲37个国家在1987年至2025年期间的员工数据,具体指标为“按性别和城乡区域划分的员工数量(以千计)”。数据集共有7,825条观测记录,涵盖1个核心指标(EES_TEES_SEX_GEO_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过筛选,以确保仅包含欧洲国家。数据集提供了详细的元数据,包括国家代码、数据来源、性别分类、年份、观测值及其状态等。数据以年度频率发布,并包含数据质量说明,例如使用ILO选择的“最佳来源”处理重复数据。该数据集适用于表格分类、回归和时间序列预测等任务,可用于分析欧洲劳动力市场的性别和城乡分布趋势。

This dataset contains 7,825 observations of employees data across 37 Europe countries, spanning 1987–2025, covering 1 distinct indicator: Employees by sex and rural/urban areas (thousands). The data is sourced from ILOSTAT, the ILOs central statistics database, and is filtered to European countries via API. It includes detailed metadata such as country codes, data sources, sex disaggregation, years, observed values, and status flags. The data is annual, with quality notes on source selection and disaggregation dimensions. It is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of labor market trends by gender and rural/urban areas in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-geo-nb-employees-by-sex-and-rural-urban-areas-thousands 数据集图片
构建方式
在国际劳工统计领域,跨国可比劳动力市场数据的匮乏长期制约着区域就业结构研究。该数据集由Electric Sheep Europe从ILOSTAT官方REST API直接拉取原始指标数据,经筛选欧洲ISO3国家代码后重新打包为机器学习就绪的Parquet格式。底层数据源自各国劳动力调查、家庭收入调查及行政记录,由国际劳工组织统计局依据国际劳工统计学家会议定义进行统一协调,并在source.label列中标注每个观测的原始来源以实现可追溯性。这种从权威统计数据库到标准化数据集的转换路径,既保留了官方统计的严谨性,又提升了数据获取与复用的效率。
特点
该数据集收录了1987至2025年间37个欧洲国家共7825条员工就业观测记录,以千人为计量单位,并按性别与城乡地域进行细分。唯一指标EES_TEES_SEX_GEO_NB提供了SEX_T、SEX_M与SEX_F三种性别维度的分解,classif1字段则编码了国家层面与城乡区域类型的地理覆盖分类。数据以年度频率发布,schema完整记录了源标签、指标标签、观测状态标志及方法修订注释等元信息。覆盖国家包括希腊、丹麦、西班牙、德国、法国等,时间跨度与地理广度在欧洲就业统计中具有显著优势。
使用方法
研究者可通过HuggingFace datasets库调用load_dataset函数直接加载该数据集,并借助to_pandas方法转换为数据框进行后续分析。典型工作流包括按ref_area列筛选单一国家子集、针对特定指标构建时间序列图以观察就业趋势演变,或利用pivot_table将数据重塑为国家与年份的交叉矩阵以便横向比较。该数据集适用于表格分类、回归及时间序列预测等任务,亦可服务于劳动经济学、区域发展研究与性别就业差距等社会科学议题的实证分析。
背景与挑战
背景概述
全球劳动力市场监测长期依赖国际劳工组织(ILO)的统计体系,其ILOSTAT数据库自二十世纪后期整合各国劳动力调查与住户调查,成为衡量就业结构变迁的权威基准。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API抽取并重新打包,以CC-BY-4.0协议发布,涵盖1987至2025年间37个欧洲国家7,825条观测,按性别及城乡地域细分雇员人数。其核心研究问题在于揭示欧洲就业性别结构与空间分布的长期演化,为劳动经济学、区域发展与性别平等政策提供微观证据,并推动跨国可比数据的机器学习应用。
当前挑战
从领域问题看,厘清性别与城乡双重维度下雇员规模的动态变化,面临各国统计口径不一、城乡定义差异以及时序断裂等难题,尤其东欧转型经济体数据系统性缺失,削弱了面板分析的完整性。在构建层面,异构来源的劳动力调查与住户调查数据需依国际劳工统计学家会议定义进行调和,而“最佳来源”筛选机制虽提升一致性,却可能掩盖方法学变更;此外,部分年份仅提供总量或单一性别数据,造成分类维度大量空值,对建模的插补与不确定性量化构成显著障碍。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集构成了剖析欧洲就业性别结构与城乡空间分异的经典基础。其最典型的使用场景在于:研究者以1987至2025年间三十七国的雇员规模为纵向观测锚点,通过性别与城乡维度的交叉分层,绘制欧洲劳动力市场演变的时空图谱。无论是刻画女性雇员在乡村地区的增长轨迹,还是比较城市与乡村男性就业的波动弹性,该数据集均提供了统一口径的跨国可比序列,成为探索性别就业差距与城乡二元结构互动关系的基准素材。
解决学术问题
该数据集直面劳动统计比较研究中的核心难题:跨国就业指标在定义、覆盖范围与调查方法上的异质性,长期制约着可靠的横截面与时间序列分析。经由国际劳工组织基于国际劳工统计学家会议标准的系统化协调,并以来源标签保留原始调查的可追溯性,该数据集有效缓解了因统计口径断裂而产生的测量偏误,为检验城乡就业结构收敛假说、评估性别平等政策成效以及识别经济周期中的差异化就业响应等议题,提供了稳健的经验支撑,其意义在于将碎片化的国别统计转化为可累积的学术知识资产。
衍生相关工作
以该数据集为经验基座,衍生出一系列颇具影响力的后续研究。比较政治经济学文献利用其面板结构检验家庭政策与女性劳动供给之间的因果关联,城镇化研究则借其刻画城乡就业结构的长期变迁与收敛趋势。若干跨国就业预测模型将该数据作为训练与验证语料,推动了劳动统计领域机器学习方法的运用。此外,围绕国际劳工组织统计标准与国别调查差异的方法论讨论,亦频繁引用此数据集作为协调实践与残余偏差的典型案例,持续激发着劳动统计基础设施的批判性反思与改进努力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务