遇见数据集

electricsheepeurope/europe-ilo-cld-xchl-sex-age-ste-nb-children-in-child-labour-by-sex-age-and-status-in

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于欧洲童工的表格数据集,包含1,134条观测数据,覆盖15个欧洲国家(如罗马尼亚、奥地利、瑞士等),时间跨度为1995年至2025年。数据集聚焦于一个核心指标:CLD_XCHL_SEX_AGE_STE_NB,即按性别、年龄和就业状况划分的童工数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤到欧洲地区,经过标准化处理。数据集包含多列信息,如国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄分组、就业状况分类、观测年份、观测值(童工数量,单位为千)、数据状态标志以及相关注释。数据以年度频率发布,部分观测可能带有临时或不可靠状态标签。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲童工问题提供机器学习就绪的数据支持。

This dataset is a tabular dataset on child labour in Europe, containing 1,134 observations across 15 European countries (e.g., Romania, Austria, Switzerland), spanning the years 1995 to 2025. It focuses on a core indicator: CLD_XCHL_SEX_AGE_STE_NB, which represents the number of children in child labour (in thousands) disaggregated by sex, age, and status in employment. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, extracted via API and filtered to European regions, with standardized processing. The dataset includes multiple columns such as country code, country name, data source, indicator code, sex classification (total, male, female), age group, employment status classification, observation year, observed value (child labour count in thousands), observation status flags, and relevant notes. Data is published at annual frequency, with some observations potentially labeled as provisional or unreliable. This dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, aiming to provide machine learning-ready data for researching child labour issues in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-cld-xchl-sex-age-ste-nb-children-in-child-labour-by-sex-age-and-status-in 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库构建,通过REST API直接抽取核心指标CLD_XCHL_SEX_AGE_STE_NB的原始数据,并依据欧洲ISO3国家代码进行地域筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收支调查等微观数据进行标准化处理,确保跨国可比性。数据由Electric Sheep Europe重新打包为Parquet格式,便于机器学习场景直接使用。
特点
数据集涵盖1995至2025年间15个欧洲国家的1134条观测记录,聚焦童工劳动状况,提供按性别、年龄段及就业身份细分的数量指标(单位:千人)。数据包含丰富的分类维度,如性别(总计、男性、女性)与就业身份(ICSE-93标准),并附有来源标识、观测状态标记及注释字段,用于评估数据质量与连续性。其时间跨度长、覆盖国家多元,为欧洲童工劳动研究提供了珍贵的时间序列素材。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,返回的pandas DataFrame可直接用于分析与建模。示例中,支持按国家(如ref_area=='DEU')筛选特定子集,或针对单一指标按年份排序绘制时间序列图。借助pivot_table,可将数据重塑为国家×年份的矩阵形式,便于进行跨国家面板分析或回归模型构建。整体设计遵循ML-Ready理念,显著降低了数据预处理的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司基于ILOSTAT数据库创建,经Electric Sheep Europe于2025年重新打包并发布于HuggingFace平台,聚焦欧洲15个国家1995至2025年间童工问题的量化分析。核心指标“按性别、年龄和就业身份统计的童工人数(千)”旨在揭示童工现象在性别、年龄阶段及就业形态上的分布规律,为劳动经济学、社会政策及可持续发展目标(SDG)中体面劳动指标的监测提供标准化数据支撑。作为ILO全球劳动统计体系的重要组成部分,该数据集通过统一方法论整合国家调查数据,填补了欧洲区域童工纵向比较研究的空白,对评估政策干预效果、识别高危群体具有不可替代的实证价值。
当前挑战
童工数据收集面临多重挑战:首先,法律界定与文化差异导致国际可比性受损,ILO需依据国际劳动统计学家会议(ICLS)标准对各国调查口径进行复杂协调;其次,数据来源涉及劳动力调查、家庭收支调查等多种渠道,抽样误差和覆盖偏差难以完全消除,部分观测值标注为不可靠(obs_status=U)便体现了质量控制的困境。构建过程中,API接口数据存在分类维度缺失(如classif1/classif2字段常为空),且时间序列不连续性(如方法修订导致的断裂)需通过注释字段回溯判断;此外,样本量分布极不均衡,罗马尼亚贡献263条记录而意大利仅5条,模型的统计效力易受稀疏区域主导。
常用场景
经典使用场景
该数据集收录了1995年至2025年间欧洲15个国家关于童工现象的1,134条观测记录,涵盖性别、年龄及就业身份等细分维度。研究者可将其用于构建时间序列模型,追踪欧洲各国童工人数的演变轨迹;亦可基于分类或回归任务,探究社会经济因素与童工发生率之间的关联机制。数据集的标准化架构(包含ISO国家代码、ILO指标编码及详细数据来源标签)使其天然适配于多国面板数据分析与跨区域比较研究,为劳动经济学领域的实证分析提供了坚实的数据基础。
衍生相关工作
围绕该数据集,已衍生出多项具有学术影响力的工作。一方面,研究者基于ILOSTAT的童工指标开发了新的面板计量方法,用于分离经济发展、教育普及与法律执行对童工率的异质性影响。另一方面,该数据与ILO其他就业、工资及社会保障指标联用,催生了关于童工问题代际传递与贫困陷阱的综合分析框架。此外,数据集的标准化处理流程也启发了‘Electric Sheep Europe’等团队构建更大规模的欧洲社会统计数据集,推动了机器学习方法在劳动统计领域的规范化应用。
数据集最近研究
最新研究方向
在全球致力于消除童工现象的时代背景下,该数据集为欧洲地区童工问题的量化研究提供了核心支撑。前沿方向聚焦于利用该纵向数据(1995-2025年,覆盖15国)开展时空动态分析与因果推断,探究社会经济政策变迁、劳动力市场结构转型及教育普及对童工现象的长期影响。特别是结合ILO国际劳工统计学家会议定义的标准化指标,研究者可深入剖析性别、年龄与就业身份(如无偿家庭劳动力)在童工群体中的交互作用,评估《联合国可持续发展目标》(SDG 8.7)在欧盟及东欧国家的实施进展。该数据集作为ILOSTAT官方统计的集成切片,其权威性与面板结构为构建童工脆弱性预警模型及政策反事实模拟提供了不可替代的经验基础,对推动全球劳工权益保障具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务