遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ocu-est-nb-employment-outside-the-formal-sector-by-sex-occupa

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含29,109个观测值,涉及亚洲24个国家的非正规经济数据,时间跨度为2000年至2025年,涵盖1个具体指标:按性别、职业和机构规模划分的非正规部门就业(千人)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取,并过滤为亚洲国家代码。ILOSTAT使用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,确保数据可比性。数据集包括多个列,如国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、机构规模分类、观测年份、观测值、观测状态等,并提供了数据质量说明和使用示例。该数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains 29,109 observations of informal economy data across 24 Asia countries, spanning 2000 to 2025, covering 1 distinct indicator: Employment outside the formal sector by sex, occupation and establishment size (thousands). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, pulled directly from its REST API and filtered to Asia ISO3 country codes. ILOSTAT harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions for comparability. The dataset includes columns such as country code, country name, data source, indicator code, sex disaggregation, occupation classification, establishment size classification, observation year, observed value, observation status, and more, with notes on data quality and usage examples. It is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia on HuggingFace.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ocu-est-nb-employment-outside-the-formal-sector-by-sex-occupa 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)所维护的ILOSTAT中央统计数据库,经由Electric Sheep Asia团队通过ILOSTAT REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_PIFL_SEX_OCU_EST_NB)直接抽取原始记录,并筛选亚洲ISO3国家代码后重新封装为面向机器学习应用的Parquet格式。源数据由ILO统计局依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化调和,每条记录均标注来源标签以实现可追溯性。
特点
数据集涵盖2000至2025年间24个亚洲国家共计29,109条观测记录,聚焦非正规部门就业规模(以千人为单位),并按性别、职业及机构规模三个维度进行交叉 disaggregation。字段结构完整,包含国家代码、来源标识、指标编码、性别分类(总计/男性/女性)、职业技能层级、机构规模聚合等元数据,同时提供观测状态标记与系列中断说明,便于研究者识别数据质量差异。时间跨度长、国别覆盖广,适用于非正规经济领域的比较分析与趋势建模。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数直接加载该数据集,并利用to_pandas()方法转换为数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家(如df[df["ref_area"] == "IDN"]),按indicator字段提取单指标时序数据并以time列排序后绘制趋势图,或通过pivot_table方法将数据重塑为国家×年份矩阵以支持面板数据分析。该数据集适用于表格分类、回归及时间序列预测等任务,使用时应遵循CC-BY-4.0许可协议并同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
非正规经济就业的测度长期构成劳动统计领域的核心议题,其数据质量直接关系到体面劳动议程的监测与推进。国际劳工组织依托国际劳工统计学家会议确立的定义框架,汇聚各国劳动力调查与家庭收入调查等微观数据,构建了覆盖二百余个经济体的ILOSTAT统计数据库。本数据集由Electric Sheep Asia于2025年重新封装发布,源自ILO官方API,聚焦亚洲二十四国2000至2025年间非正规部门外就业的性别、职业与机构规模分布,共计两万九千余条观测,为亚洲劳动市场结构转型研究提供了跨国可比的微观基础,亦为非正规就业的时空演变分析确立了权威参照。
当前挑战
该数据集所回应的领域难题在于非正规就业界定标准的跨国异质性与历时变动性,各国调查口径、抽样设计与统计能力的差异导致指标可比性受限,观测值中普遍存在的序列断点与可靠性标记进一步加剧了建模难度。构建层面的挑战则体现为多层分类维度的稀疏交织,性别、职业与机构规模的交叉细分在部分国家年份形成大量缺失单元,加之各国数据发布周期参差、年份覆盖不齐,为面板分析与预测任务的样本平衡与偏差校正带来了显著困难。
常用场景
经典使用场景
在非正规经济与劳动经济学研究领域,该数据集最经典的使用场景在于刻画亚洲地区非正规部门就业的性别与职业结构差异。研究者依托其涵盖二十四国、两万余条观测的时序面板,可按性别、职业与机构规模等维度进行交叉分析,进而绘制非正规就业的时间演变轨迹。此类场景通常涉及国家间比较与长期趋势拟合,为理解非正规经济规模变动提供基础性数据支撑。
实际应用
在实际应用层面,该数据集为国际组织与各国劳动部门监测非正规就业状况提供量化依据。政策分析者可借助其识别女性或低技能群体在非正规部门中的集中程度,从而设计针对性的社会保障扩面与劳动权益保护措施。此外,发展机构亦可利用其时序特征评估非正规经济干预政策的实施效果,为包容性增长与体面劳动目标的推进提供实证参考。
衍生相关工作
围绕该数据集,后续研究衍生出多类经典工作。其一为跨国非正规就业决定因素的面板回归分析,探讨教育、性别与产业结构的影响;其二为时间序列预测模型,用于估计非正规就业的未来走势;其三为与ILOSTAT其他指标整合的复合数据集构建,支撑多维劳动脆弱性评估。这些工作共同拓展了非正规经济实证研究的深度与广度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务