遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-eco-geo-nb-employment-outside-the-formal-sector-by-sex-econom

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含19,559条关于非正规经济的观测数据,覆盖23个亚洲国家,时间跨度为2000年至2025年,涵盖1个独特指标。具体指标为按性别、经济活动和城乡地区划分的非正规部门外就业(千人数)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,包括国家代码、性别分类、经济活动和地区类型等维度。数据集适用于表格分类、回归和时间序列预测等任务,并提供了详细的数据质量说明和使用示例。

This dataset contains 19,559 observations of Informal economy data across 23 Asia countries, spanning 2000–2025, covering 1 distinct indicators. The indicator is Employment outside the formal sector by sex, economic activity and rural / urban areas (thousands). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, harmonized with dimensions such as country codes, sex disaggregation, economic activity, and area type. It is suitable for tasks like tabular classification, regression, and time-series forecasting, and includes detailed data quality notes and usage examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-eco-geo-nb-employment-outside-the-formal-sector-by-sex-econom 数据集图片
构建方式
该数据集由Electric Sheep Asia团队基于国际劳工组织(ILO)的ILOSTAT数据库进行系统性重构与封装。构建过程遵循严谨的数据工程流程:首先,通过ILOSTAT提供的REST API接口(端点位于rplumber.ilo.org)直接拉取指标编码为EMP_PIFL_SEX_ECO_GEO_NB的原始观测数据,确保数据源的权威性与可追溯性;其次,依据ISO 3166-1 alpha-3国家代码标准,将数据筛选并限定于23个亚洲国家和地区,形成地域聚焦的子集;随后,对原始字段进行规范化处理,保留完整的分类维度标签、观测状态标识及来源注释信息,最终以Parquet格式封装发布,并同步提供详尽的模式说明与数据字典。
使用方法
研究者可通过HuggingFace生态便捷调用该数据集。使用datasets库的load_dataset函数指定仓库路径即可加载完整数据,并利用to_pandas方法转换为数据框进行后续分析。针对特定研究需求,可灵活运用筛选与重塑操作:例如通过ref_area字段提取单一国家的时间序列数据,或利用pivot_table将数据透视为国家与年份的矩阵形式,以观察跨国趋势差异。数据集适用于表格分类、回归及时间序列预测等多种机器学习任务,亦可服务于劳动经济学、发展研究及社会政策评估等领域的实证分析,使用时需遵守CC-BY-4.0许可协议并规范引用原始来源。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力调查数据,为非正规经济研究提供了权威基准。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中「按性别、经济活动及城乡地区分类的非正规部门外就业」指标进行重新封装,覆盖23个亚洲国家、2000至2025年间19,559条观测记录。该数据集直面亚洲非正规就业占比高、性别差异显著、城乡分化严重等核心劳动议题,为追踪可持续发展目标第八项「体面工作」进展、评估非正规经济规模及其结构演变提供了关键数据支撑。
当前挑战
非正规就业的测度本身即构成劳动统计领域的持久难题,其定义随国际劳工统计学家会议(ICLS)决议不断修订,导致跨国比较面临口径不一致的困境。该数据集汇聚的亚洲国家数据在来源上高度异质,部分国家依赖劳动力调查,另一些则基于家庭收入调查或行政记录,样本设计、覆盖范围与采集频率参差不齐。时间序列中普遍存在方法学修订所致的断点,且低收入国家数据稀缺、年份缺失严重,城乡与性别维度的细分更易因样本量不足而标记为不可靠。这些因素共同制约了基于该数据集进行长期趋势分析与跨区域稳健比较的可靠性。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画亚洲二十三国的非正规部门就业规模及其性别结构。研究者常以面板数据模型,按国别、年份、性别及城乡维度,系统比较非正规就业的时空演变轨迹,进而揭示发展中国家劳动力市场二元结构的动态特征。
解决学术问题
该数据集有效回应了非正规就业跨国比较中数据口径不一、覆盖零散的方法论困境。依托国际劳工组织的标准化调和流程,它为检验非正规就业与经济增长、性别平等、城乡差距之间的因果关联提供了统一的分析基础,推动了比较劳动制度研究的实证深化。
实际应用
在政策实践中,该数据集为国际组织与各国劳动部门监测体面劳动目标进展提供了量化依据。其分性别与城乡的细化指标,可用于评估非正规就业的社会保障覆盖缺口,辅助制定针对女性与农村劳动者的就业促进政策,并为亚洲区域劳动力市场一体化研究提供数据支撑。
数据集最近研究
最新研究方向
伴随非正规经济在全球南方劳动力市场中持续占据显著比重,围绕非正规就业的量化测度与结构性归因已成为劳动经济学与发展经济学的交叉前沿。该数据集依托ILOSTAT的标准化框架,覆盖23个亚洲国家2000至2025年的非正规部门就业观测,为性别差异、城乡分野与经济 activity 维度的交互分析提供了长时序面板基础。近期研究借助此类数据聚焦于非正规就业的性别分层机制、城市化进程中的生计转型,以及疫情冲击下非正规从业者的脆弱性暴露,进而服务于体面劳动议程与SDG目标的本土化监测。其方法论价值在于支持跨国家比较与时间序列预测,为社会保障扩面与劳动力市场政策评估提供可复用的证据底座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务