遇见数据集

electricsheepasia/asia-ilo-lac-xees-eco-nb-average-hourly-labour-cost-per-employee-by-economi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自13个亚洲国家的2695个观测值,时间跨度为1996年至2025年,涵盖一个指标:按经济活动划分的每小时平均劳动力成本(以当地货币计,已停用)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涉及劳动力成本统计,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 2,695 observations of labour cost data across 13 Asia countries, spanning 1996–2025, covering one distinct indicator: Average hourly labour cost per employee by economic activity - Discontinued (local currency). It is sourced from the ILOSTAT database of the International Labour Organization (ILO) and is suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-lac-xees-eco-nb-average-hourly-labour-cost-per-employee-by-economi 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,通过其REST API接口直接获取指标代码为LAC_XEES_ECO_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。数据采集过程严格遵循ILO的统计数据协调标准,基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查及行政记录等微数据进行统一整理,最终形成包含2,695条观测、覆盖13个亚洲国家、时间跨度从1996年至2025年的结构化表格数据。数据集由Electric Sheep Asia团队重新打包,以Parquet格式发布,确保机器学习任务的兼容性与高效读取。
特点
该数据集以单一核心指标——按经济活动划分的雇员平均小时劳动成本(本币计价,已停用)——为焦点,提供了时间序列与截面双重维度的精细观察。其独特之处在于丰富的元数据标注,包括数据来源追踪(source.label)、观测状态标记(obs_status)、经济活动分类(classif1)以及多层级注释信息(note_classif、note_indicator等),为研究者提供了透明度极高的数据溯源能力。地理覆盖兼顾了中亚、高加索、地中海东部及东南亚地区,尤其对塞浦路斯(618行)和阿塞拜疆(387行)等经济体提供了密集的年度观测。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据集,返回的HuggingFace Dataset对象可直接转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定经济体数据,利用时间列对单一指标进行时序可视化,或通过pivot_table构建国家×年份的宽表矩阵以进行跨经济体比较。数据集兼容表格分类、回归与时间序列预测任务,适用于劳动经济学研究、国际可比性分析及宏观经济建模。建议使用时结合obs_status字段中的质量标记,对 flagged 为provisional或unreliable的观测值进行审慎处理。
背景与挑战
背景概述
在劳动经济学与区域发展研究中,劳动力成本是评估经济体竞争力、制定产业政策及衡量社会保障水平的核心指标。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库系统收录了跨越200多个经济体的海量劳工数据,为跨国比较与纵向分析提供了宝贵的资源。在此背景下,由Electric Sheep Asia于2025年整理并发布的“asia-ilo-lac-xees-eco-nb-average-hourly-labour-cost-per-employee-by-economi”数据集,聚焦亚洲13个国家,汇集了1996年至2025年间共2695条平均每小时劳动力成本观测值。该数据集源于ILOSTAT的官方API,并经由统一模式清洗与标准化处理,旨在为研究人员与开发者提供一个可直接用于机器学习的亚洲劳动力成本时间序列表格,尤其适用于分类、回归与时间序列预测任务。通过聚焦亚洲这一经济发展差异显著的区域,该数据集为分析区域内劳动力成本的动态演变、跨国对比以及经济结构转型提供了关键数据支撑。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲各国在经济结构、统计能力与数据采集标准上存在显著差异,导致跨国劳动力成本的可比性与一致性难以保证。ILO虽通过国际劳动统计学家会议(ICLS)定义进行了数据协调,但原始数据来源(如劳动力调查、机构调查与行政记录)的异质性依然存在,需要依赖“最佳来源”选择策略以降低偏差。在构建过程中,主要挑战包括:其一,数据清理时需处理因调查方法变更或指标停用(如本数据集中的“Discontinued”标识)导致的时间序列断裂;其二,来自不同国家与经济活动的数据在分类标签(如经济活动类型、人口覆盖范围)上存在不完全对齐,需依赖注释字段(如note_classif与note_indicator)进行人工校验;其三,部分国家观测值稀疏(如斯里兰卡仅27条),增加了时序建模与缺失值插补的难度。此外,数据仅涵盖年度频次,未能纳入季度或月度波动,限制了高频率劳动成本动态分析的精度。
常用场景
经典使用场景
在劳动经济学与国际比较研究的学术脉络中,该数据集为分析亚洲地区雇员平均小时劳动成本的长期演变提供了珍贵的时序数据。研究者可借此追踪13个亚洲经济体从1996年至2025年间劳动力成本的动态轨迹,揭示不同国家在经济发展阶段、产业结构变迁与劳动力市场制度差异下的成本分化格局。通过面板数据回归或时间序列分析,能够量化全球化进程中亚洲制造业与服务业用工成本的趋同或发散趋势,为理解区域劳动力市场整合程度提供实证基础。
解决学术问题
该数据集的系统发布有效填补了亚洲发展中经济体劳动成本微观数据长期缺失的学术空白。传统研究中,跨国劳动成本比较常受限于数据可得性不一致、统计口径不统一等瓶颈,而ILOSTAT基于国际劳工统计学家会议定义的标准化处理流程,确保了跨年份、跨国别的可比性。研究者可据此探究贸易开放度、外资流入、最低工资制度与劳动成本变动之间的因果机制,进而为劳动力市场政策评估、产业竞争力分析及全球价值链研究提供可靠的数据支撑。
衍生相关工作
围绕这一数据集所承载的标准化劳动成本信息,学术界已衍生出多项具有影响力的研究工作。其中基于跨国面板数据的劳动成本弹性估计、最低工资外溢效应检验,以及亚洲制造业竞争优势的分解研究均为典型代表。此外,该数据集常与ILO发布的劳动生产率、就业结构及社会保障支出数据联合使用,构建综合性的体面劳动指标体系。在计量方法上,也催生了针对劳动成本面板数据中缺失值处理、异常值识别及跨源数据融合的策略,为后续亚非拉等发展中区域的类似数据集构建提供了方法论范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务