遇见数据集

electricsheepasia/asia-ilo-lac-xees-eco-cur-nb-average-hourly-labour-cost-per-employee-by-economi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格型数据集,专注于亚洲地区的劳动力成本统计。它包含5,736个观测值,覆盖10个亚洲国家(包括塞浦路斯、阿塞拜疆、以色列、哈萨克斯坦、亚美尼亚、土耳其、菲律宾、泰国、蒙古和乌兹别克斯坦),时间跨度为1996年至2025年。数据集的核心指标是“按经济活动和货币划分的雇员平均每小时劳动力成本 - 已停用”(指标代码:LAC_XEES_ECO_CUR_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库通过协调原始调查微数据(使用国际劳工统计学家会议定义)来提供全球劳工统计数据。数据集以年度频率发布,并包含多个列,如国家代码、国家名称、来源代码、指标代码、分类变量、观测年份、观测值以及数据状态和注释等。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的亚洲劳动力成本数据。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,并遵循CC-BY-4.0许可证。

This dataset is a tabular dataset focusing on labor cost statistics in Asia. It contains 5,736 observations across 10 Asian countries (including Cyprus, Azerbaijan, Israel, Kazakhstan, Armenia, Turkey, Philippines, Thailand, Mongolia, and Uzbekistan), spanning the years 1996 to 2025. The core indicator is Average hourly labour cost per employee by economic activity and currency - Discontinued (indicator code: LAC_XEES_ECO_CUR_NB). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, which harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions to provide global labor statistics. The dataset is published at an annual frequency and includes multiple columns such as country code, country name, source code, indicator code, classification variables, observation year, observed value, and data status and notes. It is suitable for tasks like tabular classification, regression, and time-series forecasting, aiming to provide machine learning-ready labor cost data for Asia. The dataset is repackaged by Electric Sheep Asia, released in Parquet format, and licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-lac-xees-eco-cur-nb-average-hourly-labour-cost-per-employee-by-economi 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接获取指标LAC_XEES_ECO_CUR_NB的原始数据,并依据亚洲ISO3国家代码进行地理过滤与清洗。ILOSTAT对各国调查微观数据采用国际劳工统计学家会议(ICLS)定义进行统一协调,数据来源在source.label列中清晰标注以确保可追溯性。最终经Electric Sheep Asia重新封装,形成包含5736条观测值、覆盖10个亚洲国家、时间跨度1996至2025年的标准化表格数据集。
特点
该数据集聚焦于‘按经济活动和货币划分的雇员平均每小时劳动成本’这一单一核心指标,提供高颗粒度的分类体系,包括经济活动和货币类型两个维度。数据采用年度频率,当同一国家与年份存在多个来源时,自动选取ILO认定的‘最佳来源’以保证数据质量,且每条记录均包含来源、观测状态及详细的分类注释信息。此外,数据集以Parquet格式存储,便于高效读取与机器学习流水线集成。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,使用load_dataset函数即可获得包含全部5736条记录的训练集,并支持转换为pandas DataFrame进行灵活操作。典型用法包括按国家代码过滤数据以分析特定经济体趋势,对指标进行时间序列排序与可视化,以及利用pivot_table函数构建国家×年份的矩阵形式以便进行跨区域比较分析。数据集默认采用CC-BY-4.0许可协议,使用时需同时引用ILO原始来源及Electric Sheep Asia的封装版本。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Asia于2025年重新打包并发布在HuggingFace平台上,聚焦于亚洲10个国家1996至2025年间每小时平均劳动成本的观测数据。其核心研究问题在于解构亚洲经济体在不同经济活动与货币类型下的劳动力成本动态,为跨国比较、劳动经济学分析及政策制定提供高颗粒度的时序数据。作为ILO旨在推动体面工作与可持续发展目标的统计基石,该数据集填补了亚洲区域精细劳动成本标准化数据的空白,对劳动市场监测、企业成本核算及国际竞争力研究具有重要的支撑作用。
当前挑战
数据集面临的挑战首先在于所解决的领域问题:劳动成本统计因各国数据收集标准、调查方法和统计口径的差异而难以直接比较,ILOSTAT虽采用了国际劳工统计学家会议(ICLS)定义进行协调,但原始数据源的质量不一仍可能影响分析可靠性。其次,构建过程中面临显著挑战:数据集被标注为已停用(Discontinued),意味着后续年份更新缺失,且仅包含年度频率数据,无法覆盖月度或季度波动;此外,部分国家的观测稀疏(如乌兹别克斯坦仅1年数据),且同国家不同时期可能采用不同数据源,需依赖ILO的“最佳来源”选择逻辑处理,增加了重构统一时序的复杂度。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中亚洲十国1996至2025年间每小时平均劳动力成本的年度观测值,共计5736条记录。在劳动经济学与区域比较研究中,它常被用于构建跨国面板数据模型,以分析亚洲经济体劳动力成本的时间演变轨迹与国别差异。研究者可借助经济活动的分类变量,深入探索不同产业部门的薪酬结构特征,或结合本地货币与汇率信息,评估劳动力成本的相对竞争力。数据集结构规整,涵盖国家、年份、经济活动和观测值等核心字段,特别适合开展时间序列预测、面板回归分析以及经济指标的可视化探索。
衍生相关工作
该数据集为后续学术研究提供了重要的数据基石,催生了一系列探讨劳动力成本与经济转型关系的经典工作。有学者基于此数据考察了劳动力成本上升对亚洲制造业出口竞争力的影响,发现单位劳动力成本的变动能够显著解释出口市场份额的转移。另一些研究则利用该数据结合生产函数模型,测算了全要素生产率与劳动力成本之间的联动机制,揭示了经济发展阶段不同国家在成本压力下的产业升级路径。此外,该数据集还被用于验证库兹涅茨曲线在劳动力成本领域的适用性,即随着经济发展,劳动力成本呈现先缓慢增长后加速上升的非线性规律,为发展经济学提供了新的经验注脚。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区劳动力成本的时序分析与跨国比较,为劳动经济学、国际竞争力评估以及全球化背景下的产业转移研究提供了关键数据支持。在当下全球供应链重构与地缘经济格局变动的前沿研究中,该数据可深度应用于探讨劳动力成本差异对亚洲各国制造业竞争力、外资流动以及区域经济一体化的影响。结合国际劳工组织(ILO)的标准化统计框架,研究者能够追踪1996至2025年间十个亚洲经济体(如塞浦路斯、阿塞拜疆、以色列等)的每小时平均劳动成本演变趋势,揭示经济政策、汇率波动与产业结构调整对劳动力市场的动态作用。该数据集以其高时间分辨率、多维度分类变量与严谨的元数据标注,成为推动亚太地区劳资关系、可持续发展目标(SDG)及后疫情时代就业复苏等热点议题实证分析的基石资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务