遇见数据集

electricsheepasia/asia-ilo-ear-ehrm-sex-age-cur-nb-median-hourly-earnings-of-employees-by-sex-and-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲员工中位小时收入数据,按性别、年龄和货币分类。数据集共有14,982个观测值,覆盖25个亚洲国家(如印度尼西亚、菲律宾、柬埔寨、土耳其、越南等),时间跨度为1996年至2025年。数据指标为EAR_EHRM_SEX_AGE_CUR_NB,表示员工中位小时收入,数据来源包括劳动力调查、家庭收入调查等,并经过ILO基于国际劳工统计学家会议(ICLS)定义的标准化处理。数据集包含多个维度,如性别(总计、男性、女性、其他)、年龄分类和货币类型(本地货币),适用于表格分类、回归和时间序列预测等任务。

This dataset contains median hourly earnings data for employees in Asia, disaggregated by sex, age, and currency, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 14,982 observations across 25 Asian countries (e.g., Indonesia, Philippines, Cambodia, Turkey, Vietnam) spanning the years 1996 to 2025. The indicator is EAR_EHRM_SEX_AGE_CUR_NB, representing median hourly earnings, with data derived from sources such as labour force surveys and household income surveys, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset features dimensions like sex (total, male, female, other), age classification, and currency type (local currency), and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehrm-sex-age-cur-nb-median-hourly-earnings-of-employees-by-sex-and-age 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia重新封装而成。构建流程依托ILOSTAT提供的REST API,直接拉取指标为“EAR_EHRM_SEX_AGE_CUR_NB”的原始数据,并通过预设的亚洲ISO3国家代码列表进行地理范围过滤,最终汇聚了来自25个亚洲国家、横跨1996年至2025年间的14,982条观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调与标准化处理,确保跨国数据的可比性。数据来源信息被明确标注于“source.label”字段,为用户提供了完整的溯源路径。
使用方法
用户可通过HuggingFace Datasets库中的`load_dataset()`函数,直接加载该数据集并转换为Pandas DataFrame格式进行后续分析。使用方法高度灵活,既可按国家代码(如`ref_area == "IDN"`)筛选出单一国家数据,进行国别深度研究;也可针对特定指标按时间排序,绘制观测值的变化趋势,进行时间序列预测。更进一步,用户能利用数据透视表功能,构建以时间(年份)为行、以国家为列的薪酬矩阵,实现跨国的横向对比分析。该数据集格式规整,列名清晰,特别适合社会科学、劳动经济学及区域发展研究领域的学者与数据科学家直接调用。
背景与挑战
背景概述
在劳动经济学与公共政策研究领域,薪酬数据的可获得性与细粒度是评估劳动力市场公平性与经济发展的关键基石。由国际劳工组织(ILO)统计部门构建的ILOSTAT数据库,作为全球劳动统计的权威枢纽,系统整合了来自各国劳动力调查、行政记录等多源数据。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中亚太区域数据进行了深度再包装,形成了本数据集——涵盖1996至2025年间25个亚洲国家、共计14,982条观测记录的雇员中位数时薪数据。该数据集聚焦于按性别与年龄分层的薪酬结构,为探究亚洲劳动力市场中性别工资差距、年龄效应及跨时期薪酬动态提供了标准化、机器可读的时序面板,显著降低了研究者从庞杂原始接口中清洗异构数据的时间门槛,推动了南亚、东南亚等地区劳动经济学的实证研究进程。
当前挑战
该数据集所解决的领域核心挑战在于亚洲劳动力市场中普遍存在的薪酬数据碎片化与可比性缺失问题。各国统计口径、调查频次及货币单位的巨大差异使得跨国时序分析长期受阻,而数据集通过ILOSTAT统一的ILCS定义框架进行标准化,并预设了按性别、年龄、货币类别交叉分解的维度,使研究者得以拆解数据结构背后的经济复杂性。在构建过程中,面临的主要挑战包括:如何从ILO的REST API中按ISO3国家代码精准过滤亚太子区域,如何处理不同来源同一国家年份的‘最佳来源’选择原则,以及如何保留观测状态标志(如断点、临时值)以确保数据质量追溯。此外,对多分类变量(如年龄时段、货币类型)的缺省值处理与跨表连接,进一步考验了数据管线的稳健性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲25个国家1996年至2025年间雇员按性别与年龄划分的时薪中位数,共计近1.5万条观测。其核心应用场景集中于劳动经济学的跨国比较研究,学者可借助性别、年龄等维度,剖析亚洲各国劳动力市场的薪酬结构差异,追踪工资水平的长期演变趋势,并利用时间序列分析或面板数据模型检验经济发展与收入分配之间的动态关联。
解决学术问题
数据集直面劳动经济学中性别工资差距与年龄收入曲线两大经典议题。通过提供标准化、跨国的微观汇总数据,它使得研究者能够在控制国家异质性的前提下,精细量化性别和年龄对薪酬的独立影响,识别亚洲经济体在性别平等进程中取得的进展与面临的瓶颈。同时,数据可支撑对最低工资政策效果、劳动力市场制度变革以及全球化冲击下收入分配格局演变的实证评估,为制定精准的劳动力政策提供了坚实的数据基石。
实际应用
在实际决策层面,该数据集可赋能国际组织、政府机构及智库开展区域劳动力市场监测。例如,政策制定者可以基于不同国家不同性别群体的时薪中位数基准,实时评估经济周期对低收入群体的冲击程度,从而设计更具针对性的社会保障与就业促进方案。此外,企业跨国薪酬策略的制定以及国际人力资源咨询机构对亚洲各国劳动力成本的横向对比,亦可从中提取关键洞见,进而在合规框架内优化薪酬体系。
数据集最近研究
最新研究方向
在亚洲劳动力市场的当代研究中,该数据集聚焦于性别与年龄维度的时薪中位数差异,为剖析区域劳动报酬结构提供了关键量化基础。前沿方向集中于利用近三十年时间序列数据,结合经济周期、产业转型与政策干预(如最低工资调整、性别平等立法),构建动态面板模型以识别工资不平等的演化路径与驱动因素。当前热点关联亚洲新兴经济体在全球化退潮与数字经济崛起双重背景下的劳动力市场分化——年轻群体在零工经济中的边缘化、中老年劳动者在制造业回流中的技能错配,以及女性劳动参与率攀升背后的报酬追赶效应。该数据集的独特价值在于其横跨东南亚、南亚及中东的25国比较框架,使得跨国异质性分析成为可能,为联合国可持续发展目标(SDG 8.5)所倡导的体面劳动与同工同酬原则提供了可量化的监测工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务