遇见数据集

electricsheepasia/asia-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和货币分类的员工平均小时收入 | 亚洲(ILOSTAT)”,是一个表格型数据集,专注于亚洲地区的劳动力市场收入统计。它包含14,982个观测值,覆盖25个亚洲国家(如印度尼西亚、菲律宾、柬埔寨、土耳其、越南等),时间跨度为1996年至2025年。核心指标是EAR_EHRA_SEX_AGE_CUR_NB,即按性别、年龄和货币分类的员工平均小时收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,通过调查(如劳动力调查、家庭收入调查)和行政记录收集,并按照国际劳工统计学家会议(ICLS)定义进行标准化。数据集提供了详细的列信息,包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性等)、年龄分类、货币类型、观测年份、观测数值、数据状态标志等。数据以年频率发布,并包含数据质量说明,例如当同一国家×年份有多个来源时,使用ILO选择的“最佳来源”。该数据集适用于表格分类、回归和时间序列预测任务,可用于分析亚洲各国收入趋势、性别和年龄差异等。数据集由Electric Sheep Asia重新打包,以Parquet格式发布,便于机器学习使用。许可证为cc-by-4.0。

This dataset, titled Average hourly earnings of employees by sex and age and currency | Asia (ILOSTAT), is a tabular dataset focusing on labor market earnings statistics in Asia. It contains 14,982 observations across 25 Asian countries (e.g., Indonesia, Philippines, Cambodia, Turkey, Vietnam), spanning the years 1996 to 2025. The core indicator is EAR_EHRA_SEX_AGE_CUR_NB, which represents the average hourly earnings of employees disaggregated by sex, age, and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, a leading global source for labor statistics, compiled from surveys (e.g., labor force surveys, household income surveys) and administrative records, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes detailed columns such as country code, country name, data source, indicator code, indicator label, sex classification (total, male, female, etc.), age classification, currency type, observation year, observed value, and data status flags. Data is published at annual frequency and comes with data quality caveats, e.g., when multiple sources exist for the same country×year, the ILO-selected best source is used. This dataset is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of income trends, gender and age disparities across Asian countries. It has been repackaged by Electric Sheep Asia in Parquet format for machine learning readiness. The license is cc-by-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Asia团队从ILOSTAT REST API接口直接抓取原始指标数据,并依据亚洲ISO3国家代码进行地理筛选。数据采集指标为'EAR_EHRA_SEX_AGE_CUR_NB',即按性别、年龄和货币分类的雇员平均小时收入。ILO依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行标准化处理,并将数据来源信息记录在'source.label'字段中,以确保数据的可追溯性与跨国产出的可比性。最终数据集以Parquet格式打包,在HuggingFace平台上发布,共包含14,982条观测记录。
特点
本数据集涵盖1996年至2025年间亚洲地区25个国家的雇员平均小时收入,观测总量达14,982条,时间跨度近三十年。数据集中包含1个核心指标,并通过'sex'、'classif1'(年龄)、'classif2'(货币类型)等维度进行精细分解,支持按性别(总计、男性、女性)分类分析。每条记录携带详细的元数据注释,包括观测状态标志(如序列中断)与指标说明,有助于研究者评估数据的质量与适用性。其数据结构为表格形式,列设计清晰,适合进行时间序列分析、面板数据回归以及跨国家、跨时期的比较研究。
使用方法
用户可通过HuggingFace Datasets库的'load_dataset()'函数一行代码加载该数据集,并利用'to_pandas()'方法将其转换为Pandas DataFrame进行后续操作。典型应用场景包括按国家过滤数据以获取特定地区的时间序列,或针对单一指标按年份排序进行趋势可视化。数据集亦支持构建国家×年份的透视矩阵,便于开展多国面板数据分析。由于数据采用标准化的表格格式且遵循CC-BY-4.0许可协议,研究者在引用时需同时标注原始ILO数据来源及Electric Sheep Asia的再包装版本,即可放心在学术与工业场景中使用。
背景与挑战
背景概述
亚洲地区劳动力市场的性别与年龄工资差异一直是劳动经济学与发展研究领域的核心议题。由国际劳工组织(ILO)统计司创建并维护的ILOSTAT数据库,作为全球劳动统计的权威来源,为本数据集提供了坚实的数据基础。该数据集由Electric Sheep Asia于2025年整理发布,聚焦于亚洲25个国家(覆盖印尼、菲律宾、柬埔寨等经济体)1996年至2025年间按性别与年龄划分的雇员平均小时工资数据,共计14,982条观测记录。其核心研究问题在于揭示亚洲不同国家在薪酬结构上的性别与年龄分层特征,为跨国比较、政策评估及体面劳动目标(如SDG第八项)的监测提供了标准化的时间序列数据。该数据集的影响力在于填补了亚洲区域精细化劳动收入数据的空白,使得机器学习模型能够对工资不平等动态进行更深入的建模与分析。
当前挑战
本数据集所应对的领域挑战主要源于劳动统计数据的异质性与不完整性:亚洲各国在调查方法(如劳动力调查、企业调查)、数据频率(多为年度数据而缺少高频序列)及货币单位方面存在显著差异,且部分国家的观测值因调查断点或修订而带有“序列中断”等质量标记,这为跨国的纵向比较与回归建模引入非平稳性与测量误差。在构建过程中,挑战集中于数据清洗与标准化环节:ILOSTAT原始API返回的多源、多分类变量(如性别、年龄组与货币类型)需经过细致的模式对齐与空值处理,同时需要处理同一国家-年份组合下的“最佳来源”挑选逻辑,以确保下游任务中时间序列的连续性与一致性。此外,减少的监测指标数量(仅单一工资指标)虽提高了专注度,但也限制了模型捕捉多元劳动市场特征的能力。
常用场景
经典使用场景
该数据集收录了1996至2025年间亚洲25个国家按性别与年龄分组的雇员平均时薪数据,共计14,982条观测记录。其经典使用场景集中于劳动经济学领域的跨国比较分析,研究者可借助该数据探究亚洲各国薪资水平的长期演变趋势与区域差异,亦可结合性别与年龄维度剖析薪酬结构的动态特征,为理解亚洲劳动力市场的多元图景提供实证基础。
衍生相关工作
该数据集衍生了若干重要学术工作,尤其在跨国薪资比较与劳动市场建模领域。研究者常将其与国际劳工组织的其他指标数据(如失业率、劳动参与率)进行联合分析,以构建亚洲国家体面劳动指数。此外,该数据被广泛用于训练时序预测模型,例如利用长短期记忆网络(LSTM)预测特定国家的薪资走势,或在面板数据回归模型中评估性别工资差异的收敛性,推动了计算社会科学方法在劳动经济学中的应用。
数据集最近研究
最新研究方向
当前,基于ILOSTAT发布的亚洲地区雇员平均时薪数据集,研究前沿正聚焦于性别薪酬差距的跨时期动态演变与结构性拆解。结合亚太区域劳动力市场在新冠疫情后复苏、产业结构转型与人口老龄化交织的热点,学者利用该数据中按性别与年龄细分的高频观测值,通过时间序列分析与面板回归模型,量化各经济体在性别平等立法、最低工资政策及非正规就业治理方面的效应。该数据集涵盖25国近三十年数据,为评估联合国可持续发展目标8(体面工作和经济增长)中薪酬公平目标的实现进度提供了关键实证基础,尤其在监测不同代际女性劳动者面临的“玻璃天花板”与“粘地板”效应方面具有不可替代的学术价值。其影响深远,不仅支撑了跨国比较研究,更直接为国际劳工组织及各国制定精细化劳动力市场政策提供了数据驱动的决策锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务