遇见数据集

electricsheepasia/asia-ilo-emp-care-sex-geo-nb-care-employment-by-sex-and-rural-urban-areas-thous

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于亚洲地区按性别和城乡区域划分的有偿护理工作者就业数据(以千为单位)的数据集。数据集包含1924个观测值,覆盖27个亚洲国家(如蒙古、柬埔寨、越南、格鲁吉亚、巴勒斯坦、塞浦路斯、斯里兰卡、泰国、菲律宾、巴基斯坦、文莱、印度、不丹、约旦、东帝汶等),时间跨度为1996年至2025年。数据源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包含唯一指标EMP_CARE_SEX_GEO_NB,表示按性别和城乡区域划分的护理就业人数(千)。数据列包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性等)、年份、观测值、观测状态等。数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,采用CC-BY-4.0许可证发布。

This dataset contains paid care workers employment data (in thousands) by sex and rural/urban areas for Asia. It includes 1,924 observations across 27 Asian countries (e.g., Mongolia, Cambodia, Vietnam, Georgia, Palestine, Cyprus, Sri Lanka, Thailand, Philippines, Pakistan, Brunei, India, Bhutan, Jordan, Timor-Leste, etc.), spanning the years 1996 to 2025. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via the REST API and filtered to Asian ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset features a single indicator, EMP_CARE_SEX_GEO_NB, representing care employment by sex and rural/urban areas (thousands). Columns include country code, country name, data source, indicator code, sex disaggregation (total, male, female, etc.), year, observed value, observation status, and more. It is suitable for tabular classification, regression, and time-series forecasting tasks, released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-care-sex-geo-nb-care-employment-by-sex-and-rural-urban-areas-thous 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API(https://rplumber.ilo.org/data/indicator?id=EMP_CARE_SEX_GEO_NB)直接获取原始数据,并依据亚洲ISO3国家代码进行筛选过滤。ILOSTAT借助国际劳工统计学家会议(ICLS)定义的标准,对来自各国劳动力调查、家庭收入调查等原始微观数据进行统一规范化处理,并在source.label列中标注数据来源以确保可追溯性。最终由Electric Sheep Asia团队重新打包为Parquet格式,形成包含1924条观测值、覆盖27个亚洲国家、时间跨度1996年至2025年的数据集。
特点
数据集聚焦于有偿护理工作者(Paid care workers)的就业状况,核心指标为EMP_CARE_SEX_GEO_NB,即按性别和城乡区域划分的护理就业人数(单位:千)。在结构上,数据集设计了丰富的维度字段,包括性别、地区类型和国家代码等,尤其提供SEX_T(总计)、SEX_M(男性)、SEX_F(女性)和SEX_O(其他)四种性别分型,便于精细化的交叉分析。此外,数据标注了观测状态(如序列中断、初步数据等)及来源注释,体现了数据质量的透明性,适用于时序分析、面板数据建模及区域性横向比较。
使用方法
数据集可通过HuggingFace Datasets库便捷调用,使用load_dataset函数即可完成加载,并可直接转换为Pandas DataFrame进行分析。典型使用方式包括:按国家代码过滤子集、针对单一指标按时间排序观察趋势、或通过数据透视表生成国家×年份矩阵。数据标签包含分类、回归和时序预测等任务类型,适合用于劳动力市场的统计分析、机器学习建模及政策评估研究。需注意数据以年频发布,且ILO优先选用'最佳来源'处理同一国家年份的多源冲突,确保数据一致性。
背景与挑战
背景概述
在全球劳动力市场研究中,照护工作者(paid care workers)的就业状况是衡量社会经济发展与性别平等的重要指标。亚洲作为人口密集且经济结构多元的区域,其照护行业就业数据的系统化整理尤为关键。该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布,经Electric Sheep Asia重新封装后呈现,涵盖了1996年至2025年间27个亚洲国家共计1924条观测记录,聚焦于按性别及城乡区域划分的照护就业人数(单位:千人)。数据集依托ILOSTAT对各国劳动力调查、家庭收入调查及行政记录的统一标准化流程,采用国际劳工统计学家会议(ICLS)定义进行数据整合,为学术界和政策制定者提供了跨时空可比的基础数据,有力推动了亚洲地区照护经济、性别劳动分工及可持续发展目标(SDGs)相关议题的实证研究。
当前挑战
该数据集与相关研究面临多重挑战。首先,在领域问题层面,不同国家对‘照护工作者’的职业定义与统计口径存在显著差异,导致跨国比较时需谨慎处理概念异质性;同时,照护行业常受非正规就业、家务劳动未纳入统计等因素影响,使得数据对真实就业规模的反映存在局限。其次,在数据集构建过程中,ILOSTAT虽采用基于ICLS的协调框架,但各国原始调查数据的采集频率、样本代表性及质量参差不齐,部分年度与国家的数据缺失或标注为‘序列中断’,增加了时间序列分析的难度;此外,从多个来源中挑选‘最佳来源’时,不同数据源之间的衔接与一致性维护亦构成技术挑战,需依赖详尽的元数据注释来保障用户可追溯性。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域中,该数据集是分析亚洲地区有偿照料就业时空格局的核心资源。研究者可利用其按性别与城乡分层的1,924条观测值,构建面板数据模型,探究1996年至2025年间27个国家照料工作者规模的演变轨迹。通过将观测值按年份与国家进行透视,可揭示照料经济在不同发展阶段的扩张或收缩特征,为国别比较与区域异质性研究提供量化基础。时间序列分析功能则支持预测劳动力市场中照料部门的未来走向,为政策模拟提供实证锚点。
实际应用
在实际政策制定与国际组织中,该数据集为亚洲各国的体面劳动议程提供了诊断工具。国际劳工组织可依据性别与城乡分解数据,识别特定国家或区域内女性照料就业过度集中或严重不足的警讯,进而设计针对性干预措施,如推动社会保护制度向非正规照料者覆盖。国家统计部门亦可借此校验本国劳动力调查的覆盖偏差,优化照料经济卫星账户的编制。非政府组织则能利用时间序列趋势,游说政府加大对长期照护基础设施的投资,使数据从学术论文真正转化为改善劳动者福祉的行动依据。
衍生相关工作
围绕该数据集,已衍生出若干标志性研究脉络。其一,基于面板计量方法的照料就业决定因素分析,学者们将性别工资差距、教育水平与公共支出等变量纳入模型,识别出制约照料职业发展的结构性瓶颈。其二,时间序列预测工作利用ARIMA或Prophet模型,对东南亚与南亚地区的照料人力需求进行前瞻性估算,为老龄化社会下的护理人力规划提供预警。其三,该数据作为基准输入,催生了若干跨数据集整合研究,例如将照料就业与ILO的体面劳动缺口指数、世界银行的性别发展指数对接,构建多维脆弱性评估框架,从而深化了照料经济与可持续发展目标之间的量化关联探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务