遇见数据集

birkhoffg/folktables-acs-income

收藏
Hugging Face2023-05-08 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: AGEP dtype: float64 - name: COW dtype: float64 - name: SCHL dtype: float64 - name: MAR dtype: float64 - name: OCCP dtype: float64 - name: POBP dtype: float64 - name: RELP dtype: float64 - name: WKHP dtype: float64 - name: SEX dtype: float64 - name: RAC1P dtype: float64 - name: STATE dtype: string - name: YEAR dtype: int64 - name: PINCP dtype: float64 - name: __index_level_0__ dtype: int64 splits: - name: train num_bytes: 808018860 num_examples: 7345626 - name: test num_bytes: 269339730 num_examples: 2448543 download_size: 197308481 dataset_size: 1077358590 task_categories: - tabular-classification language: - en tags: - adult size_categories: - 1M<n<10M --- # Dataset Card for "folktables-acs-income" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

### 数据集信息 #### 特征字段 1. 年龄(AGEP):64位浮点型 2. 就业类型(COW):64位浮点型 3. 教育程度(SCHL):64位浮点型 4. 婚姻状况(MAR):64位浮点型 5. 职业编码(OCCP):64位浮点型 6. 出生地区编码(POBP):64位浮点型 7. 家庭关系(RELP):64位浮点型 8. 每周工作时长(WKHP):64位浮点型 9. 性别(SEX):64位浮点型 10. 种族编码(RAC1P):64位浮点型 11. 州(STATE):字符串型 12. 年份(YEAR):64位整型 13. 个人总收入(PINCP):64位浮点型 14. 索引列(__index_level_0__):64位整型 #### 数据划分 - 训练集(train):占用字节数808,018,860,样本量7,345,626 - 测试集(test):占用字节数269,339,730,样本量2,448,543 下载总大小:197,308,481字节,数据集总存储大小:1,077,358,590字节 #### 任务类别 表格分类(tabular-classification) #### 语言 英语(en) #### 标签 成人(adult) #### 样本规模 100万 < 样本量 < 1000万(1M<n<10M) --- # 「folktables-acs-income」数据集卡片 [更多信息请参阅](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
birkhoffg
原始信息汇总

数据集概述

数据集名称

  • folktables-acs-income

数据集特征

  • AGEP: 数据类型 - float64
  • COW: 数据类型 - float64
  • SCHL: 数据类型 - float64
  • MAR: 数据类型 - float64
  • OCCP: 数据类型 - float64
  • POBP: 数据类型 - float64
  • RELP: 数据类型 - float64
  • WKHP: 数据类型 - float64
  • SEX: 数据类型 - float64
  • RAC1P: 数据类型 - float64
  • STATE: 数据类型 - string
  • YEAR: 数据类型 - int64
  • PINCP: 数据类型 - float64
  • index_level_0: 数据类型 - int64

数据集分割

  • train:
    • 数据量 - 7345626 条记录
    • 存储大小 - 808018860 字节
  • test:
    • 数据量 - 2448543 条记录
    • 存储大小 - 269339730 字节

数据集大小

  • 下载大小 - 197308481 字节
  • 数据集总大小 - 1077358590 字节

任务类别

  • 表格分类

语言

  • 英语

标签

  • adult

大小类别

  • 1M<n<10M
搜集汇总
数据集介绍
birkhoffg/folktables-acs-income 数据集图片
构建方式
在经济社会研究中,收入预测是理解劳动力市场结构与个体经济福祉的关键议题。birkhoffg/folktables-acs-income数据集源自美国社区调查(American Community Survey, ACS)的微观样本数据,由Folktables项目整理而成。该数据集以表格分类任务为导向,聚焦于个体年收入是否超过特定阈值的二分类问题。构建过程中,研究者从ACS原始记录中提取了涵盖人口统计学、就业状态、教育背景、地理分布等多维度的特征变量,包括年龄(AGEP)、工作类别(COW)、教育程度(SCHL)、婚姻状况(MAR)、职业编码(OCCP)、出生地(POBP)、亲属关系(RELP)、每周工作小时数(WKHP)、性别(SEX)及种族(RAC1P)等,同时保留州(STATE)与年份(YEAR)信息以控制时空异质性。数据集被划分为训练集与测试集,分别包含约735万和245万条记录,为大规模机器学习模型的训练与评估提供了坚实基础。
特点
该数据集最显著的特点在于其规模宏大与结构严谨,总样本量超过980万条,属于百万级至千万级规模的数据集合,适用于深度学习与集成学习等对数据量要求较高的算法范式。所有数值型特征均以float64格式存储,确保了计算精度与数值稳定性,而状态与年份作为分类变量则保留了地域与时间维度的分析潜力。数据集的标签变量PINCP代表个体总薪资收入,通常用于二分类任务中以预测收入是否超越预设阈值。此外,数据集的特征空间覆盖了影响收入的经典社会经济学因素,如教育、职业、工作时长与地理流动等,使得模型能够捕捉到复杂的经济行为模式。其跨年份的纵向结构亦支持时间序列或面板数据分析,为研究收入动态演化提供了可能。
使用方法
使用该数据集时,研究者通常采用表格分类的标准流程。首先,通过HuggingFace Datasets库加载数据,可直接调用`load_dataset("birkhoffg/folktables-acs-income")`获取训练与测试分割。随后,对特征进行预处理,包括对数值型变量如AGEP、WKHP进行标准化或归一化,对分类变量如COW、MAR进行独热编码或标签编码。标签PINCP需根据研究目标转化为二值变量,例如以5万美元为分界点设定阈值。模型训练阶段,可应用逻辑回归、随机森林、梯度提升树或神经网络等分类器,并使用交叉验证优化超参数。评估指标宜选用准确率、精确率、召回率及F1分数,同时注意类别不平衡问题。最后,测试集用于评估模型泛化能力,并可通过特征重要性分析揭示收入预测的核心驱动因素。
背景与挑战
背景概述
在机器学习与社会科学的交叉领域中,收入预测作为衡量社会经济不平等与劳动力市场动态的关键指标,长期受到研究者的广泛关注。birkhoffg/folktables-acs-income数据集诞生于美国人口普查局发布的美国社区调查(American Community Survey, ACS)数据之上,由Folktables项目团队整理并公开,旨在为表格分类任务提供一个大规模、标准化且具有社会意义的基准。该数据集涵盖了从2014年至2018年的年度人口统计样本,包含年龄、教育水平、职业、婚姻状况、性别与种族等十余项特征,以及个人收入(PINCP)作为目标变量,样本量超过七百万条训练记录与两百四十万条测试记录,规模之大使其成为分析收入不平等、检测算法公平性以及评估表格数据模型泛化能力的理想平台。其影响力不仅体现在推动表格分类算法的进展上,更在于为政策制定者与社会科学研究者提供了可复现的实证基础,从而促进数据驱动的社会公平研究。
当前挑战
该数据集所面临的挑战首先体现在其核心的领域问题——收入预测中:由于收入分布通常具有长尾特性且受到众多社会、经济与地理因素的复杂交互影响,模型容易偏向多数群体,导致对少数族裔、女性或低收入群体的预测偏差加剧,从而引发公平性与歧视性风险。此外,构建过程中亦存在显著挑战:原始ACS数据经过复杂的抽样与加权设计,直接使用原始样本可能导致统计推断失准;特征如职业(OCCP)与出生地(POBP)的编码层级过高,需进行维度压缩或合并处理以缓解稀疏性问题;同时,跨年份的数据整合要求严格的时间一致性校验,以确保训练集与测试集在分布偏移下仍能反映真实的人口变迁趋势,这些技术难题对数据预处理与模型鲁棒性提出了严苛要求。
常用场景
经典使用场景
在人口统计学与社会经济学交叉研究的广袤领域中,birkhoffg/folktables-acs-income数据集凭借其源自美国社区调查(ACS)的权威微观数据,成为预测个人收入是否超越特定阈值(如5万美元)的经典基准。该数据集囊括了年龄、性别、种族、教育程度、职业、婚姻状况及每周工作时长等十余项结构化特征,为构建和评估二分类模型提供了丰富而规范的实验平台。研究者借助此数据集,可系统性地探索社会经济地位与人口属性之间的复杂关联,从而在公平性、可解释性及模型鲁棒性等维度上展开深入剖析。
衍生相关工作
围绕此数据集,学术界已衍生出多项里程碑式的工作。例如,Ding等人利用该数据构建了公平性约束下的收入预测框架,提出了基于分布鲁棒优化的去偏算法。另一项经典研究则聚焦于因果推断视角,通过结构方程模型解析教育年限对收入的直接与间接效应。此外,该数据集还催生了若干关于模型可解释性的探索,如基于Shapley值的特征重要性分析,揭示了工作经验与职业类别在收入决定中的主导作用。这些衍生工作不仅拓展了数据集的学术边界,也为后续研究提供了方法论参考。
数据集最近研究
最新研究方向
基于美国社区调查(ACS)数据的收入预测与公平性研究正成为社会经济计算领域的前沿热点。birkhoffg/folktables-acs-income数据集整合了年龄、教育、职业、婚姻状况等结构化特征,覆盖超700万训练样本,为大规模表格分类任务提供了坚实基础。当前研究聚焦于利用该数据集探索人口统计学变量与收入水平之间的复杂关联,特别是在算法公平性框架下评估性别、种族等敏感属性对预测结果的影响。随着美国社会对经济不平等与结构性歧视问题的持续关注,该数据集被广泛用于构建可解释的机器学习模型,以揭示隐性偏见并推动公平决策机制的发展。其意义在于为政策制定者提供数据驱动的洞察,助力缩小收入差距,促进社会正义与包容性增长。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务