遇见数据集

AiresPucrs/data-credit-card

收藏
Hugging Face2024-10-13 更新2024-03-04 收录
官方服务:

资源简介:

data-credit-card数据集用于信用卡申请,并可用于探索机器学习算法中的偏见。数据集包含16列,所有属性名称和值已被更改为无意义的符号以保护数据的机密性。数据集的大小为689个示例,语言为英语,许可证为Creative Commons Attribution 4.0 International。

The data-credit-card dataset is designed for credit card application-related tasks and can also be used to explore biases in machine learning algorithms. The dataset consists of 16 columns, and all attribute names and values have been replaced with meaningless symbols to protect the confidentiality of the data. It contains 689 instances in total, is in English, and is licensed under Creative Commons Attribution 4.0 International.

提供机构:
AiresPucrs
原始信息汇总

数据集概述

数据集详情

  • 数据集名称: data-credit-card
  • 语言: 英语
  • 总样本数: 689
  • 数据集大小: 69072字节
  • 下载大小: 17253字节
  • 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0)

数据集结构

特征

  • b: 字符串
  • 30.83: 字符串
  • 0: float64
  • u: 字符串
  • g: 字符串
  • w: 字符串
  • v: 字符串
  • 1.25: float64
  • t: 字符串
  • t.1: 字符串
  • 01: int64
  • f: 字符串
  • g.1: 字符串
  • 00202: 字符串
  • 0.1: int64
  • +: 字符串

数据分割

  • train: 689个样本,69072字节

数据集内容

数据集包含16列:

  • A1: b, a
  • A2: 连续值
  • A3: 连续值
  • A4: u, y, l, t
  • A5: g, p, gg
  • A6: c, d, cc, i, j, k, m, r, q, w, x, e, aa, ff
  • A7: v, h, bb, j, n, z, dd, ff, o
  • A8: 连续值
  • A9: t, f
  • A10: t, f
  • A11: 连续值
  • A12: t, f
  • A13: g, p, s
  • A14: 连续值
  • A15: 连续值
  • A16: + (44.4%), - (55.6%) (类别属性)
搜集汇总
数据集介绍
构建方式
该数据集源自金融信用评估领域,旨在为文本分类任务提供基础训练数据。其构建基于信用卡申请相关的原始记录,共包含689个训练样本,每个样本由16个字段组成,涵盖字符串、浮点数和整数等多种数据类型,如申请人个人信息、财务指标及信用状态标签等。数据以结构化表格形式存储,并采用CC许可协议发布,确保了数据的规范性与可复用性。
特点
数据集以精简高效为特点,规模控制在1K以内,适合小样本学习和快速原型验证。其字段命名保留了原始数据的编码风格(如'30.83'、'00202'),体现了金融数据的真实性与未经过度清洗的原始特征。此外,数据集明确标注为英文文本分类任务,并关联金融领域标签,为信用风险评估模型提供了针对性的训练素材。
使用方法
使用该数据集时,可通过HuggingFace的datasets库直接加载,调用`load_dataset('AiresPucrs/data-credit-card', split='train')`即可获取训练数据。用户无需本地下载,库函数自动处理数据解析与分片。加载后的数据集可直接用于训练文本分类模型,或结合Teeny-Tiny Castle教程中的伦理与安全研究工具进行进一步分析。
背景与挑战
背景概述
在金融科技迅猛发展的当下,信用卡审批与风险评估已成为机器学习在金融领域的重要应用方向。由巴西PUCRS大学Aires研究团队于近年创建的Credit Card Dataset(亦称Teeny-Tiny Castle),旨在为信用评分模型提供基准测试数据。该数据集包含689个样本,涵盖年龄、负债率、婚姻状况等15项特征,并标注了信用审批结果。作为开源AI伦理与安全研究工具包Teeny-Tiny Castle的组成部分,该数据集不仅服务于信用违约预测研究,更强调在敏感金融决策中平衡模型性能与公平性,其发布对推动可解释、负责任的信用评估模型发展具有范式意义。
当前挑战
该数据集面临的核心挑战首先在于领域问题的复杂性:信用卡审批需同时处理类别不平衡(正负样本比例悬殊)、特征异构(数值型与类别型变量混杂)以及潜在的歧视性模式(如基于性别或婚姻状况的偏见)。构建过程中,数据预处理面临字段名混乱(如特征列无明确语义标签)、缺失值编码歧义(部分数值型特征存在异常占位符)等难题,需大量人工清洗与领域知识介入。此外,689条样本的规模限制使得模型泛化能力评估困难,而缺乏时间戳信息更难以捕捉信用行为的动态演化规律,这要求研究者必须结合正则化、集成学习或合成数据生成等策略来克服小样本下的过拟合风险。
常用场景
经典使用场景
在金融风控与信用评估领域,AiresPucrs/data-credit-card数据集常被用于构建和验证个人信用风险的分类模型。该数据集包含一系列表征申请人信用资质的多维特征,如收入水平、债务比例、职业类型及历史还款记录等,通过监督学习范式,研究者可训练模型预测申请人的违约概率或信用等级,从而评估其信贷可靠性。这一经典应用场景不仅为信用评分系统的开发提供了基准测试平台,也推动了特征工程与模型可解释性研究的进展,成为金融科技领域中风险评估模型训练与验证的基石。
解决学术问题
该数据集主要解决了信用风险量化评估中的样本不均衡与特征稀疏性等学术难题。传统信用评估依赖专家规则,难以捕捉非线性关系与高维交互效应,而该数据集为实证研究提供了标准化的小规模样本,使得研究者能够对比逻辑回归、决策树、支持向量机及深度神经网络等算法在违约预测任务上的表现差异。通过此数据集,学术界深入探讨了过采样、代价敏感学习及集成方法在缓解类别不平衡问题上的有效性,为构建更稳健的信用评分模型奠定了实验基础,显著提升了金融风控理论在实证层面的严谨性。
衍生相关工作
围绕AiresPucrs/data-credit-card数据集,衍生出多项具有影响力的学术工作。例如,研究者基于此数据集探索了联邦学习框架下跨机构信用模型协作的隐私保护方案,解决了数据孤岛问题;也有工作将对抗训练与因果推断引入信用评估,增强模型对分布偏移的鲁棒性。此外,该数据集被广泛应用于可解释人工智能(XAI)研究,通过SHAP、LIME等方法解析模型决策逻辑,为监管合规下的透明化风控提供技术路径。这些衍生工作不仅拓展了信用评分的技术边界,也推动了负责任人工智能在金融领域的落地实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务