遇见数据集

Stressed German Credit Dataset

收藏
github2026-06-18 更新2026-06-20 收录
官方服务:

资源简介:

这是一个基于UCI德国信用数据集的压力版本数据集,版本为SGCD-v0.1,通过应用受控的输入退化(如噪声、缺失、模糊性、格式变化、矛盾等)来评估机器学习和LLM系统的鲁棒性。

This is a stress-test variant dataset based on the UCI German Credit Dataset, versioned as SGCD-v0.1. It is constructed to evaluate the robustness of machine learning and Large Language Model (LLM) systems by applying controlled input degradations, including noise, missing values, ambiguity, format variations, contradictions, and other similar perturbations.

创建时间:
2026-06-18
原始信息汇总

数据集概述

名称: Stressed SOTA Datasets
维护方: Santander AI Lab(西班牙桑坦德银行人工智能实验室)
目的: 提供评估机器学习与大型语言模型(LLM)系统鲁棒性的基准数据集集合。这些数据集为知名公开数据集的“受控压力版本”——对部分记录施加了经过定义和文档化的输入退化(“冲击”,包括噪声、缺失、歧义、格式更改、矛盾等),使社区能够自由重用。

当前收录数据集

数据集 母数据集(来源) 版本 状态 链接
Stressed German Credit Dataset UCI German Credit SGCD-v0.1 已发布 datasets/stressed_german_credit_dataset/

注:该集合为持续演进的集合,未来将逐步增加更多压力测试数据集。

目录结构

每个数据集位于 datasets/<数据集名称>/ 目录下,包含:

  • README.md
  • CHANGELOG.md
  • CITATION.cff
  • LICENSE
  • data/ 文件夹(存放数据与元数据)

每个数据集所施加的具体冲击/压力在该数据集文件夹内均有详细文档说明。

许可证与引用

  • 双许可证
    • 数据与文档:遵循 CC BY 4.0 许可证。每个数据集与其母数据集使用相同许可证(集合默认:CC BY 4.0)。
    • 源代码:遵循 Apache License 2.0(适用于 .github/scripts/ 下的验证工具以及 .github/workflows/ 下的 CI 工作流)。
  • 引用要求:必须同时标注原始来源数据集 Santander AI Lab。引用集合时使用根目录下的 CITATION.cff;引用单个数据集时使用其文件夹内的 CITATION.cff

贡献与安全

  • 该集合由 Santander AI Lab 策划管理,数据文件通过文档化的方法再生,非手工编辑。
  • 欢迎提交问题报告(数据问题、归属问题、文档问题)以及新数据集提案(详见 CONTRIBUTING.md)。
  • 若发现任何隐私问题,请遵循 SECURITY.md 进行私下报告(勿公开提交 issue)。
搜集汇总
数据集介绍
Stressed German Credit Dataset 数据集图片
构建方式
Stressed German Credit Dataset 源自经典的 UCI German Credit 数据集,由 Santander AI Lab 在原始数据基础上,通过系统性施加可控的输入退化(即“冲击”),包括噪声注入、缺失值引入、语义模糊、格式变更及矛盾信息植入等方式,对部分记录进行破坏性改造,形成压力测试版本。每个数据记录均经过精心设计的扰动,旨在模拟现实环境中数据质量下降的极端场景,从而为评估机器学习与大型语言模型的鲁棒性提供标准化基准。
特点
该数据集最显著的特点在于其双重属性:既保留了原始 German Credit 数据集的标签与结构完整性,又通过文档化的冲击策略引入了可量化的数据退化。每个扰动模式均被明确记录,支持研究者精确控制分析变量。作为不断演进的集合的一部分,该版本(SGCD-v0.1)聚焦于信用风险评估领域,为模型在恶劣数据条件下的表现提供了首次公开的对抗性测试资源。
使用方法
用户可直接从 GitHub 仓库的 datasets/stressed_german_credit_dataset/data 目录获取 CSV 格式的数据文件,随附详细的元数据说明与冲击日志。使用时需遵循 CC BY 4.0 许可协议,同时标注原始 UCI German Credit 数据集与 Santander AI Lab 的贡献。该资源特别适合作为基准测试套件,用于比较不同模型在受控数据退化下的鲁棒性差异,或开发专门应对低质量输入数据的预处理与训练策略。
背景与挑战
背景概述
Stressed German Credit Dataset 是由 Santander AI Lab 于近期发布的基准数据集,旨在评估机器学习与大型语言模型在面对输入数据退化时的鲁棒性。该数据集基于经典的 UCI German Credit 数据集,通过引入可控且文档化的“冲击”(如噪声、缺失值、歧义、格式变更及矛盾信息)对部分记录进行退化处理,从而构建出具有挑战性的压力测试版本。其核心研究问题聚焦于探究模型在非理想输入条件下的表现稳定性,填补了现有基准在系统评估数据扰动影响方面的空白。作为 Santander AI 开源生态的一部分,该数据集为金融风控、信用评估等高风险领域提供了关键评估工具,有望推动鲁棒性研究的发展,并促进更可信赖的 AI 系统构建。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,传统信用风险评估模型往往在理想数据条件下表现优异,但真实场景中数据常受噪声、缺失或格式错误等干扰,导致模型预测可靠性骤降。Stressed German Credit Dataset 旨在模拟这些现实中的退化情形,从而挑战模型在恶劣环境下的泛化能力与判别稳定性。在构建过程中,挑战在于如何设计既具有代表性又不失可重复性的“冲击”方案,确保退化程度的标准化与可解释性,同时避免过度改变原始数据的统计特性。此外,需要平衡扰动强度与真实场景的契合度,保证数据集既能暴露模型脆弱性,又不脱离实际应用背景,从而为基准比较提供公平且富有洞察力的评价基础。
常用场景
经典使用场景
Stressed German Credit Dataset作为经受过系统化输入扰动的基准测试集合,最经典的使用场景在于评估机器学习模型与大型语言模型在非理想数据条件下的鲁棒性。研究者通过向原始德国信用数据集中的部分记录施加可控的噪声、缺失值、语义歧义、格式变化乃至信息矛盾等‘冲击’,构建出一个具有挑战性的压力测试环境。该数据集特别适用于信贷风控领域的模型稳健性验证,能够揭示模型在遭遇数据质量退化时的性能衰减规律,为开发更具韧性的信用评分算法提供标准化评估平台。
解决学术问题
该数据集精准回应了学术界长期关注的模型鲁棒性量化评估难题。传统基准测试往往聚焦于干净数据下的性能指标,而忽略了真实场景中数据质量波动对模型可靠性的深刻影响。通过提供经过系统化、可复现的输入降质处理的公开版本,该数据集使研究者能够分离并量化不同类型的扰动对模型预测一致性的破坏程度,为鲁棒性理论的形式化验证和对比分析提供了不可或缺的实验基础,有力推动了风险管理领域对模型脆弱性的系统认知。
衍生相关工作
基于Stressed German Credit Dataset,后续研究已衍生出多项经典工作。研究者利用该数据集开展了对抗性鲁棒性训练方法的系统性对比实验,验证了多种数据增强技术在信用评分任务中的有效性。该数据集也被用于探索可解释性机器学习模型在压力条件下的决策行为,揭示了线性模型与复杂集成模型面对输入扰动时的不同退化模式。此外,围绕该数据集建立的冲击评估框架已被扩展至其他金融基准测试,形成了考量数据质量因素的标准化鲁棒性评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务