遇见数据集

Universal AI Failure Database (UAIFD)

收藏
github2026-06-22 更新2026-06-26 收录
官方服务:

资源简介:

Universal AI Failure Database (UAIFD) 是一个结构化、开放访问的集合,记录了AI语言模型(LLMs)和其他AI系统在现实世界中失败的实例。它旨在为AI安全研究人员提供可复现的基准,支持对模型鲁棒性的系统评估,作为开发者和审计人员的红队资源,通过具体失败案例为政策和法规提供信息,并支持AI对齐、可解释性和可靠性方面的学术研究。

The Universal AI Failure Database (UAIFD) is a structured, openly accessible collection that documents real-world failure instances of large language models (LLMs) and other AI systems. It aims to provide reproducible benchmarks for AI safety researchers, support systematic evaluations of model robustness, serve as red-teaming resources for developers and auditors, inform policy and regulatory frameworks via concrete failure cases, and advance academic research on AI alignment, interpretability and reliability.

创建时间:
2026-06-21
原始信息汇总

数据集概述:Universal AI Failure Database (UAIFD)

Universal AI Failure Database (UAIFD) 是一个开源、社区驱动的结构化数据库,旨在收集和整理人工智能模型(特别是大型语言模型)在实际应用中出现的各类失败案例。

核心目标

  • 为AI安全研究人员提供可复现的基准测试。
  • 支持对模型鲁棒性的系统性评估。
  • 作为开发者与审计者的红队测试资源。
  • 为政策制定和监管提供具体的失败案例依据。
  • 支持AI对齐、可解释性和可靠性领域的学术研究。

数据规模与覆盖范围

  • 总条目数: 超过505条。
  • 覆盖模型数量: 18种不同的AI模型。
  • 代表性提供商: OpenAI、Anthropic、Google、Meta、Mistral、Cohere等。
  • 时间范围: 2020年至今。
  • 严重程度分布: 严重 (12%)、高 (38%)、中 (33%)、低 (17%)。
  • 验证率: 94%的条目已通过独立验证。

失败类别

数据集将失败案例分为五大核心类别,并提供详细的JSON Schema:

  • 🌀 幻觉: 自信地做出虚假陈述、捏造引用或编造事实(现有120+条)。
  • 🔢 数学错误: 包括算术、代数、微积分和概率计算错误(现有90+条)。
  • 🧩 逻辑错误: 包括错误推理、无效推断和逻辑矛盾(现有85+条)。
  • ⚖️ 法律错误: 包括错误引用案例、错误陈述法律条文及管辖权错误(现有70+条)。
  • 🔒 安全漏洞: 包括提示注入、越狱攻击、数据提取和安全绕过(现有140+条)。

数据格式与使用

  • 格式: 每个失败条目均遵循严格的JSON Schema,包含ID、类别、模型信息、输入提示、模型回复、失败分析、影响评估和缓解措施等字段。
  • 访问方式:
    • 在线浏览: 直接访问GitHub仓库中的data/子目录。
    • 本地克隆与查询: 支持通过Python工具(tools/query.py)按模型、类别、严重程度等进行搜索,并支持导出为CSV格式。
    • 条目验证: 可使用tools/validate.py工具验证新条目是否符合Schema。

主要应用场景

  • AI研究人员: 可用于基准测试、训练检测幻觉/逻辑错误的分类器、分析失败模式分布。
  • 开发人员与工程师: 可将数据集集成至CI/CD流水线,用于应用程序的红队测试以及构建安全护栏。
  • 政策制定者与审计者: 可引用具体失败案例用于监管文件,评估已部署AI系统的风险。
  • 教育工作者: 可用于教学,展示AI的局限性。

许可与贡献

  • 许可: 代码与工具采用MIT许可;数据集条目采用CC0 1.0 Universal(公共领域)许可。
  • 贡献: 欢迎社区通过提交Pull Request贡献新的失败条目、验证现有条目、改进工具或翻译文档。所有提交需遵循特定的JSON Schema及提交清单,确保不包含个人身份信息。

引用

如果在研究中使用了UAIFD,请使用以下BibTeX格式进行引用:

bibtex @misc{uaifd2025, title = {Universal AI Failure Database (UAIFD)}, author = {Plesca, Ciprian Stefan and Contributors}, year = {2025}, howpublished = {url{https://github.com/yourusername/universal-ai-failure-database}}, note = {Open-source dataset of documented AI model failures}, license = {MIT / CC0-1.0} }

搜集汇总
数据集介绍
Universal AI Failure Database (UAIFD) 数据集图片
构建方式
UAIFD的构建源于对AI系统安全性系统性审视的迫切需求,旨在弥补现有知识体系中对于模型失败案例碎片化记录的空白。该数据集采用开源社区协作模式精心打造,通过结构化的方式收集并整理了来自OpenAI、Anthropic、Google等主流大语言模型及其他AI系统的真实失败实例。每一条失败记录均遵循严格统一的JSON模式,详尽记录失败类型(如幻觉、数学错误、逻辑谬误、法律误差及安全漏洞)、模型信息、触发提示词、模型输出、失败分析、影响评估与缓解策略等核心字段。为确保数据质量与可信度,UAIFD要求所有条目必须经过实质性与可验证的失败分析,并设有独立的验证流程,目前验证率高达94%。
特点
UAIFD最引人瞩目的特点在于其系统性的失败分类架构与高度的互操作性。数据集将AI失败精心划分为五大核心类别,涵盖从基础的数学运算错误到复杂的逻辑推理谬误,乃至严峻的安全漏洞,实现了对模型失效模式的全景式覆盖。每条记录都携带丰富的元数据,如严重等级、模型版本及验证状态,并通过严格的JSON模式保障了不同工具与场景下的数据兼容性。更为可贵的是,UAIFD不仅是一个静态的数据库,更作为一个动态生长的社区资源存在,支持研究者、开发者与政策制定者深入探究AI系统的脆弱性边界,其标准化与可复现的设计,为行业安全基准的建立铺设了坚实的实证基石。
使用方法
UAIFD的使用路径展现出卓越的便捷性与灵活性,可满足多元用户群体的不同需求。研究者与开发者可通过简单的Git克隆命令将完整数据集部署至本地环境,并利用内置的查询工具以多种维度(如模型名称、失败类别、严重程度)进行精确检索与数据分析。该工具支持对特定失败模式的深度挖掘、全文搜索以及结果导出为CSV格式,极大便利了后续的统计分析。对于希望参与数据扩充的贡献者,项目提供了专用的验证工具以检查新条目是否符合规范模式。此外,UAIFD可无缝集成至CI/CD流水线中用于回归测试,亦可作为红队测试与评估课程设计的核心资源,其开放许可模式更是消除了学术与商业应用中的法律障碍。
背景与挑战
背景概述
随着大型语言模型(LLMs)在医疗、法律、金融等高风险领域的广泛应用,其可靠性问题日益凸显。为了系统性地记录与分析AI系统背离预期行为的现象,由Ciprian Stefan Plesca主导,联合全球社区贡献者于2024年创建了通用AI失败数据库(UAIFD)。该数据集聚焦于AI模型在幻觉、数学错误、逻辑谬误、法律误判及安全漏洞等关键维度的失败案例,旨在为人工智能安全研究、模型鲁棒性评估及政策法规制定提供可复现的实证基准。作为首个社区驱动的开放式AI失败案例知识库,UAIFD已收录超过500条验证案例,覆盖18种主流模型,对推动AI对齐、可解释性与可靠性等前沿领域研究具有里程碑意义。
当前挑战
UAIFD面临的核心挑战涵盖领域问题与构建过程两方面。在领域问题层面,当前AI系统普遍存在“能力与可靠性悖论”——模型在复杂任务上表现越强,其隐蔽失败(如幻想引用、逻辑矛盾)的破坏性也越大,而现有基准测试多聚焦于理想性能,缺乏对失败模式的系统化、标准化捕获,导致开发者难以提前预判模型在真实场景中的风险边界。在数据集构建过程中,挑战尤为严峻:失败案例的主动发现依赖社区贡献,但低发生率与高隐蔽性特征使案例采集效率低下;跨模型、跨版本失败模式的统一分类体系设计需兼顾详尽性与互操作性;每条记录须经独立核查以确保证据链完备,但人工验证成本高昂且存在时间滞后;此外,如何在不泄露活跃攻击载荷的前提下披露安全漏洞,亦是伦理与工程之间的艰难平衡。
常用场景
经典使用场景
在人工智能安全与对齐研究领域,UAIFD作为结构化、可复现的基准测试集,被广泛应用于评估大语言模型在幻觉、逻辑谬误、数学运算、法律判定及安全漏洞等维度的鲁棒性。研究者可依据其详尽的JSON条目,对GPT-4、Claude等主流模型进行系统性压力测试,量化其失败模式在不同模型家族间的分布差异,从而推动模型薄弱环节的识别与改进。
衍生相关工作
UAIFD的出现催生了一系列衍生研究,包括基于该数据集的幻觉检测分类器训练、逻辑错误自动识别模型开发,以及针对失败模式分布的分析工具构建。研究者还借鉴其条目格式与验证流程,建立了面向特定领域(如医疗、司法)的专用失败数据库,推动了AI安全评测从通用向场景化的纵深发展。
数据集最近研究
最新研究方向
随着大语言模型在医疗、法律、金融等高风险领域的深度渗透,模型幻觉、逻辑谬误与安全漏洞等失效模式的系统性研究已成为AI可信任落地的核心瓶颈。Universal AI Failure Database (UAIFD) 正是在此背景下诞生的社区驱动型开放资源,它首次以结构化、可复现的方式收录了超过500例涵盖幻觉、数学错误、法律失准及越狱攻击等维度的真实失败案例。该数据集的前沿价值体现在三个层面:为红队测试与鲁棒性基准测试提供了标准化语料库,使研究者能够跨模型家族对比失效分布;通过细粒度JSON模式(包括严重性分级与可验证的分析元数据)支撑起AI对齐与可解释性的实证研究;其94%的独立验证率与CC0公共领域许可,直接助力政策制定者将具体失败实例纳入合规框架。当前研究热点正从单纯记录失效转向利用该库训练失效检测分类器、构建CI/CD回归测试管线,以及建立AI系统风险画像的基线度量——标志着AI安全从原则性讨论迈向数据驱动的工程化纠偏时代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务