遇见数据集

ai-agent-failure-logs

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集记录了由本地 LLM 驱动的自主 AI 代理组织在生产环境中运行 43 天(2026-06-24 至 2026-08-06)期间发生的 576 个真实失败案例。每个案例均为实际生产环境中的失败,而非合成示例。数据集包含 5 个失败类别:contract_violation(合同违反,478 条)、scheduler_starvation(调度饥饿,26 条)、language_corruption(语言污染,26 条)、process_error(进程错误,24 条)和 timeout(超时,22 条)。数据以 JSON 行格式存储,每条记录包含以下字段:source(来源子系统)、at(时间戳,UTC)、stage(失败的工作阶段)、failure_class(失败类别)、violations(违反的合同条款)、violation_types(违反的具体类型,如 too_short、missing_required、not_japanese 等)、detail(失败详情)、duration_sec/duration_ms(运行时长)、model(使用的模型)。该数据集适用于需要了解 LLM 代理实际运行中破坏模式的团队,以及需要真实失败案例来测试护栏(guardrails)的工程师。 注意:该数据集仅来自一个组织,可能不具泛化性;文本字段可能为日语;不涉及任何关于采纳、客户或收入的声明。

This dataset records 576 real failure cases that occurred during 43 days (2026-06-24 to 2026-08-06) of production operation of an autonomous AI agent organization powered by a local LLM. Each case is a real production failure, not a synthetic example. The dataset contains 5 failure categories: contract_violation (478 entries), scheduler_starvation (26 entries), language_corruption (26 entries), process_error (24 entries), and timeout (22 entries). Data is stored in JSON lines format, with each record containing the following fields: source (subsystem), at (timestamp, UTC), stage (failure stage), failure_class (failure category), violations (violated contract terms), violation_types (specific violation types, such as too_short, missing_required, not_japanese, etc.), detail (failure details), duration_sec/duration_ms (runtime), and model (model used). The dataset is suitable for teams wanting to understand failure modes of LLM agents in real operation, and engineers needing real failure cases to test guardrails. Note: The dataset comes from only one organization, may not be generalizable; text fields may be in Japanese; no claims about adoption, customers, or revenue are made.

创建时间:
2026-08-05
原始信息汇总

自主AI代理故障日志数据集

数据集概述

本数据集记录了在本地大语言模型上运行的自主AI代理组织在生产环境中发生的真实故障记录,共包含 620条 故障记录,覆盖时间范围为 2026年6月24日至2026年8月6日(共43天),涵盖 5种 故障类别。所有记录均为实际生产中发生的故障,非合成示例。

数据集背景

该数据集源于一个观察现象:监控显示AI代理运行成功,资源利用率维持在97-100%,但实际交付成果为零。这些故障均未返回错误,具有合理的长度和形态,包括:被记录为交付成果的拒绝、通过长度检查的回避性回答、答非所问、错误语言流利文本、虚构字段名等,这些故障无法通过追踪工具识别。

适用人群

  • 在生产环境中运行LLM代理的团队,希望了解实际故障模式
  • 构建护栏工具的工程师,需要真实故障案例进行测试

数据内容

字段说明

每条记录为一行JSON对象,包含以下字段:

字段 说明
source 记录来源子系统(task_executionlocal_inference
at 时间戳(UTC)
stage 失败的工作类型
failure_class 故障类别
violations 被违反的合同条款记录
violation_types 稳定的机器可读违规类型名称
detail 故障详情
duration_sec / duration_ms 失败前运行时长
model 使用的模型

违规类型统计

类型 数量 含义
too_short 209 输出短于合同要求(通常在推理上耗费预算后为空)
missing_required 209 缺少必需标记(裁决行、标题、字段)
not_japanese 56 要求日语输出但未返回任何假名
chinese_in_japanese 39 日语输出中出现纯中文字符
other 26 已记录但尚未分类
unearned_claim 20 声称公司不拥有的客户、采用数字或夸大用语
broken_language_mix 18 日语和英语混杂成非任何语言
refusal 10 拒绝被记录为交付成果
reasoning_leaked 9 内部推理泄漏到交付内容中
answer_to_other_question 3 返回另一任务答案(跨槽位提示缓存重用)
forbidden_present 1 出现合同明确禁止的文本

无类型记录 316条:包括流程故障、超时,以及2026年8月5日之前的未记录原因记录。

故障类别统计

类别 数量 含义
contract_violation 520 输出不满足合同要求(长度、必需标记、格式、语言)
scheduler_starvation 26 工作待处理但调度器无法拾取
language_corruption 26 输出语言混杂或泄漏其他语言字符
process_error 24 推理进程启动失败或异常退出
timeout 24 推理超过时间限制被终止

局限性

  • 首个小规模发布:仪器化于2026年8月3日添加,时间窗口为43天,早前运行未以该形式记录。
  • 全部记录来自 单一组织,可能不具备普遍性。
  • 文本字段以系统记录时的日语为准。
  • 数据集不包含任何关于采用、客户或收入的声明。

数据生成方式

scripts/build-failure-dataset.js脚本读取原始运维日志生成,计数和日期由脚本自动计算,非人工编写。数据集生成于2026年8月7日08:53:23(日本标准时间)。

搜集汇总
数据集介绍
ai-agent-failure-logs 数据集图片
构建方式
本数据集源自一个运行于本地大型语言模型之上的自主AI代理组织,记录了其在2026年6月24日至8月6日期间43天内发生的620条真实生产故障记录。每条记录均为实际发生的失败案例,而非合成示例。构建过程通过脚本`scripts/build-failure-dataset.js`解析原始操作日志,生成每行一个JSON对象的数据文件。数据字段涵盖故障来源、时间戳、失败阶段、故障类别、违规详情、违规类型、持续时间及所用模型等关键信息,确保了数据结构的完整性与可追溯性。
特点
该数据集的核心特色在于揭示了传统监控工具无法察觉的‘隐性失败’——即输出看似正常但实际违反契约的案例,如回答偏离问题、语言混用或虚构内容等。数据集将故障细分为5个粗粒度类别和10种具体违规类型,其中`too_short`与`missing_required`占比最高,体现了模型在推理预算耗尽后输出空内容或缺乏关键标记的常见问题。所有违规类型命名稳定且跨语言一致,便于统计分析。此外,数据集的局限性明确标注,例如仅来自单一组织、部分记录缺乏类型标注,确保使用者能合理评估其泛化性。
使用方法
本数据集主要面向在生产环境中运行LLM代理的团队,以及构建防护措施的工程师,用于识别真实故障模式并测试防护机制。用户可直接通过HuggingFace平台加载数据,按字段筛选特定故障类别或违规类型,进行趋势分析或作为回归测试用例。配套发布的`honto-contract`检查器(MIT许可)可结合此数据集使用,验证其拒绝故障输出的有效性。数据以JSON行格式存储,便于集成到现有数据处理管道,支持自定义分析或机器学习模型的训练与评估。
背景与挑战
背景概述
自主AI代理系统在生产环境中的可靠性已成为大语言模型(LLM)应用落地的关键议题。2026年,由GXCafe团队发布的《Autonomous AI Agent Failure Logs》数据集,记录了本地LLM驱动的自治代理组织在43天(2026-06-24至2026-08-06)内的620条真实故障记录,覆盖5种故障类别。该数据集源于一个严峻的发现:尽管系统监控显示运行成功且利用率高达97-100%,但实际交付物为零,揭示了传统追踪工具无法捕捉的隐性失败模式。这些失败包括拒绝被记录为成果、长度检查通过但内容空洞、语言混用、推理泄漏等,构成了对LLM代理契约遵循性的系统性挑战。该数据集为构建防护机制(如honto-contract)提供了实证基础,对LLM运维(LLM-ops)和故障分析领域具有重要影响,是少数关注代理长期自主运行失败模式的开源资源。
当前挑战
该数据集所应对的核心挑战在于,LLM代理在无人监督下运行时的失败具有高度隐蔽性,故障不产生错误信号,却导致任务未完成,这突破了传统监控的盲区。具体挑战包括:其一,领域问题层面,代理输出的契约违反(如长度不足、缺失必需标记、语言错误)难以被流水线检测,且失败类型多样(如过度推理导致输出为空、日英混用、缓存复用引发答非所问),需要细粒度标注。其二,构建过程中,数据集仅覆盖单一组织的43天窗口,且早期记录缺乏类型标注,导致316条记录未分类,限制普适性;同时,文本字段涉及日英多语言,增加标注复杂度。这些挑战要求持续改进故障识别机制并扩大数据来源,以提升数据的代表性与可用性。
常用场景
经典使用场景
该数据集聚焦于自主人工智能代理在长时间无人值守运行中的失败日志,是智能体运维与可靠性工程领域难得的实战数据资源。其核心价值在于记录了620条真实生产环境下的失败案例,覆盖了从输出合约违反、语言混淆到调度饥饿、超时等五类典型故障。研究者可基于这些数据深入剖析LLM代理在无监督状态下的行为退化模式,训练失败检测模型,或用之基准测试智能体鲁棒性。尤其适合作为验证智能体框架、推理引擎及监测工具效能的标尺,推动代理系统从实验室原型走向稳健部署。
实际应用
在实际产业场景中,该数据集是构建智能体防护栏和运维监控体系的宝贵素材。工程团队可利用其中的违规类型(如too_short、missing_required、unearned_claim)训练自动化检查器,以拦截不合格交付物,提升内容质量与合规性。数据集同样适用于开发多语言代理的质量门禁,防止日文任务产生中文混入或语言破裂。对于运营自动化代理的组织,其故障时间线能指导调度器优化、超时策略调整及资源分配,显著减少无产出运行成本,是生产级LLM系统质量保障的核心参考。
衍生相关工作
该数据集催生了若干关键工作方向。其配套的honto-contract检查器即是直接产物,依据数据中提炼的合约违规类型构建了可复用的验证规则库。未来,研究人员可基于此数据开发细粒度失败分类模型,构建自动根因分析系统,或设计超前的质量预测算法。此外,数据中的语言混杂问题可启发多语言生成控制研究,而提示缓存导致的错误回答案例则为缓存安全机制的设计提供了反面教材。这些衍生工作共同推动了智能体失败模式库的建设,为LLM运维(LLMOps)领域奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务