ai-agent-failure-logs
收藏资源简介:
该数据集记录了由本地 LLM 驱动的自主 AI 代理组织在生产环境中运行 43 天(2026-06-24 至 2026-08-06)期间发生的 576 个真实失败案例。每个案例均为实际生产环境中的失败,而非合成示例。数据集包含 5 个失败类别:contract_violation(合同违反,478 条)、scheduler_starvation(调度饥饿,26 条)、language_corruption(语言污染,26 条)、process_error(进程错误,24 条)和 timeout(超时,22 条)。数据以 JSON 行格式存储,每条记录包含以下字段:source(来源子系统)、at(时间戳,UTC)、stage(失败的工作阶段)、failure_class(失败类别)、violations(违反的合同条款)、violation_types(违反的具体类型,如 too_short、missing_required、not_japanese 等)、detail(失败详情)、duration_sec/duration_ms(运行时长)、model(使用的模型)。该数据集适用于需要了解 LLM 代理实际运行中破坏模式的团队,以及需要真实失败案例来测试护栏(guardrails)的工程师。 注意:该数据集仅来自一个组织,可能不具泛化性;文本字段可能为日语;不涉及任何关于采纳、客户或收入的声明。
This dataset records 576 real failure cases that occurred during 43 days (2026-06-24 to 2026-08-06) of production operation of an autonomous AI agent organization powered by a local LLM. Each case is a real production failure, not a synthetic example. The dataset contains 5 failure categories: contract_violation (478 entries), scheduler_starvation (26 entries), language_corruption (26 entries), process_error (24 entries), and timeout (22 entries). Data is stored in JSON lines format, with each record containing the following fields: source (subsystem), at (timestamp, UTC), stage (failure stage), failure_class (failure category), violations (violated contract terms), violation_types (specific violation types, such as too_short, missing_required, not_japanese, etc.), detail (failure details), duration_sec/duration_ms (runtime), and model (model used). The dataset is suitable for teams wanting to understand failure modes of LLM agents in real operation, and engineers needing real failure cases to test guardrails. Note: The dataset comes from only one organization, may not be generalizable; text fields may be in Japanese; no claims about adoption, customers, or revenue are made.
自主AI代理故障日志数据集
数据集概述
本数据集记录了在本地大语言模型上运行的自主AI代理组织在生产环境中发生的真实故障记录,共包含 620条 故障记录,覆盖时间范围为 2026年6月24日至2026年8月6日(共43天),涵盖 5种 故障类别。所有记录均为实际生产中发生的故障,非合成示例。
数据集背景
该数据集源于一个观察现象:监控显示AI代理运行成功,资源利用率维持在97-100%,但实际交付成果为零。这些故障均未返回错误,具有合理的长度和形态,包括:被记录为交付成果的拒绝、通过长度检查的回避性回答、答非所问、错误语言流利文本、虚构字段名等,这些故障无法通过追踪工具识别。
适用人群
- 在生产环境中运行LLM代理的团队,希望了解实际故障模式
- 构建护栏工具的工程师,需要真实故障案例进行测试
数据内容
字段说明
每条记录为一行JSON对象,包含以下字段:
| 字段 | 说明 |
|---|---|
source |
记录来源子系统(task_execution 或 local_inference) |
at |
时间戳(UTC) |
stage |
失败的工作类型 |
failure_class |
故障类别 |
violations |
被违反的合同条款记录 |
violation_types |
稳定的机器可读违规类型名称 |
detail |
故障详情 |
duration_sec / duration_ms |
失败前运行时长 |
model |
使用的模型 |
违规类型统计
| 类型 | 数量 | 含义 |
|---|---|---|
too_short |
209 | 输出短于合同要求(通常在推理上耗费预算后为空) |
missing_required |
209 | 缺少必需标记(裁决行、标题、字段) |
not_japanese |
56 | 要求日语输出但未返回任何假名 |
chinese_in_japanese |
39 | 日语输出中出现纯中文字符 |
other |
26 | 已记录但尚未分类 |
unearned_claim |
20 | 声称公司不拥有的客户、采用数字或夸大用语 |
broken_language_mix |
18 | 日语和英语混杂成非任何语言 |
refusal |
10 | 拒绝被记录为交付成果 |
reasoning_leaked |
9 | 内部推理泄漏到交付内容中 |
answer_to_other_question |
3 | 返回另一任务答案(跨槽位提示缓存重用) |
forbidden_present |
1 | 出现合同明确禁止的文本 |
无类型记录 316条:包括流程故障、超时,以及2026年8月5日之前的未记录原因记录。
故障类别统计
| 类别 | 数量 | 含义 |
|---|---|---|
contract_violation |
520 | 输出不满足合同要求(长度、必需标记、格式、语言) |
scheduler_starvation |
26 | 工作待处理但调度器无法拾取 |
language_corruption |
26 | 输出语言混杂或泄漏其他语言字符 |
process_error |
24 | 推理进程启动失败或异常退出 |
timeout |
24 | 推理超过时间限制被终止 |
局限性
- 首个小规模发布:仪器化于2026年8月3日添加,时间窗口为43天,早前运行未以该形式记录。
- 全部记录来自 单一组织,可能不具备普遍性。
- 文本字段以系统记录时的日语为准。
- 数据集不包含任何关于采用、客户或收入的声明。
数据生成方式
由scripts/build-failure-dataset.js脚本读取原始运维日志生成,计数和日期由脚本自动计算,非人工编写。数据集生成于2026年8月7日08:53:23(日本标准时间)。





