遇见数据集

DOUBLE_ENTRY_OBSERVABILITY_FOR_LLM_AGENTS

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

Double-Entry Observability for LLM Agents 是一个小型的、仅包含数据的基准测试数据集,旨在评估模型编写的行动分类账作为LLM代理工作流中的补充可观测性层。该数据集完全由合成数据构成,包含所有场景、身份、消息和工具效果,不执行任何真实的外部操作。数据以 JSONL 格式存储,每一行代表一个完整的工作流。每个工作流以标准的聊天结构开始,包含系统消息和用户消息,随后定义了可用工具、合成起始状态、参考函数调用、日志记录规则、执行限制和评估标准。数据集分为两个分割:验证集(validation)包含 3 个工作流和 50 个普通调用,用于开发和初步评估;测试集(test)包含 1 个工作流和 19 个普通调用,该分割数据完整但从未被端到端执行过,因此作为保留规范。数据集还提供了详细的日志契约,要求每个普通函数调用后立即跟随一个日志调用,记录调用的ID、工具名称、请求行为和结果。此外,数据集包含结构检查工具和验证器,可用于确保数据格式正确。该数据集适用于评估LLM代理在行动记账和日志记录方面的行为,但不直接用于建立欺骗、意图或一般性错位。

Double-Entry Observability for LLM Agents is a small, data-only benchmark dataset designed to evaluate the models action ledger as a complementary observability layer in LLM agent workflows. The dataset is entirely synthetic, containing all scenarios, identities, messages, and tool effects, and does not perform any real external operations. The data is stored in JSONL format, with each line representing a complete workflow. Each workflow begins with a standard chat structure containing system messages and user messages, followed by definitions of available tools, synthetic initial states, reference function calls, logging rules, execution constraints, and evaluation criteria. The dataset is split into two partitions: the validation set contains 3 workflows and 50 ordinary calls for development and preliminary evaluation; the test set contains 1 workflow and 19 ordinary calls, which is complete but has never been end-to-end executed, thus serving as a held-out specification. The dataset also provides a detailed logging contract, requiring each ordinary function call to be immediately followed by a log call recording the calls ID, tool name, request behavior, and result. Additionally, the dataset includes structure checking tools and validators to ensure data format correctness. This dataset is suitable for evaluating the behavior of LLM agents in action accounting and logging, but is not directly used for establishing deception, intent, or general misalignment.

创建时间:
2026-08-26
原始信息汇总

数据集概述

Double-Entry Observability for LLM Agents 是一个用于测试模型自主编写操作分类账(action ledger)作为长LLM代理工作流中补充可观测性层的基准数据集。该数据集仅包含数据,所有场景、身份、消息和工具效果均为合成生成,不执行任何真实的外部操作。

核心研究问题

比较模型编写的操作分类账与权威环境分类账,是否能在普通运行时遥测之外提供额外的诊断信号。该基准不主张替代权威遥测,而是衡量对比模型自编分类账是否能增加关于操作核算、执行和任务结果的诊断信息。

数据格式

  • 采用 JSONL 格式,每行代表一个完整的工作流。
  • 每行以熟悉的聊天结构 messages 开头(包含 rolecontent)。
  • 其余字段定义可用工具、合成初始状态、参考函数调用、日志规则、执行限制和评估标准。
  • 详细的字段解释及模型/运行器/评估器边界说明见 data_structure.md,精确机器可读格式由 schemas/workflow-v2.schema.json 记录。

数据划分

划分 工作流数 普通调用数 用途
validation 3 50 开发和试点评估
test 1 19 保留集,尚未可运行
  • test 划分数据完整但从未端到端执行过,其 production-outage-customer-coordination-v1 工作流声明了14个普通工具,但参考运行时仅为三个验证工作流实现了模拟器,因此运行会提前停止。
  • 可读的缩进JSON副本提供于 data/readable/test.jsondata/readable/validation.json.jsonl 文件为基准源文件。

日志契约

  • 参考轨迹中的每个普通函数调用后必须紧跟一次 log_action 调用,重复调用ID、工具名称、请求行为和结果。
  • 被拒绝和失败的尝试也必须记录。log_action 不会记录自身,防止无限日志循环。
  • 参考轨迹是有效示例而非唯一解决方案。
  • 轨迹条目上的 issue_tags 标记代理可能出错的位置,每个标签以 *_opportunity 后缀结尾,对应工作流评估中 incident_opportunities 的条目。
  • 反向不成立:incident_opportunities 列出所有预期出错方式,而 issue_tags 仅标记参考路径经过的点。覆盖率为:采购3/4、日历3/4、供应商安全2/4、中断工作流2/5。应以 incident_opportunities 作为评估面。

加载方式

使用 Hugging Face Datasets 库,通过 load_dataset 函数分别加载 data/validation.jsonldata/test.jsonl 文件。

结构检查

使用 jsonschema 库的独立验证器,通过 python3 validate_dataset.py 命令检查JSON语法、v2模式、唯一标识符、声明工具、执行限制、普通调用/行为日志对以及有状态结构化报告规则。有效文件退出码为 0,存在结构问题时为 1

结果说明

  • 早期探索性试点已撤回,因其运行存在两个缺陷:日志质量仅按单一分数衡量,忽略了日志顺序要求;实验清单未记录运行时版本和依赖信息,导致无法复现。
  • 参考运行器已修复上述问题,派生分析现在将 内容一致性协议合规性 作为独立指标报告,清单记录代码修订版、脏工作树标志、Python及依赖版本、执行限制、令牌使用和分类终止原因。
  • 替代试点尚未运行,未来完整的原始事件、对话、清单、派生运行和分析将发布在此处,并说明具体模型、采样设置和数据集提交版本。
  • 预先说明两个限制:两个工作流使用参考轨迹和隐藏状态中存在但无法通过代理工具发现的规范标识符,结果诊断基准可访问性而非模型能力;运行时不会请求、解析或使用推理轨迹作为证据,模型内联发出的推理文本会原样记录,但视为原始提供者输出而非证据渠道。

局限性

四个工作流是试点数据,不代表生产代理任务的代表性样本。参考轨迹是撰写的示例而非观察到的LLM输出。该数据集可测试可观测的任务和日志行为,但本身不能确立欺骗、意图或一般的对齐问题。

许可

数据集采用 MIT 许可证。

搜集汇总
数据集介绍
DOUBLE_ENTRY_OBSERVABILITY_FOR_LLM_AGENTS 数据集图片
构建方式
该数据集以JSONL格式构建,每一行代表一个完整的工作流,包含消息序列、可用工具、合成初始状态、参考函数调用、日志规则、执行限制与评估标准。数据分为验证集和测试集,验证集包含3个工作流,测试集包含1个工作流,均通过schema文件定义机器可读格式,并配备独立验证器以符合v2 schema、唯一标识、工具声明、执行限制等结构要求。
特点
数据集特色在于其双重记账可观测性设计,即模型生成的行动账本与权威环境账本的对比诊断信号。每个普通函数调用后必须紧跟log_action记录,拒绝和失败尝试也需记录,且log_action自身不被记录以避免无限循环。issue_tags标记参考路径上的潜在错误点,但incident_opportunities全面覆盖所有预期错误事件,两者映射关系非一一对应,评估时以incident_opportunities为准。
使用方法
使用方法包括通过Hugging Face Datasets库加载数据文件,或使用提供的验证器检查数据完整性。运行基准测试时,需参照data_structure.md理解字段含义,并注意测试集因缺少模拟器而不可运行。数据集仅支持观测任务和日志行为,不用于推断欺骗或意图,结果需分别报告内容一致性和协议合规性,并记录运行环境以保证可复现性。
背景与挑战
背景概述
随着大语言模型(LLM)在复杂工作流中的广泛应用,其可观测性成为保障系统可靠性与安全性的关键议题。传统遥测技术虽能记录系统状态,却难以揭示模型决策的深层逻辑。为此,该数据集于2023年由匿名研究团队构建,聚焦于'双重记账'式可观测性——即比较模型自主生成的行动台账与环境权威台账,以诊断长周期LLM代理工作流中的执行偏差与会计漏洞。其核心研究问题在于验证该比较方法能否提供超越常规遥测的额外诊断信号。作为一个小型合成基准,它涵盖四个工作流场景,并附带完善的日志契约与验证工具,为代理可观测性研究提供了独特的实验平台,推动了该领域向更细粒度的行为审计方向发展。
当前挑战
该数据集直面多重挑战。领域层面,LLM代理在长时间运行中可能产生未被记录的隐性操作(如拒绝调用或伪造批准),传统遥测难以捕捉这类行为,而双重记账比较旨在揭示此类偏差,但需设计严格的日志契约(如日志调用不得自递归)与详尽的事件标记体系。构建中,团队需确保合成数据既真实又安全,同时规避外部副作用;参考轨迹需标注潜在出错点(issue_tags),并与评估中的事故机会对应,但覆盖度因工作流而异(如采购场景为3/4)。此外,早期试点因度量缺陷与不可复现性被撤回,迫使团队重构评估指标(分为内容一致性与协议合规性)并完善运行记录,但测试集尚未执行完毕,限制了基准的即时可用性。
常用场景
经典使用场景
该数据集专注于评估大型语言模型(LLM)在长周期agent工作流中的可观测性,其核心场景是验证模型撰写的动作账本(action ledger)与权威环境账本(environment ledger)之间的对比是否能为运行时遥测提供补充诊断信号。通过模拟采购、日历管理、供应商安全及生产中断协调等合成工作流,数据集要求模型在调用工具的同时记录行为日志,并依据协议合规性和内容一致性进行评估。它适用于测试agent遵循日志契约的能力,以及识别工作流中潜在的异常事件。
实际应用
在实际应用中,该数据集可用于开发和验证生产级LLM agent的监控工具,例如在客户服务、企业资源规划或安全合规等场景中,确保agent的每一步操作都有据可查。它帮助工程师测试日志基础设施的鲁棒性,并调整模型提示或日志策略以增强透明度。此外,它也可作为模拟环境,用于训练模型在动态任务中同时兼顾执行与记录,从而减少因信息缺失导致的责任追溯困难,提升系统运维效率。
衍生相关工作
围绕此基准已衍生出多项相关工作,包括改进agent运行时监控框架、开发基于双账本对比的异常检测算法,以及设计更严格的日志契约以提升模型遵循度。该数据集也激励了关于模型是否能够通过日志来“掩盖”或“遗漏”关键行为的讨论,推动了可解释AI和agent对齐的研究。未来工作可能包括扩展更多复杂工作流,或将其作为多模态事件记录的测试床,以深化对LLM决策过程的可信度评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务