遇见数据集

DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

这是一个用于测试LLM代理工作流中双录入行为日志记录的小型合成基准数据集。所有场景、身份、消息和工具效果均为人工生成,不执行任何真实的外部操作。数据以JSONL格式存储,每行代表一个完整的工作流。每个工作流包含标准的聊天消息结构(system和user角色),以及可用工具、合成起始状态、参考函数调用、日志规则、执行限制和评估标准等字段。数据集包含两个拆分:validation(3个工作流,50个普通调用)和test(1个工作流,19个普通调用)。日志契约要求每个普通函数调用后立即跟随一个log_action调用,记录调用ID、工具名称、请求行为和结果;拒绝和失败的尝试也必须记录,且log_action自身不记录以防止无限循环。每个轨迹条目中的issue_tags标记了代理可能出错的机会点。该数据集可用于评估LLM代理在长工作流中的日志记录行为,但仅作为试点数据,不能代表生产环境中的代理任务,且参考轨迹为手动编写,不直接反映模型欺骗、意图或失调。数据集采用MIT许可证。

This is a small synthetic benchmark dataset for testing double-entry behavior logging in LLM agent workflows. All scenarios, identities, messages, and tool effects are artificially generated, and no real external operations are performed. The data is stored in JSONL format, with each line representing a complete workflow. Each workflow contains standard chat message structures (system and user roles), as well as fields such as available tools, synthetic initial states, reference function calls, logging rules, execution constraints, and evaluation criteria. The dataset includes two splits: validation (3 workflows, 50 normal calls) and test (1 workflow, 19 normal calls). The logging contract requires that each normal function call be immediately followed by a `log_action` call, recording the call ID, tool name, request behavior, and result; rejected and failed attempts must also be logged, and `log_action` itself is not logged to prevent infinite loops. The `issue_tags` in each trajectory entry mark potential error points for the agent. This dataset can be used to evaluate the logging behavior of LLM agents in long workflows, but it is only a pilot dataset and does not represent production agent tasks. The reference trajectories are manually written and do not directly reflect model deception, intention, or misalignment. The dataset is licensed under MIT.

创建时间:
2026-08-26
原始信息汇总

数据集概述

名称:Double-Entry Logging for LLM Agent Production Issues

描述:这是一个用于测试长LLM代理工作流中双重记账行为(double-entry behavior logging)的小型、纯数据基准数据集。所有场景、身份、消息和工具效果均为合成数据,数据集本身不执行任何真实的外部操作。

基本信息

  • 语言:英语(en)
  • 许可证:MIT License
  • 规模:少于1K条数据(n<1K)
  • 任务类别:文本生成(text-generation)
  • 标签:benchmark、agents、tool-calling、synthetic、jsonl、safety

数据划分

划分 工作流数量 普通调用次数 用途
validation 3 50 开发和试点评估
test 1 19 端到端基准冒烟测试

数据格式

  • 数据采用JSONL格式,每行代表一个完整的工作流。
  • 每行以标准的聊天结构(messages字段)开始,包含systemuser角色。
  • 其余字段定义了可用工具、合成初始状态、参考函数调用、日志规则、执行限制和评估标准。
  • 详细的字段说明见data_structure.md,机器可读格式由schemas/workflow-v2.schema.json定义。
  • 为了便于阅读,另提供了缩进格式的JSON副本(data/readable/test.jsondata/readable/validation.json),内容与JSONL文件一致。

日志契约

  • reference_trace中的每个普通函数调用后必须紧跟着一个log_action调用。
  • 日志需重复普通调用的ID、工具名称、请求行为和结果。
  • 被拒绝和失败的尝试也必须记录日志。
  • log_action本身不记录日志,以避免无限日志循环。
  • 参考跟踪是有效示例之一,而非唯一解决方案。
  • issue_tags标记了代理可能出错的潜在点,每个标签以*_opportunity结尾,对应工作流evaluation.incident_opportunities中的条目。

加载方式

可使用Hugging Face Datasets库加载:

python from datasets import load_dataset

dataset = load_dataset( "json", data_files={ "validation": "data/validation.jsonl", "test": "data/test.jsonl", }, )

结构校验

数据集附带独立的验证器,基于jsonschema库:

  1. 安装依赖:pip install -r requirements.txt
  2. 运行验证:python3 validate_dataset.py data/test.jsonlpython3 validate_dataset.py data/validation.jsonl(也可检查可读JSON文件)
  3. 验证内容包括:JSON语法、v2模式、唯一标识符、声明的工具、执行限制、必需的普通调用/行为日志对,以及状态性结构化报告规则(如先打开文档再使用、引用每条报告声明)。
  4. 有效文件退出码为0,发现问题时退出码为1

局限性

  • 四个工作流属于试点数据,不代表生产环境代理任务的典型样本。
  • 参考跟踪是作者编写的示例,并非观察到的LLM输出。
  • 该数据集可测试可观察的任务和日志行为,但本身不能证明欺骗、意图或一般性失调。
搜集汇总
数据集介绍
DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK 数据集图片
构建方式
本数据集专为评估大语言模型代理在长周期工作流中的可观测性而设计,通过合成方式构建了四个典型工作流场景,涵盖采购、日历、供应商安全及生产故障协调等关键业务领域。每个工作流均以JSONL格式存储,包含完整的对话结构、可用工具定义、合成初始状态、参考函数调用序列、日志规则、执行限制及评估标准。数据严格遵循预定义的JSON Schema,并配备独立验证器以确保格式正确性和逻辑一致性。参考轨迹中每个普通函数调用后紧跟日志记录,且日志不记录自身,避免无限循环。测试集特意保留为未运行状态,作为未来的预留规范,以检验模型的泛化能力。
特点
该数据集的核心特点在于引入模型书写的动作账本与环境权威账本的双重记录机制,通过对比两者提供超越常规遥测的诊断信号。其独特之处在于区分'内容一致性'和'协议合规性'两个独立评估维度,并采用'incident_opportunities'作为全面评估面,'issue_tags'作为导航提示,清晰界定覆盖面与映射关系。数据集强调合成性质,所有场景均为虚构,无真实外部动作,确保安全性。此外,其设计严谨,参考运行时记录完整重现所需的代码版本、依赖及环境参数,保证实验可复现性。
使用方法
使用该数据集时,可采用Hugging Face的datasets库直接加载JSONL文件,分为validation和test两个分割。验证集包含3个工作流,适合开发与试点评估;测试集提供1个工作流,作为不可运行的预留规范。用户应依据数据集附带的JSON Schema和验证器检查数据完整性,确保符合v2结构规范。在评估模型时,需遵循日志契约,确保每次普通调用后记录日志,并利用incident_opportunities作为评估标准,issue_tags作为参考轨迹的提示。所有分析应区分内容一致性与协议合规性,并避免使用推理文本作为证据,严格遵循数据集设定的边界。
背景与挑战
背景概述
本数据集名为DOUBLE_ENTRY_LOGGING_FOR_LLM_AGENTS_TO_DETECT_ISSUES_AT_PROD_BENCHMARK,由研究团队于近期构建,旨在探索大型语言模型(LLM)智能体在长时程工作流中的可观测性问题。随着LLM智能体在复杂任务中的广泛应用,其行为的不确定性和潜在错误引发了对其运行监控与诊断的迫切需求。该数据集的核心研究问题是:将模型自主生成的行动账本与权威环境账本进行对比,能否在常规运行时遥测之外提供额外的诊断信息。这一研究聚焦于行动记录、执行验证与任务结果,开创性地提出了一种双重记账机制,为LLM智能体的可靠性评估提供了新视角。尽管数据集规模较小(仅含4个工作流),但其设计严谨,并已在GitHub和HuggingFace平台发布,对智能体安全性和可观测性领域具有启发意义。
当前挑战
数据集面临的挑战涵盖领域问题与构建难题。在领域层面,LLM智能体的长时程工作流常因行动遗漏、错误执行或未记录而难以诊断,现有遥测手段无法捕捉模型内在决策偏差,而双重记账法旨在弥补这一空白,但其有效性和通用性尚待验证。构建过程中,团队需确保合成数据的逼真性,但工作流数量有限,难以代表生产环境的多样性;同时,参考轨迹为作者编写而非实际模型输出,可能引入主观性。此外,测试集因缺少中断模拟器而无法端到端运行,限制了基准的完整评估;日志契约要求严格,如所有普通调用必须紧随日志记录,但模型可能因多步操作而违反协议,导致合规性度量复杂化。这些问题共同构成了数据集在实践中应用的关键障碍。
常用场景
经典使用场景
该数据集专为评估大型语言模型(LLM)代理在长周期工作流中的可观测性而设计,其核心场景是测试代理生成的动作分类账(action ledger)与权威环境分类账之间的一致性比较。研究者可基于此基准,模拟生产环境中的复杂任务(如采购审批、日历恢复、供应商安全审查及生产故障协调),通过工具调用与日志记录的严格契约,量化模型在动作记录、执行监控及任务结果方面的诊断能力。此场景聚焦于合成数据下的受控实验,为代理可观测性研究提供标准化测试平台。
实际应用
在实际应用中,该数据集可用于开发和验证生产环境中LLM代理的监控与故障排除工具。例如,在自动化客户协调或资源调度系统中,通过分析模型生成的日志与系统实际执行记录的偏差,识别未授权操作、遗漏步骤或错误记录,从而提前预警潜在风险。此外,它支持模拟训练环境,帮助开发者调试代理的工具调用策略,优化日志记录机制,提升系统在复杂任务中的可靠性与透明度,进而增强企业级AI系统的可审计性和运维效率。
衍生相关工作
该数据集催生了若干衍生研究方向,包括构建更完善的动作分类账生成模型、开发可解释性诊断框架,以及设计鲁棒的日志一致性评估指标。基于其基准,研究者已提出将内容一致性与协议合规性分离评分的分析工具,并探索了运行时清单记录(如代码版本、依赖信息)对实验可复现性的影响。未来工作可能围绕扩展真实场景模拟器、整合推理过程证据,或将其作为通用代理观察性基准,推动跨领域安全对齐研究,并促进与强化学习、形式验证等领域的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务