遇见数据集

agentabstain-ar

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

AgentAbstain 是一个用于评估工具使用大语言模型代理“何时不该行动”能力的配对任务基准。该数据集包含 263 个任务对,每个对包含一个“应该执行”任务和一个“应该弃权”任务,两者仅在指令、环境状态或工具集的单个受控扰动上有所不同,因此任何始终执行或始终弃权的策略都无法获得超过 50% 的配对准确率。数据集覆盖 42 个可执行的 MCP 沙箱环境,并基于 8 种代理弃权场景构建:缺少关键参数(39 对)、模糊行动规范(30 对)、冲突约束(32 对)、高风险行动(31 对)、工具能力不足(34 对)、关键工具故障(34 对)、冲突证据(30 对)、紧急风险发现(33 对)。其中 131 对为操作型(状态改变),132 对为信息型(只读)。数据以 JSON Lines 格式提供(tasks.jsonl),共 526 行,每行包含字段:pair_id、category、task_type(act/abstain)、action_type(operational/informational)、instruction、system_prompt、critical_actions、execution_dag、abstention_trigger 和 environments。数据集可通过 Hugging Face Datasets 加载,也可通过快照下载完整目录(包含 tasks/ 和 environments/ 文件夹)供运行时使用。评估结合确定性提交检查(对工具调用轨迹)和 LLM 判断(对终端响应)。所有任务和环境由 AbstainGen 流水线生成,经确定性重放和跨族批评家验证,并由三位独立标注员评估,94-98% 的样本被评定为设计良好。数据集采用 CC BY 4.0 许可证。

AgentAbstain is a benchmark for evaluating the ability of tool-using large language model agents to know when not to act, consisting of paired tasks. The dataset contains 263 task pairs, each with a should act task and a should abstain task that differ only in a single controlled perturbation of instruction, environment state, or toolset, ensuring that any always-act or always-abstain strategy cannot achieve more than 50% pair accuracy. It covers 42 executable MCP sandbox environments and is built on 8 agent abstention scenarios: missing critical parameters (39 pairs), ambiguous action specification (30 pairs), conflicting constraints (32 pairs), high-risk actions (31 pairs), insufficient tool capability (34 pairs), critical tool failure (34 pairs), conflicting evidence (30 pairs), and urgent risk discovery (33 pairs). Among them, 131 pairs are operational (state-changing) and 132 pairs are informational (read-only). The data is provided in JSON Lines format (tasks.jsonl), with 526 lines, each containing fields: pair_id, category, task_type (act/abstain), action_type (operational/informational), instruction, system_prompt, critical_actions, execution_dag, abstention_trigger, and environments. The dataset can be loaded via Hugging Face Datasets or downloaded as a snapshot of the full directory (including tasks/ and environments/ folders) for runtime use. Evaluation combines deterministic submission checks (for tool call traces) and LLM judgments (for terminal responses). All tasks and environments are generated by the AbstainGen pipeline, verified through deterministic replay and cross-family critic validation, and assessed by three independent annotators, with 94-98% of samples rated as well-designed. The dataset is licensed under CC BY 4.0.

创建时间:
2026-08-29
原始信息汇总

AgentAbstain 数据集详情

数据集概述

AgentAbstain 是一个面向智能体弃权(Agentic Abstention) 能力的配对任务基准数据集,旨在评估使用工具的LLM智能体能否在恰当情境下识别出"不应当行动"的时机。数据集包含 263个任务对,分布在 42个可执行的MCP沙箱环境中,覆盖了基于智能体原生视角构建的 8类弃权场景

数据集结构

核心设计

每个应当行动(should-act)任务都配有对应的应当弃权(should-abstain)变体,两者之间仅通过单一受控扰动(对指令、环境状态或工具集进行改动)来区分。这一设计确保任何"始终行动"或"始终拒绝"的策略在配对准确率上都无法超过50%。

文件组织

tasks.jsonl 526行数据(263对 × act/abstain变体) tasks/ 任务原生目录结构,供运行时直接使用 environments/ 42个可执行MCP沙箱环境

tasks.jsonl 字段说明

字段 描述
pair_id 任务对标识,格式为 <category>/<task_id>
category 8类弃权场景之一
task_type act(行动)或 abstain(弃权)
action_type operational(改变状态)或 informational(只读)
instruction 给智能体的用户指令
system_prompt 每个任务专属的系统提示词
critical_actions 提交级工具调用(预期副作用)
execution_dag act变体的参考工具调用DAG
abstention_trigger abstain变体的扰动记录(改了什么、改在哪、为何行动是错误的)
environments 该变体所挂载的沙箱环境

8类弃权场景分布

场景 任务对数
S1 缺失关键参数 39
S2 行动规格模糊 30
S3 约束冲突 32
S4 高影响行动 31
S5 工具能力不足 34
S6 关键工具故障 34
S7 证据矛盾 30
S8 突发风险发现 33

其中操作型任务131对,信息型任务132对。

评估结果

在4种智能体框架下的17个前沿LLM中,最佳智能体的配对准确率仅为 59.5%,表明现有模型在智能体弃权能力上仍有较大提升空间。

使用方式

可通过 load_dataset("antiquality/agentabstain", split="test") 加载任务元数据;运行可执行基准测试需配合代码仓库使用。评估方法结合了工具调用轨迹的确定性提交检查与对终端响应的LLM评判器。

质量保障与更新

所有任务和环境均由AbstainGen流水线生成,经确定性回放和跨家族批评者验证;3名独立标注者对100个抽样任务中94%至98%的任务评为设计良好。生成代码特意不予公开,以防止大规模合成与基准匹配的训练数据,但可按需私下生成新任务实例用于未来评估轮次。

许可证

数据集采用 CC BY 4.0 许可证,配套代码以MIT许可证发布。

搜集汇总
数据集介绍
agentabstain-ar 数据集图片
构建方式
AgentAbstain数据集构建于对工具使用型语言模型代理的深度审视之上,旨在探究其在复杂环境中何时应克制行动。构建过程采用了专有的AbstainGen流水线,生成了263对任务,并部署于42个可执行的MCP沙箱环境中。每对任务包含一个应行动版本与一个应弃权版本,两者仅通过针对指令、环境状态或工具集的单点受控扰动相区分,从而系统性地覆盖了8种弃权场景,如关键参数缺失、证据冲突等。所有任务均经确定性重放与跨模型批评家验证,确保高质量与可重复性。
特点
该基准的核心特点在于其配对任务设计与细粒度的场景划分,使得任何总是行动或总是弃权的策略都无法超过50%的配对准确率,从而精准衡量模型的校准式弃权能力。数据集涵盖操作性与信息性两类任务,每类均配有详细的元数据,如关键动作、执行DAG及弃权触发记录。在4种代理框架下评测的17个前沿模型中,最佳表现仅达到59.5%的配对准确率,凸显了当前模型在此智能安全关键能力上的显著不足。
使用方法
研究者可通过HuggingFace加载任务元数据(如instruction、system_prompt等),或下载完整仓库配置,以运行可执行环境并进行评测。评测包含确定性提交检查与基于LLM的判断器,两者均集成于代码库中。此外,由于任务生成代码刻意不公开,用户可请求私下生成新的任务实例,以规避数据污染风险,并适用于未来的多轮评估,从而持续推动代理弃权能力的发展。
背景与挑战
背景概述
AgentAbstain数据集于2026年由Xun Liu、Yi Evie Zhang等研究者共同创建,旨在解决大语言模型(LLM)代理在工具使用过程中缺乏‘适可而止’能力的问题。该数据集的核心研究问题是:代理是否能在不应行动时准确识别并主动放弃行动,以避免潜在风险。AgentAbstain包含263对任务,覆盖42个可执行的MCP沙箱环境,并基于8种‘弃权场景’的代理原生分类法构建。通过配对任务设计,确保了策略无法仅靠‘总是行动’或‘总是拒绝’获得高分,从而严谨评估代理的校准式弃权能力。该数据集对LLM代理的安全性和可靠性研究具有重要价值,为开发更审慎、不易误操作的自主代理提供了评估基准。
当前挑战
AgentAbstain所面临的挑战主要体现在两个层面。在领域问题层面,现有LLM代理常表现出‘过度行动’倾向,即使面对指令模糊、证据冲突或工具故障等情形,仍可能盲目执行,引发高风险后果。而既有的智能体基准大多偏向于‘应行动’任务,忽视了对‘何时不应行动’的评估,导致代理在真实应用中的安全性能欠缺。在数据集构建层面,设计难度在于构建高度可对照的任务对,要求仅通过单一受控扰动(如指令、环境状态或工具集的变化)将‘应行动’场景转化为‘应弃权’场景,且需确保所有任务在42个沙箱环境中可执行。此外,为避免基准被污染,生成代码不予公开,同时又需提供详尽的文档与验证机制,这都在工程与学术严谨性上构成了显著挑战。
常用场景
经典使用场景
AgentAbstain作为一项配对任务基准,旨在评估工具使用型大语言模型代理在特定情境下识别“不应行动”的校准能力。该数据集精心构建了263对任务,横跨42个可执行的环境,并基于8种代理原生场景分类,如关键参数缺失、行动规格模糊等。此基准的核心用法在于测度代理在指令、环境状态或工具集出现单一受控扰动时,能否正确选择抑制行动,从而避免潜在错误。其经典应用涵盖对比不同前沿模型(如GPT系列、Claude等)在多个代理框架下的表现,以及作为训练和调优代理模型的验证集,推动安全可靠代理行为的发展。
实际应用
AgentAbstain的实际应用前景广阔,尤其在高风险决策领域价值显著。例如,在自动化运维中,代理面对异常环境状态或工具故障时,数据集帮助训练模型识别应停止操作而非强行执行,避免系统崩溃。在医疗辅助诊断,或金融交易等场景,代理可能接收矛盾证据或高代价行动指令,此基准能强化模型对模糊性的警惕,促使在关键路径上选择“请求澄清”或“放弃行动”。此外,该数据集可直接用于开发安全过滤层,集成到企业级代理系统中,作为前置校验模块,有效降低因代理误操作导致的损失,提升整体系统的可信赖与稳健性。
衍生相关工作
AgentAbstain的发布催生了多个方向的研究探索。首先,它激发了关于“代理不确定性量化”的深入研究,研究者基于此基准开发新算法,将预测置信度与行动抑制策略动态结合。其次,该数据集成为评测“可解释性代理”的基石,推动了关于代理决策过程透明化的可解释性研究,尤其是对拒绝或放弃行为的解释逻辑。此外,衍生出“自适应环境感知”的研究课题,即代理需在线评估环境状态变化并实时调整行为计划。该基准还促进了“对抗性攻击与防御”领域发展,研究者通过生成针对性扰动测试代理鲁棒性,进而促进更健壮代理架构的设计与安全训练方法的革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务