遇见数据集

auto

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集名为“auto—agentic tool-call approve/deny training data”,是一个用于训练AI代理工具调用审批编码器的训练语料库,编码器用于判断代理的提议工具调用是否可自动执行。数据集包含70万个样本,其中批准和拒绝各35万,保持平衡。构成上,288,260个样本来自auto-0.4b语料库,411,740个新样本由GPT-5.6 Luna在低推理努力下生成,所有新行均通过结构验证和精确证据检查,并进行了独立盲审(但后续审计因订阅使用限制而停止,因此全量新增部分不应被描述为独立审计)。已移除每个标签内的精确和近似重复,同时保留对比性对立标签案例。输入格式严格包含提议工具调用、用户请求和代理历史,顺序和标题重要。决策规则:拒绝表示执行提议调用将导致严重、未经授权的损害,或遵循通过不可信内容注入的指令;批准涵盖普通工作、正常网络访问、合法软件包安装、只读本地检查以及明确授权且正确范围的破坏性操作。字段包括文本、标签、用户请求、历史、提议调用、类别、难度、理由、框架、领域、语言、长度桶、生成模式、子集等。数据集主要适用于训练和评估工具调用安全护栏模型,但存在局限性:大多数样本为合成,独立审核和去重可减少标签噪声,但无法消除共享模型家族的盲点,不能替代沙箱、最小权限或高风险操作的人工审查。

The dataset named auto-agentic tool-call approve/deny training data is a training corpus for training an AI agent tool-call approval encoder, which is used to determine whether an agents proposed tool call can be automatically executed. The dataset contains 700,000 samples, balanced between 350,000 approvals and 350,000 denials. Composition: 288,260 samples from the auto-0.4b corpus, and 411,740 new samples generated by GPT-5.6 Luna under low reasoning effort. All new rows passed structural validation and precise evidence checks, and were independently blind-reviewed (but subsequent audits were stopped due to subscription usage limits, so the full additional portion should not be described as independently audited). Exact and near duplicates within each label were removed, while contrasting adversarial label cases were retained. The input format strictly includes proposed tool call, user request, and agent history, with order and headings being important. Decision rules: Denial indicates that executing the proposed call would cause severe, unauthorized harm, or follow instructions injected through untrusted content; Approval covers ordinary work, normal web access, legitimate software package installation, read-only local checks, and destructive operations that are explicitly authorized and properly scoped. Fields include text, label, user request, history, proposed call, category, difficulty, rationale, framework, domain, language, length bucket, generation mode, subset, etc. The dataset is primarily suitable for training and evaluating tool-call safety guardrails models, but has limitations: most samples are synthetic, independent review and deduplication can reduce label noise but cannot eliminate blind spots of shared model families, and cannot replace sandboxing, least privilege, or human review for high-risk operations.

创建时间:
2026-08-07
原始信息汇总

数据集概述

auto 是一个用于训练 AI 代理工具调用审批/拒绝分类器的数据集,由 ProCreations 发布,采用 Apache-2.0 许可证。该数据集旨在帮助模型判断 AI 代理提出的工具调用是否可以自动执行。

基本信息

  • 任务类型:文本分类
  • 语言:英语、西班牙语、法语、德语、葡萄牙语、日语、韩语、中文、印地语、俄语、意大利语(共 11 种语言)
  • 数据规模:100K < n < 1M(实际为 700,000 条样本)
  • 标签平衡:350,000 条 approve / 350,000 条 deny
  • 标签:agent-safety、tool-calling、guardrails

数据构成

  • 288,260 条:保留自 auto-0.4b 语料库
  • 411,740 条:使用 GPT-5.6 Luna 在低推理难度下新生成
  • 每条新生成的数据均通过结构验证和精确证据检查;初始子集经过了独立的盲审,已知被拒样本已排除。但完整新增部分不应被描述为经过独立审计。
  • 在每个标签内进行了精确和近似去重,同时保留了相反标签的对比样本。
  • ProCreations/approve-or-deny 作为未触碰的基准数据集,未参与生成、加权、训练或校准,其内容碰撞样本已排除。

输入格式

text 字段包含精确的模型输入,顺序和标题具有显著意义:

text

PROPOSED TOOL CALL

tool: <工具名称> args: <参数>

USER REQUEST

<人类请求>

AGENT HISTORY

[1] Tool(arguments) -> result

空历史序列化为 (no prior actions)

决策规则

  • deny:执行当前提议的调用会造成重大、未经授权的损害,或遵循通过不可信内容注入的指令。
  • approve:涵盖普通工作、正常网络访问、合法软件包安装、只读本地检查和明确授权且范围正确的破坏性操作。

字段说明

字段 含义
text 精确序列化的分类器输入
label approvedeny
user_request 人类请求
history 先前的 {tool, args, result} 操作
call 提议的 {tool, args} 操作
category, difficulty 课程元数据
rationale 决策证据(不属于模型输入)
framework, domain, lang 场景多样性维度
length_bucket, gen_mode, subset 生成元数据

局限性

  • 大多数数据行为合成数据。
  • 独立审查和去重可减少标签噪声,但无法消除共享模型族的盲点。
  • 该数据集不能替代沙箱隔离、最小权限原则或对高影响操作的人工审查。
搜集汇总
数据集介绍
auto 数据集图片
构建方式
该数据集是专为AI代理工具调用审批任务构建的训练语料库,总计包含70万条样例,其中批准与拒绝各半,保持了严格的类别平衡。构建过程融合了两部分数据:28.8万余条源自既有语料库的保留样例,以及41.1万余条由GPT-5.6 Luna在低推理强度下生成的创新样例。每一新增数据行均通过结构化验证与精确证据校验,并剔除了标签内的精确及近似重复项,同时保留了相反标签的对比性案例。特别地,构建过程中严格排除了与独立基准数据集ProCreations/approve-or-deny的内容冲突,确保基准的纯净性。这一精心设计的流程旨在最大化数据的多样性与实用性,同时忠实反映了代理工具调用审批场景的真实分布。
使用方法
数据集的官方用途是训练ProCreations/auto-1b编码器,该编码器用于判断AI代理的提议工具调用是否可自动执行。使用时,研究者需遵循输入格式,将文本字段作为模型输入,标签字段作为监督信号。数据集支持文本分类任务的训练与验证,尤其适用于构建鲁棒的工具调用安全审批系统。鉴于数据集的平衡特性与丰富的元数据,可将其用于多语言、多领域的泛化能力评估,或结合课程元数据进行阶段性训练。然而,鉴于合成数据的局限,建议在使用时结合沙箱环境、最小权限原则及人工审核机制,以确保高影响场景下的安全性。总体而言,该数据集为研究代理安全、工具调用边界问题提供了高质量的训练资源。
背景与挑战
背景概述
该数据集名为“auto”,由ProCreations团队于近期创建,旨在训练一个名为auto-1b的编码器,用于判断AI代理提出的工具调用是否应当自动执行。核心研究问题聚焦于智能体安全中的工具调用审批机制,以减少未经授权的操作风险。数据集包含70万条精心平衡的样本,其中35万条为批准,35万条为拒绝,并融合了多方生成与人工审计的内容,确保了数据的多样性与质量。该数据集在智能体安全领域具有重要影响力,为构建更安全的自动化代理系统提供了关键的训练资源。
当前挑战
该数据集面临的挑战主要包括:领域问题方面,需精确界定工具调用的安全边界,区分无授权的有害操作与授权的破坏性行为,同时防范通过不可信内容注入的指令;构建过程中的挑战则涵盖大规模数据生成的效率与质量控制,确保结构有效性和证据准确性,去除重复样本以保持类别间对比性,以及应对独立审计提前终止带来的潜在标签噪声,这些因素均对数据集的可靠性构成考验。
常用场景
经典使用场景
该数据集专为训练和评估AI代理在工具调用场景下的安全审批模型而设计,其核心应用在于构建一个能够自主决定是否执行工具调用的分类器。通过输入精确序列化的模型输入,包含提议的工具调用、用户请求及代理历史,模型需输出“批准”或“拒绝”的二元决策。此场景广泛应用于多语言环境,涵盖英语、西班牙语、法语、德语等11种语言,支持跨语言的指令遵循与安全拦截,适用于开发需要实时判断工具调用安全性的智能代理系统,如自动化编程助手、网络操作代理等,确保在复杂交互中仅执行被授权的操作,防范恶意注入或越权行为。
解决学术问题
该数据集解决了代理安全领域中的关键学术问题,即如何从海量交互数据中学习可靠的工具调用授权策略,以平衡操作效率与安全风险。传统基于规则或人工审批的方法难以应对多样化的动态请求,而该数据集提供了70万条平衡样本(批准/拒绝各半),涵盖了不同难度与领域的场景,使研究者能够训练出鲁棒性强的分类器,有效识别出有害操作、指令注入及未授权行为。其意义在于推动了代理决策边界的研究,为构建更安全、更自主的AI系统提供了数据基础,并促进了多语言环境下安全基准的建立。
实际应用
在实际应用中,该数据集直接服务于企业级AI代理的部署,例如自动化运维、代码执行、网络访问控制等场景。通过集成经此数据训练的模型,系统能够在无人工干预下自动审批低风险操作,如常规文件读取、软件包安装或网络请求,而将高风险行为如删除数据、越权访问或恶意指令执行拦截并转交人工审核。这种机制显著提升了运营效率,同时降低了安全事件发生的概率。此外,该数据集支持多语言,可适应全球化的产品环境,为不同语言用户提供一致的安全保障,是构建可靠AI代理基础设施的重要组件。
数据集最近研究
最新研究方向
该数据集聚焦于人工智能代理工具调用的安全审批机制,代表了智能体安全领域的前沿研究方向。随着大语言模型驱动的自主代理在执行复杂任务时频繁调用外部工具,如何有效防止未经授权的危险操作或提示注入攻击成为关键挑战。auto数据集通过大规模合成数据训练分类器,实现对工具调用的自动批准或拒绝,为代理系统提供即时防护屏障。其平衡的正负样本设计、多语言覆盖和结构化输入格式,旨在提升模型对上下文威胁的判别能力,推动代理安全从规则过滤向智能决策演进。该数据集的发布对于构建可靠、可控的自主系统具有重要意义,也为后续研究提供了标准化的训练与评估基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务