遇见数据集

ToolAlignBench

收藏
github2026-06-04 更新2026-06-08 收录
官方服务:

资源简介:

ToolAlignBench是一个用于研究工具调用大型语言模型(LLMs)中价值对齐冲突的数据集。它包含128个标记文件提示,覆盖多个领域(如制药分销),旨在探究LLM代理在安全训练与部署指令之间的冲突解决行为。数据集以JSONL格式在HuggingFace上提供,用于评估模型的对齐行为。

ToolAlignBench is a dataset dedicated to researching value alignment conflicts in tool-augmented large language models (LLMs). It includes 128 annotated file-based prompts spanning multiple domains such as pharmaceutical distribution, and aims to explore the conflict resolution behaviors of LLM agents when dealing with conflicts between safety training instructions and deployment instructions. The dataset is provided in JSONL format on HuggingFace for evaluating the alignment behaviors of models.

创建时间:
2026-05-24
原始信息汇总

数据集概述

ToolAlignBench 是一个用于研究大语言模型(LLM)在工具调用场景下对齐冲突的数据集和评测基准,相关论文发表于 ICML 2026 Pluralistic Alignment Workshop。

核心内容

  • 研究问题:探究 LLM 代理在安全训练与部署指令之间产生冲突时(如涉及虚构的组织不当行为文档),如何解析并执行工具调用。
  • 数据集来源:包含 128 个评测提示(markdown 文件),其中四个药品分发场景源自 SnitchBench(MIT 许可证),其余场景为原创。
  • 数据格式:最终数据集以 JSONL 格式打包,托管于 HuggingFace:aryankeluskar/ToolAlignBench

仓库结构

目录 说明
benchmark/ 128 个 markdown 格式的提示文件 + 每个领域的工具分类法。
runner/ 驱动 LLM 通过每个场景,生成每个(模型、领域、场景、运行、条件)组合的 markdown 转录。
analysis/ 解析转录 → 行为标签 → 表格、统计检验和图表。
inference/ FastAPI 服务,用于本地 HuggingFace 模型的工具调用兼容推理(用于“消融安全训练”的开源模型)。
dataset/ benchmark/ 打包为上传至 HuggingFace 的 JSONL 文件的脚本。

快速使用

  1. 克隆仓库并配置环境变量(.env 中填写 OPENROUTER_API_KEY)。
  2. 进入 runner/ 目录,使用 bun run start --safe 复现单模型在单场景类型上的评测。
  3. 进入 analysis/ 目录,使用 bun run analyzebun run plot 分析转录并生成图表。
  4. 默认模型为 meta-llama/llama-3.1-8b-instruct(通过 OpenRouter),可修改模型列表复现完整结果。

许可与责任声明

  • 代码采用 MIT 许可证。
  • 评测文档(基准数据)采用 CC BY 4.0 许可证。
  • 数据集包含合成文档,仅用于学术研究,不可用于实际不当行为。
搜集汇总
数据集介绍
ToolAlignBench 数据集图片
构建方式
ToolAlignBench是一个专为评估工具调用型大语言模型在安全对齐冲突中的表现而设计的基准数据集。其构建过程基于合成文档,模拟将不同受监管领域(如制药、分销等)中的虚构组织不当行为情景,每个情景均以Markdown格式呈现,涵盖128个提示(prompts),并按领域划分出工具分类体系(tool taxonomy)。其中四个制药分销场景衍生自SnitchBench项目,其余为原创内容。数据集通过脚本将Markdown格式的基准数据打包为JSONL文件,并上传至HuggingFace平台,方便社区访问和使用。
特点
该数据集最突出的特点在于聚焦于工具调用场景下的安全对齐冲突,深入探讨了LLM在面对安全训练与指令遵循之间的矛盾时如何决策。数据集覆盖多个受监管领域,情景设计专门用于触发模型在安全性和指令执行之间的权衡。此外,项目提供了完整的分析工具链,包括转录解析、行为标签分类、统计检验和可视化图表生成,能够系统地评估和对比不同模型(包括经过安全训练和“abliterated”去除安全训练的模型)在工具调用中的行为差异。
使用方法
使用ToolAlignBench时,用户首先克隆GitHub仓库并配置环境变量(如OpenRouter API密钥)。通过运行runner目录下的脚本,可以驱动指定的LLM模型依次执行所有情景,每个模型、领域、情景、运行和条件组合会生成独立的Markdown转录文件。随后,analysis目录中的脚本能够自动解析转录文件,提取行为标签,并生成统计表格和可视化结果。用户可通过修改runner中的模型配置文件,轻松扩展至其他LLM以进行对比实验。该项目还提供了FastAPI的推理工具(inference/),用于在本地托管HuggingFace模型,并以OpenAI兼容接口进行工具调用,支持离线评估。
背景与挑战
背景概述
ToolAlignBench数据集诞生于大型语言模型(LLM)工具调用能力与安全对齐之间日益凸显的冲突这一前沿研究领域。该数据集由Aryan Keluskar等研究人员于2025年创建,旨在系统性地探究LLM在工具调用场景中面临的对齐冲突问题。其核心研究问题聚焦于当模型同时接收到安全训练约束与部署指令时,如何在执行工具调用的过程中平衡二者关系。数据集覆盖制药分销等多个受监管领域的合成场景,为评估和解析LLM代理在复杂工具使用环境中的行为提供了标准化基准,对推动工具调用型LLM的安全部署与对齐优化具有重要学术价值。
当前挑战
ToolAlignBench面临的核心挑战在于:首先,如何在受监管领域中构建既能反映真实工具调用复杂性,又能精确触发对齐冲突的合成场景,避免场景设计失真的同时确保伦理合规性。其次,数据集构建过程中需应对跨域工具分类体系的标准化难题,不同领域(如制药分销)的工具调用范式差异巨大,统一标注成本高昂。再者,评估模型行为时需区分安全训练与指令执行之间的冲突来源,区分模型是被动违规还是主动规避,这对分析框架的解析能力和统计学方法提出了严苛要求。
常用场景
经典使用场景
ToolAlignBench数据集专为评估大型语言模型在工具调用场景下的行为对齐性而设计,其核心应用场景聚焦于模拟真实世界中智能代理与复杂工具交互时面临的指令冲突。通过精心构造的合成文档,该数据集构建了安全训练偏好与工具调用指令相矛盾的测试案例,从而系统性地考察模型在矛盾情境中的决策倾向。典型用法是驱动待测模型遍历四类医药分销情景及其他原创情景,记录其在安全性与功能性之间的权衡轨迹,为度量工具增强型语言模型的对齐可靠性提供标准化基准。
实际应用
在实际应用层面,ToolAlignBench为部署工具增强型语言模型的企业开发者和安全工程师提供了关键的可靠性诊断工具。例如在自动化客服、智能文档处理、法律合规审查等涉及敏感信息处理的场景中,该数据集能够预先识别模型在工具调用时可能发生的安全偏离行为,从而指导系统性的风险规避设计。此外,其与公理化模型评估流程的结合,使开发者能够量化去安全训练操作对工具调用行为的具体影响,为实际部署中的安全阈值设定提供数据驱动的决策支持。
衍生相关工作
ToolAlignBench的发布催生了若干具有学术价值的相关工作。其评估框架被后续研究扩展至医疗、金融等更多高风险领域,衍生出针对特定行业工具调用安全性的专用测试集。同时,该数据集提出的行为标签体系促使研究者开发了更细粒度的日志分析工具,能够自动分类模型在冲突场景中的妥协、拒绝或规避策略。此外,基于ToolAlignBench发现的模型对齐缺陷,有学者提出了动态权重调整的训练策略,以在保持工具调用能力的同时强化安全边界,这些工作共同构成了工具对齐研究领域的新兴范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务