遇见数据集

ps4mas-castle-final-test-rollouts

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

PS4MAS Final Test Rollouts (0813) 是一个用于多智能体个性化安全评估的数据集,包含多个模型在 200 个最终测试场景和 4 种拓扑结构下的智能体-工具循环推理轨迹。数据集包含 8 个模型(如 glm_47flash_base、glm_47flash_oracle、glm_9b_base、glm_9b_oracle、qwen36_27b_base、qwen36_27b_oracle、qwen36_35ba3b_base、qwen36_35ba3b_oracle),每个模型提供 800 条轨迹,总计 6400 条样本。每条轨迹包含场景 ID、查询、配置、拓扑、完整消息/工具调用历史(hops)、最终响应文本(final_output)、智能体模型、智能体标签以及 rollout 模式。数据可用于多智能体安全推理、个性化安全策略评估、以及智能体轨迹分析等任务。

PS4MAS Final Test Rollouts (0813) is a dataset for multi-agent personalized safety evaluation, containing agent-tool cyclic reasoning trajectories of multiple models under 200 final test scenarios and 4 topologies. The dataset includes 8 models (e.g., glm_47flash_base, glm_47flash_oracle, glm_9b_base, glm_9b_oracle, qwen36_27b_base, qwen36_27b_oracle, qwen36_35ba3b_base, qwen36_35ba3b_oracle), each providing 800 trajectories, totaling 6400 samples. Each trajectory contains scene ID, query, configuration, topology, complete message/tool call history (hops), final response text (final_output), agent model, agent label, and rollout mode. The data can be used for multi-agent safety reasoning, personalized safety policy evaluation, and agent trajectory analysis.

创建时间:
2026-09-06
原始信息汇总

PS4MAS Final Test Rollouts (0813) 数据集总结

数据集概述

该数据集是PS4MAS(个性化安全多智能体系统)的最终测试回滚数据,版本标记为0813。数据集基于ps4mas-0521-splits中的final_test_scenarios.jsonl源数据生成,主要用于评估不同模型在个性化安全多智能体场景下的推理与工具调用表现。

许可与标签

  • 许可证:Apache-2.0
  • 标签ps4maspersonalized-safetymulti-agentinference-traces

数据内容与结构

数据规模

  • 包含 200个最终测试场景 × 4种拓扑结构 的回滚记录。
  • 每个模型对应800条数据行。

数据文件路径与模型列表

数据集按模型分类,每个模型的文件存放于对应的traces/<model>/<model>.jsonl路径下:

模型 数据行数 文件路径
glm_47flash_base 800 traces/glm_47flash_base/glm_47flash_base.jsonl
glm_47flash_oracle 800 traces/glm_47flash_oracle/glm_47flash_oracle.jsonl
glm_9b_base 800 traces/glm_9b_base/glm_9b_base.jsonl
glm_9b_oracle 800 traces/glm_9b_oracle/glm_9b_oracle.jsonl
qwen36_27b_base 800 traces/qwen36_27b_base/qwen36_27b_base.jsonl
qwen36_27b_oracle 800 traces/qwen36_27b_oracle/qwen36_27b_oracle.jsonl
qwen36_35ba3b_base 800 traces/qwen36_35ba3b_base/qwen36_35ba3b_base.jsonl
qwen36_35ba3b_oracle 800 traces/qwen36_35ba3b_oracle/qwen36_35ba3b_oracle.jsonl

说明:多数基线(base)与oracle文件为原始回滚数据;GiGPO 0805-r2在step20/40/60/80阶段的评估附加了OSS-120B的scoressummary.json

每行数据字段(per-trace)

  • scenario_id:场景标识符
  • query:用户查询内容
  • config:配置信息
  • topology:拓扑结构
  • hops:完整的消息/工具调用历史
  • final_output:最终回复文本
  • agent_model:智能体模型名称
  • agent_tag:智能体标签
  • rollout_mode:回滚模式

数据生成

数据由scripts/0521/push_final_test_results.py脚本生成,用于记录并推送各模型的最终测试回滚结果。

搜集汇总
数据集介绍
ps4mas-castle-final-test-rollouts 数据集图片
构建方式
在个性化安全多智能体系统(PS4MAS)的研究进程中,为系统评估各智能体在复杂安全场景下的推理与决策能力,构建了本数据集。其构建基于既定的最终测试场景集,涵盖200个情境并适配4种网络拓扑结构,生成了800条测试样本。数据集中汇集了来自GLM系列、Qwen系列等多家模型在基础模式与Oracle模式下的完整智能体-工具交互轨迹。每条记录细致刻画了场景标识、查询内容、具体配置与拓扑信息,并完整保留了消息流转及工具调用的历史,为深度剖析模型行为模式奠定了数据基础。
特点
该数据集的核心特性体现在其多维度、细粒度的结构化设计。每一行数据不仅关联了唯一的场景标识与拓扑结构,确保了实验场景的可复现性,还详尽记录了智能体与工具间的全部交互步骤,即'hops',这一设计使研究者得以追踪推理链条的每一步演变。尤为突出的是,它包含了'基础'与'Oracle'两种执行模式的对照数据,能够清晰揭示先验知识对智能体决策的影响。对于特定的强化学习评估版本,还额外涵盖了评分模型对生成结果的详细评分与汇总信息,极大丰富了对智能体性能进行多层级量化分析的潜力。
使用方法
本数据集专为多智能体安全研究中的离线评估而精心制作。研究人员可直接加载JSONL格式的轨迹文件,对特定模型或配置下的完整'动作-工具'交互序列进行复现分析。其规范化的列结构,如'场景ID'、'消息历史'和'最终响应',使得开发自定义的评估协议变得尤为简便,既支持对单步工具调用准确性的校验,也支持对最终回答质量的综合评判。尤为难得的是,数据集中内置的基础与Oracle模式的对照设计,为进行消融实验、理解不同模型在获取额外信息后能力的边际提升提供了绝佳素材,亦可用作训练数据以提升模型在类似安全场景中的鲁棒性。
背景与挑战
背景概述
PS4MAS(个性化安全多智能体系统)数据集由研究团队于2023年创建,旨在评估多智能体系统在个性化安全场景下的推理与决策能力。该数据集的核心研究问题聚焦于多智能体协作中的个性化安全约束满足,以及不同拓扑结构对系统性能的影响。其影响力体现在为多智能体系统的安全评估提供了标准化基准,推动了相关领域(如智能体安全、人机交互)的发展。该数据集包含200个最终测试场景 × 4种拓扑结构,由GLM、Qwen等主流模型生成推理轨迹,为多智能体系统的性能对比与优化提供了丰富的数据支撑。
当前挑战
该数据集面临的挑战包括:第一,多智能体系统在个性化安全场景中的核心问题——如何在动态环境中确保智能体行为既满足个性化需求又规避安全风险,这要求模型具备深度理解与实时判断能力。第二,构建过程中的挑战:数据生成依赖模型推理,不同模型(如GLM、Qwen)在轨迹长度、工具调用一致性上差异显著,导致数据覆盖面与均衡性难以保障;同时,多拓扑结构试验增加了数据复杂度,需确保场景代表性与可复现性,但现有数据仅包含推理结果,缺乏对推理过程的细粒度标注,限制了对其决策机理的深入分析。
常用场景
经典使用场景
PS4MAS-castle-final-test-rollouts数据集为个性化安全多智能体系统领域提供了高保真的推理轨迹资源。该数据集的核心价值在于其依据200个最终测试场景与四种拓扑结构,精妙构建了800条包含完整智能体-工具循环日志的交互记录。研究者可借助这些数据,针对不同基础模型(如GLM系列与Qwen系列)在有无Oracle引导下的行为差异,开展深入的分析与比较。该数据集在验证多智能体协作安全性、评估模型在复杂环境下的决策一致性,以及探究个性化安全策略对智能体推理路径的优化效应等经典研究课题中,扮演着至关重要的基准角色。其详尽记录的消息历史与调用序列,为复现实验和深入剖析提供了宝贵的实证依据,从而确立了其作为多智能体系统评估黄金标准的地位。
实际应用
在实际应用中,此数据集为构建与检验安全、可靠的AI多智能体系统提供了不可或缺的测试基石。开发人员可利用其丰富的轨迹数据,为智能体训练中的安全微调与策略优化提供参照,尤其是在涉及个性化安全约束的场景下。例如,在模拟的虚拟城堡环境中,该数据集可被用于验证协作型AI助手(如智能客服或具身代理)在遵循用户个性化边界的同时,是否具备行动连贯性与环境适应能力。它支持在企业级应用中,对不同商用模型(如GLM和Qwen的多个变体)进行安全性能的横向对比评估,辅助选型决策。此外,数据集所包含的完整工具调用记录,也为开发自动化评测管道、异常行为检测系统及强化学习环境中的奖励建模提供了高贴合度的现实语料,从而缩短从研究原型到工业落地的转化周期。
衍生相关工作
围绕本数据集,一系列衍生研究已蓬勃展开。其中,一个颇具影响力的方向聚焦于使用Oracle轨迹作为教师信号,开展模仿学习或离线强化学习,以提升Base模型在个性化安全任务中的表现,此类工作显著增强了模型遵循复杂指令与安全约束的能力。另一条研究脉络则基于数据集中丰富的失败案例,开发了针对多智能体系统的红队测试框架与安全性解释工具,推动了对抗性攻击防御策略的革新。此外,该数据集的性能指标催生了新的评估协议,例如对比分析不同拓扑结构下智能体的韧性,进而衍生出一批探讨动态环境对多智能体协作稳定性影响的理论模型。更有学者借助该数据集的日志,向多步工具调用规划与错误恢复机制的研究延伸,为构建更为自主和可信的智能体系统铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务