遇见数据集

ps4mas-final-test-rollouts-0813

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集是 PS4MAS(个性化安全多智能体系统)项目的最终测试 rollout 结果,收录了 16 个不同模型在 200 个 final_test 场景下,基于 4 种拓扑(cold 模式、warm 模式、oracle 模式)的完整 agent-tool-loop 交互轨迹。每个模型均有 800 条记录,总数据量达 12800 条。每条记录包含场景标识符(scenario_id)、用户查询(query)、配置(config)、拓扑(topology)、完整的消息与工具调用历史(hops)、最终输出文本(final_output)、智能体模型名称(agent_model)、智能体标签(agent_tag)以及 rollout 模式(rollout_mode)。数据集不包含 judge 评分,如需评估需额外运行 judge 流程。数据来源于 ps4mas-0521-splits 中的 final_test_scenarios.jsonl,适用于多智能体推理、个性化安全对话、模型对比等研究任务。

This dataset is the final test rollout results of the PS4MAS (Personalized Safe Multi-Agent Systems) project. It contains the complete agent-tool-loop interaction trajectories of 16 different models under 200 final_test scenarios based on 4 topologies (cold mode, warm mode, oracle mode). Each model has 800 records, with a total of 12,800 records. Each record includes scenario_id, query, config, topology, complete message and tool call history (hops), final output text (final_output), agent model name (agent_model), agent tag (agent_tag), and rollout mode (rollout_mode). The dataset does not include judge scores; evaluation requires running an additional judge process. The data originates from the final_test_scenarios.jsonl in ps4mas-0521-splits, and is suitable for research tasks such as multi-agent reasoning, personalized safe dialogue, and model comparison.

创建时间:
2026-08-15
原始信息汇总

PS4MAS 最终测试轨迹数据集(0813)

数据集概览

该数据集为 PS4MAS(个性化安全多智能体系统)的最终测试推理轨迹数据,涵盖 200 个最终测试场景、4 种拓扑结构(冷启动或热启动/预言机模式)下的智能体-工具循环原始输出。注意:数据集中不包含裁判评分,如需评分需另行运行裁判流程。

数据规模与内容

  • 源数据分割ps4mas-0521-splits final_test_scenarios.jsonl
  • 总数据量:每个模型包含 800 行轨迹数据(200 场景 × 4 拓扑),共 15 个模型/配置,总计 12,000 条记录。
  • 文件格式:每个模型的轨迹数据存储于 traces/<模型名>/<模型名>.jsonl 文件中。

覆盖的模型与配置

数据集包含以下 15 种模型/配置(均为 800 行):

类别 模型/配置
强化学习模型 best_rl_gigpo_debate_step40best_rl_gigpo_single_step10
微调模型 best_sft_claude_x5_mixed_ep3
GLM 系列 glm_47flash_baseglm_47flash_oracleglm_9b_baseglm_9b_oracle
Qwen 系列 qwen35_27b_baseqwen35_27b_oracleqwen35_9b_baseqwen35_9b_oracleqwen36_27b_baseqwen36_27b_oracleqwen36_35ba3b_baseqwen36_35ba3b_oracle

数据结构(每条轨迹的字段)

  • 标识字段scenario_id(场景ID)、query(查询)、config(配置)、topology(拓扑结构)
  • 轨迹内容hops(完整的消息/工具调用历史)、final_output(最终回复文本)
  • 元数据agent_model(智能体模型)、agent_tag(智能体标签)、rollout_mode(推演模式)

其他信息

  • 许可证:Apache 2.0
  • 标签:ps4mas、个性化安全、多智能体、推理轨迹
  • 生成方式:由 scripts/0521/push_final_test_results.py 脚本生成。
搜集汇总
数据集介绍
ps4mas-final-test-rollouts-0813 数据集图片
构建方式
本数据集源于PS4MAS个性化安全多智能体系统的最终测试阶段,基于`ps4mas-0521-splits final_test_scenarios.jsonl`划分的200个最终测试场景,在四种拓扑配置(冷启动或热启动/预言机模式)下,由15个不同模型执行智能体-工具循环推理,生成原始交互轨迹。每个模型对应800条输出记录,存储于`traces/<model>/<model>.jsonl`文件中,由`scripts/0521/push_final_test_results.py`脚本生成,确保数据的一致性与可复现性。
特点
该数据集涵盖了多种模型架构,包括强化学习优化模型(如`best_rl_gigpo_debate_step40`)、监督微调模型(如`best_sft_claude_x5_mixed_ep3`)以及不同规模的基础模型(如`qwen35_27b_base`和`qwen36_35ba3b_oracle`)。每条轨迹包含完整的消息与工具调用历史(`hops`)、最终响应文本(`final_output`)以及关键的元数据(如`scenario_id`、`topology`、`agent_model`)。值得注意的是,数据集未包含判定分数,需用户自行运行判定流程,这为后续评估提供了灵活性。
使用方法
使用本数据集时,研究者可按需选取特定模型的轨迹文件,每行对应一个测试场景的完整推理过程。数据以JSONL格式存储,便于直接加载与分析。若要评估模型性能,可基于`final_output`与`hops`字段进行判定,或单独运行判定程序。此外,数据集支持对比不同模型在相同场景下的行为,适用于个性化安全多智能体系统的推理分析、轨迹可视化及模型鲁棒性研究。
背景与挑战
背景概述
该数据集由PS4MAS团队于2025年发布,聚焦于个性化安全多智能体系统的推理轨迹评估。其核心研究问题在于,通过多智能体协作与工具调用,提升个性化安全场景下的响应质量与推理能力。数据集涵盖了多种基础模型(如GLM、Qwen)及不同训练策略(如RL、SFT、Oracle模式),为多智能体系统的性能对比与优化提供了基准。在相关领域内,该数据集填补了多智能体安全推理轨迹标准化评估的空白,对推动个性化安全智能体的发展具有重要意义。
当前挑战
挑战之一在于领域问题的复杂性:多智能体系统需在个性化安全场景中平衡响应准确性、安全性与多轮交互的连贯性,且缺乏统一的评估框架。构建过程中,数据集的生成涉及跨模型、跨拓扑(冷/热启动)的大规模轨迹采集,需处理不同模型输出格式的异构性与工具调用的错误传播。此外,确保轨迹数据的完整性与可复现性、以及避免模型在特定拓扑下的性能偏差,也是构建中的关键难点,后续还需独立评估以获取判断分数,进一步增加了流程的复杂度。
常用场景
经典使用场景
该数据集是面向个性化安全多智能体系统(PS4MAS)的推理轨迹集合,记录了不同模型在200个最终测试场景、4种拓扑结构(冷/热、oracle模式)下的完整代理-工具循环输出。其经典使用场景在于作为多智能体交互的基准测试集,研究者可据此评估各模型在复杂安全约束下的决策过程,深入分析不同拓扑配置(如辩论拓扑与单代理拓扑)对推理质量的影响,从而促进多智能体协作机制与安全对齐策略的验证与比较。
实际应用
在实际应用中,该数据集可服务于自主Agent系统的安全部署与优化。例如,在智能客服、自动驾驶协同决策或工业多机器人协作等场景中,开发者可利用这些推理轨迹来调试与校准各Agent的安全策略,确保在个性化用户需求下仍能遵循安全规范。此外,该数据集的多样拓扑设置模拟了冷启动与知识增强(oracle)条件,有助于企业评估在有限信息下系统性能的变化,从而制定更稳健的工程方案。
衍生相关工作
基于该数据集,研究者可衍生多项经典工作。一方面,可通过训练奖励模型对轨迹进行自动评判,构建偏好数据集以用于进一步的强化学习或偏好优化,例如改进拒绝采样或直接偏好优化(DPO)算法。另一方面,对比不同模型(如GLM系列与Qwen系列)的推理轨迹可催生关于模型规模与安全泛化能力关联性的实证研究,还可利用轨迹进行可解释性分析,提取安全决策的关键模式,为安全对齐库的构建提供基础资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务