ISETrace
收藏资源简介:
ISE(Intent → Simulate → Execute)是一个三阶段合成范式,用于生成多样、多轮、且真实执行落地的数据,以训练OS Agent。最终得到的语料ISETrace包含23,132条多轮轨迹,平均8.12轮用户回合、68.24轮总对话回合,每条轨迹29.26次工具调用,由43,956条去重后的结构化意图构建而成。该数据集旨在解决现有数据集中缺乏结构化用户意图、多轮任务委派和真实落地工具执行的问题。
ISE (Intent → Simulate → Execute) is a three-stage synthesis paradigm developed to generate diverse, multi-turn, real-world executable data for training OS Agents. The resulting corpus, ISETrace, consists of 23,132 multi-turn trajectories, with an average of 8.12 user turns, 68.24 total dialogue turns, and 29.26 tool calls per trajectory, and is built upon 43,956 deduplicated structured intents. This dataset is designed to mitigate the limitations of existing datasets, which lack structured user intents, multi-turn task delegation, and real-world executable tool execution.
ISE-Trace 数据集概述
ISE-Trace 是一个为训练操作系统智能体(OS Agent)而合成的高质量多轮轨迹数据集,包含 23,132 条完整轨迹。
- 核心范式:采用 Intent → Simulate → Execute (ISE) 三阶段范式合成数据,旨在解决现有数据集普遍缺少“结构化用户意图”、“多轮任务委派”和“真实工具执行”这三大属性。
- 数据规模:由 43,956 条去重后的结构化意图构建而成。每条轨迹平均包含 8.12 个用户回合,68.24 个总对话回合,以及 29.26 次工具调用。
- 意图构造(Stage 1):在
Persona(角色) × Domain(领域) × Task(任务) × Complexity(复杂度)四维空间上采样结构化意图,使训练数据的分布由用户需求组合驱动。采样空间超过 10¹¹ 种组合。 - 多轮模拟(Stage 2):使用“角色锁定(Role-locked)用户模拟器”进行多轮交互,通过四条行为约束(视角锁定、语域匹配、增量推进、响应式条件化)抑制角色漂移(实测漂移率仅 0.02%)和状态幻觉。
- 执行落地(Stage 3):将每一个工具调用在隔离的真实操作系统工作区中执行,记录真实的 stdout/stderr/退出码,从而捕获真实的“失败-恢复”动态。
- 数据多样性:覆盖 10 个功能域(如 Intelligence-Core、Code-Runtime、File-IO 等),跨 47 个行业的 965 个不同 persona。全池 Vendi Score(多样性度量)为 61.57。
- 实验结果:使用 ISETrace 微调 Qwen3-8B 模型,在 ClawEval 评测集上的 pass@1 从 19.3% 提升至 37.7%(+18.4 个百分点),性能超过 GPT-4o 零样本参考和 4 倍规模的 Qwen3-32B 基础模型。




