遇见数据集

ISETrace

收藏
github2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

ISE(Intent → Simulate → Execute)是一个三阶段合成范式,用于生成多样、多轮、且真实执行落地的数据,以训练OS Agent。最终得到的语料ISETrace包含23,132条多轮轨迹,平均8.12轮用户回合、68.24轮总对话回合,每条轨迹29.26次工具调用,由43,956条去重后的结构化意图构建而成。该数据集旨在解决现有数据集中缺乏结构化用户意图、多轮任务委派和真实落地工具执行的问题。

ISE (Intent → Simulate → Execute) is a three-stage synthesis paradigm developed to generate diverse, multi-turn, real-world executable data for training OS Agents. The resulting corpus, ISETrace, consists of 23,132 multi-turn trajectories, with an average of 8.12 user turns, 68.24 total dialogue turns, and 29.26 tool calls per trajectory, and is built upon 43,956 deduplicated structured intents. This dataset is designed to mitigate the limitations of existing datasets, which lack structured user intents, multi-turn task delegation, and real-world executable tool execution.

创建时间:
2026-06-08
原始信息汇总

ISE-Trace 数据集概述

ISE-Trace 是一个为训练操作系统智能体(OS Agent)而合成的高质量多轮轨迹数据集,包含 23,132 条完整轨迹。

  • 核心范式:采用 Intent → Simulate → Execute (ISE) 三阶段范式合成数据,旨在解决现有数据集普遍缺少“结构化用户意图”、“多轮任务委派”和“真实工具执行”这三大属性。
  • 数据规模:由 43,956 条去重后的结构化意图构建而成。每条轨迹平均包含 8.12 个用户回合,68.24 个总对话回合,以及 29.26 次工具调用。
  • 意图构造(Stage 1):在 Persona(角色) × Domain(领域) × Task(任务) × Complexity(复杂度) 四维空间上采样结构化意图,使训练数据的分布由用户需求组合驱动。采样空间超过 10¹¹ 种组合。
  • 多轮模拟(Stage 2):使用“角色锁定(Role-locked)用户模拟器”进行多轮交互,通过四条行为约束(视角锁定、语域匹配、增量推进、响应式条件化)抑制角色漂移(实测漂移率仅 0.02%)和状态幻觉。
  • 执行落地(Stage 3):将每一个工具调用在隔离的真实操作系统工作区中执行,记录真实的 stdout/stderr/退出码,从而捕获真实的“失败-恢复”动态。
  • 数据多样性:覆盖 10 个功能域(如 Intelligence-Core、Code-Runtime、File-IO 等),跨 47 个行业965 个不同 persona。全池 Vendi Score(多样性度量)为 61.57。
  • 实验结果:使用 ISETrace 微调 Qwen3-8B 模型,在 ClawEval 评测集上的 pass@1 从 19.3% 提升至 37.7%(+18.4 个百分点),性能超过 GPT-4o 零样本参考和 4 倍规模的 Qwen3-32B 基础模型。
搜集汇总
数据集介绍
ISETrace 数据集图片
构建方式
ISETrace的构建遵循一套名为ISE的三阶段范式。首先,在意图构造阶段,该方法在一个由人物角色、领域、任务和复杂度构成的四维空间中系统性地采样结构化意图,从而使得训练数据的分布由用户需求的组合塑造,而非受限于现存的工具清单。随后,多轮模拟阶段部署了一个具有角色锁定机制的用户模拟器,通过四条行为原则来抑制角色漂移和状态幻觉,驱动智能体与模拟用户间的复杂交互。最终,在执行落地阶段,每一个工具调用都被置于一个隔离的真实操作系统工作区内执行,从而捕获了真实世界中因凭证失败、非零退出码等引发的失败与恢复动态,而非依赖模拟的响应,由此生成了包含23,132条多轮轨迹的高质量语料。
使用方法
使用ISETrace数据集分为两个独立的阶段。第一阶段借助intent_creator仓库,通过配置大语言模型端点,运行脚本在四维空间中采样并生成结构化的用户意图,输出为intents.jsonl文件。第二阶段则利用openclaw_gen_data仓库,首先在本地初始化OpenClaw智能体环境以捕获真实的运行时工具,随后使用第一阶段产生的意图文件作为输入,驱动多轮用户模拟与真实操作系统执行。整个流程最终产出可训练的OpenAI消息格式的轨迹数据,用户可直接将此格式化的数据用于监督微调各类操作系统智能体模型。
背景与挑战
背景概述
操作系统智能体(OS Agent)的研发近年来备受瞩目,其核心在于赋予大语言模型执行多轮、真实环境下的工具调用能力。然而,现有数据集普遍存在结构性缺陷:它们要么从API目录反推任务,导致用户意图分布与真实需求脱节;要么局限于单轮交互,且以模拟代替真实的执行反馈。为填补这一空白,项目团队于2026年基于三阶段范式(Intent→Simulate→Execute)构建了ISETrace数据集。该工作由Valiere团队主导,联合Nairong Zheng等研究者共同推进,相关论文发表于arXiv(2606.11520)。ISETrace包含23132条多轮轨迹,平均每轨迹8.12个用户回合与29.26次工具调用,覆盖10个功能域与965种人物画像。通过在该数据集上微调,Qwen3-8B在ClawEval基准上的pass@1从19.3跃升至37.7,超越GPT-4o零样本性能,有力证明了其在复杂OS任务场景下的实用价值与领域影响力。
当前挑战
ISETrace旨在应对操作系统智能体训练数据生成中双重挑战。首先是领域问题的挑战:现有数据集难以兼顾结构化用户意图、多轮任务委派与真实工具执行三个关键属性,导致训练出的Agent在长尾意图、跨域任务及真实失败恢复方面表现疲软。为此,ISE范式通过4D意图构造(Persona×Domain×Task×Complexity)从用户需求组合采样,避免任务分布被工具空间绑架,并通过真实执行捕获非零退出码与凭证失败等动态信息。其次是构建过程的挑战:多轮模拟中用户模拟器易发生角色漂移与状态幻觉,破坏交互真实性;同时,大规模真实执行面临workspace隔离与存储成本陡增的难题。ISE团队通过四条行为约束(视角锁定、语域匹配、增量推进、响应式条件化)将角色漂移率压制至0.02%,并设计基于共享快照模板的workspace隔离机制,将存储代价从O(N)降至O(1)每worker,兼顾了数据的真实质量与生成可规模性。
常用场景
经典使用场景
ISETrace数据集专为训练操作系统智能体(OS Agent)而设计,其经典使用场景聚焦于多轮、真实执行的工具调用轨迹学习。研究者利用该数据集中的23,132条完整轨迹,每条涵盖平均8.12轮用户回合与29.26次工具调用,来微调语言模型(如Qwen3-8B),使其掌握在真实桌面环境中解析用户意图、委派任务并执行工具操作的复杂能力。该数据集通过三阶段范式(Intent→Simulate→Execute)确保了轨迹的意图导向性、交互多轮性与执行真实性,为OS Agent的指令遵循与工具使用训练提供了高质量的监督信号。
解决学术问题
ISETrace数据集系统性地解决了OS Agent训练数据合成中的三个核心学术难题:意图分布失配、交互单轮化与执行模拟化。传统方法从API目录反推任务导致分布偏移,而ISETrace通过4D意图构造(Persona×Domain×Task×Complexity)使训练分布由真实用户需求塑造,覆盖超过10¹¹种意图组合。基于角色锁定模拟器的多轮交互机制将角色漂移率压制至0.02%,避免了模拟中的身份幻觉。每个工具调用均在隔离的真实操作系统环境中执行,捕获了凭证失败、非零退出等真实失败-恢复动态,大幅提升了Agent在开放环境中的鲁棒性。
实际应用
在实际应用中,ISETrace数据集为构建可部署于个人电脑的智能助手提供了关键训练基础。基于该数据集微调的OS Agent能够处理跨文件管理、代码运行、网页抓取、多媒体操作等10个功能域的复杂多步任务,例如自动化数据整理、软件安装配置或工作流编排。其真实执行特性使Agent能够应对权限不足、路径错误、依赖缺失等实际运行中的突发状况,并具备从失败中自主恢复的能力。数据集覆盖47个行业的965种用户角色,使其在办公自动化、软件开发辅助、系统运维支持等场景中展现出广泛的应用价值。
数据集最近研究
最新研究方向
当前操作系统智能体领域正经历从工具驱动向意图驱动的范式变革,ISETrace数据集在这一前沿趋势中占据核心地位。该数据集通过创新的三阶段合成范式(Intent→Simulate→Execute),突破了传统合成数据从API目录逆推任务的局限性,首次实现了基于Persona×Domain×Task×Complexity四维采样构建结构化用户意图。研究重点聚焦于解决现有数据集普遍缺失的多轮任务委派与真实工具执行动态,其角色锁定用户模拟器将角色漂移率压至0.02%,并通过隔离的真实操作系统环境捕获包含失败恢复过程的完整轨迹。在ClawEval基准上,基于ISETrace微调的8B参数模型不仅以37.7%的pass@1超越GPT-4o零样本参考,更显著揭示了多轮模拟对性能增益的关键贡献(消融实验下降9.6个百分点),为构建真正具备实用价值的OS Agent提供了可复现的优质数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务