遇见数据集

optiq-lab-traces

收藏
Hugging Face2026-08-09 更新2026-08-10 收录
官方服务:

资源简介:

该数据集为 OptiQ Lab Traces,由 OptiQ Lab(mlx-optiq 附带的本地 Web UI)生成,包含 866 个完整的工具调用与研究会话。每个会话存储为一个 JSONL 文件,第一行为会话元数据,后续为消息序列。数据集分为两种类型:深度研究(deep research,605 个会话)和聊天(chat,261 个会话)。深度研究会话执行 TTD-DR 循环,包括计划、生成初稿、基于初稿缺口的搜索与迭代,最终输出带引用的报告;聊天会话是真正的工具调用代理循环,模型可选择 web_search、python 或 terminal 工具,在沙箱容器中执行并返回结果。会话元数据包含 mode、model、domain、ok、elapsed_s 等字段,研究会话额外包含 sources、citations、report_chars、model_calls,聊天会话包含 turns_used、tool_calls、tools_used。数据格式符合 HuggingFace Session-Traces 格式(agent-traces 查看器)。研究轨迹由本地 OpenAI 兼容端点生成,聊天轨迹由 deepseek/deepseek-v4-flash-0731 生成。问题覆盖 43 个研究领域和 25 个聊天领域,包括机器学习、密码学、流行病学、公共政策等。该数据集可用于训练或评估工具调用代理、深度研究循环、Agent 轨迹分析等任务。

This dataset is OptiQ Lab Traces, generated by OptiQ Lab (a local Web UI bundled with mlx-optiq), containing 866 complete tool-calling and research sessions. Each session is stored as a JSONL file, with the first line being session metadata followed by a sequence of messages. The dataset is divided into two types: deep research (605 sessions) and chat (261 sessions). Deep research sessions execute the TTD-DR loop, including planning, generating a first draft, searching and iterating based on gaps in the draft, and finally outputting a report with citations; chat sessions are true tool-calling agent loops where the model can choose web_search, python, or terminal tools, executing in a sandbox container and returning results. Session metadata includes fields such as mode, model, domain, ok, elapsed_s, etc. Research sessions additionally include sources, citations, report_chars, model_calls, while chat sessions include turns_used, tool_calls, tools_used. The data format conforms to the HuggingFace Session-Traces format (agent-traces viewer). Research traces are generated by a local OpenAI-compatible endpoint, and chat traces are generated by deepseek/deepseek-v4-flash-0731. The questions cover 43 research domains and 25 chat domains, including machine learning, cryptography, epidemiology, public policy, etc. This dataset can be used for training or evaluating tool-calling agents, deep research loops, agent trajectory analysis, and other tasks.

提供机构:
MLX Community
创建时间:
2026-08-09
原始信息汇总

OptiQ Lab Traces 数据集概述

基本信息

  • 数据集名称: OptiQ Lab Traces
  • 数据集地址: https://huggingface.co/datasets/mlx-community/optiq-lab-traces
  • 任务类别: 文本生成(text-generation)
  • 数据规模: 少于1K条(n<1K)
  • 数据格式: HuggingFace Session-Traces 格式,每个 .jsonl 文件代表一个会话,首行为会话元数据,后续每行对应一轮消息
  • 数据量: 共 866 个会话

数据来源

该数据集由 OptiQ Lab 产生,这是一个与 mlx-optiq 工具包配套的本地 Web 界面,支持模型量化、微调、深度研究和本地聊天。每个会话是一次完整的运行记录,包括基于实时网络来源构建的深度研究报告,或多轮智能体工具调用循环。

数据结构与内容

会话类型

类型 数量 内容说明
深度研究(Deep Research) 605 个 执行 TTD-DR 循环:模型先制定计划、撰写初稿,然后多轮根据草稿缺口进行搜索并将检索到的来源整合进报告中,最终生成带引用的报告
聊天(Chat) 261 个 真实的智能体循环:模型选择工具、实验室在沙箱容器中执行、结果返回后模型继续决策,包含真实的 toolCallstoolCallId 记录

会话头部字段

每个会话的头部元数据包含:modedeep_researchchat)、modeldomainokelapsed_s

深度研究会话附加字段

字段 含义
sources 实际检索并阅读的页面数量
citations 报告正文中使用的来源标记数(不包含文末参考文献列表中的标记)
report_chars 最终报告的长度
model_calls 循环中发生的模型调用次数

聊天空话附加字段

字段 含义
turns_used 助手轮次数量
tool_calls 发出的工具调用次数
tools_used 出现过的工具(从 web_searchpythonterminal 中选用)

生成方式

  • 深度研究痕迹: 通过 optiq serve 提供的本地 OpenAI 兼容端点生成
  • 聊天痕迹: 使用 deepseek/deepseek-v4-flash-0731 模型生成
  • 领域覆盖: 研究任务覆盖 43 个领域,聊天任务覆盖 25 个领域,涉及 ML 系统、密码学、流行病学、公共政策等多个主题
  • 工具环境: 聊天的工具运行在沙箱容器中,无网络连接且仅含 Python 标准库,因此痕迹中使用了 mathstatisticsjsoncsvitertools 等内置库,而非 numpy 或 pandas

加载方式

python from datasets import load_dataset

ds = load_dataset("mlx-community/optiq-lab-traces", split="train")

一个会话 = 一个文件;头部行携带元数据

sessions = [r for r in ds if r["type"] == "session"] research = [s for s in sessions if s["mode"] == "deep_research"]

相关资源

  • OptiQ Code Traces — 同格式的智能体软件工程轨迹数据集
  • mlx-optiq — 产生该数据集的工具包
  • OptiQ Lab — 本地量化、微调、研究与聊天的 Web 界面
搜集汇总
数据集介绍
optiq-lab-traces 数据集图片
构建方式
该数据集源自OptiQ Lab,一个随mlx-optiq工具包发布的本地Web界面,其构建方式集中于捕捉完整的代理交互会话。具体而言,数据集包含866个会话,每个会话以独立的.jsonl文件存储,遵循HuggingFace的Session-Traces格式。这种格式设计为每个文件的首行包含会话的元数据,随后按轮次记录消息,从而完整保留每一次模型调用时发送的提示语及返回的完成文本。数据集分为两大类别:深度研究(605个会话)和聊天(261个会话)。深度研究会话执行TTD-DR循环,从规划生成初稿,再针对初稿的缺陷进行分轮搜索并将结果融入,期间所有模型调用均被记录。聊天会话则呈现真实的工具调用代理循环,模型在沙箱环境中调用网络搜索、Python执行或终端工具,每步的工具调用及结果均被详细追踪。
特点
该数据集的核心特色在于其精细的元数据结构和真实交互记录。每个会话头部包含关键字段,如模式(深度研究或聊天)、模型、领域、成功与否及耗时。深度研究会话额外记录了来源网页数、引用的标识数、报告长度和调用次数,而聊天会话则包括轮数、工具调用数及使用哪些工具,且引用的统计基于报告正文中的标记,准确反映实际引用行为。这种设计使数据集能够细腻区分检索与引用,揭示模型在真实任务中的信息利用效率。此外,工具调用均运行于无网络的沙箱环境,仅依赖Python标准库,确保了轨迹的纯净性和可复现性。数据集涵盖43个研究领域和25个聊天领域,横跨机器学习、密码学、流行病学等,多样性显著。
使用方法
该数据集的使用方法简便且灵活。虽然HuggingFace预览已关闭,但用户可通过datasets库的load_dataset函数加载数据集,例如使用load_dataset("mlx-community/optiq-lab-traces", split="train")即可获取所有会话。每个会话对应一个数据项,通过检查type字段为"session"即可筛选有效会话,再根据mode字段区分深度研究或聊天模式。这种结构允许研究者针对不同任务进行定向分析,例如提取深度研究会话以研究长文本生成与迭代搜索策略,或分析聊天会话以探讨工具调用决策的合理性。数据集的格式与OptiQ Code Traces一致,便于跨数据集对比研究,且本地生成的特性保证了数据的可验证性,为代理行为研究提供了坚实的数据基础。
背景与挑战
背景概述
OptiQ Lab Traces数据集由mlx-optiq团队于近期创建,旨在记录OptiQ Lab这一本地Web界面所产生的完整研究与会话轨迹。该数据集包含866个会话,分为605个深度研究会话与261个聊天会话,均采用HuggingFace Session-Traces格式存储。其核心研究问题在于捕捉代理系统在真实环境中的工具调用行为,涵盖从初始规划、草稿生成到基于检索的迭代改进,以及多轮工具交互的完整循环。该数据集为研究agent轨迹的生成、分析与优化提供了宝贵的原始语料,对于提升代理系统在科研辅助、动态决策等领域的应用能力具有重要参考价值,尤其为本地化、资源受限场景下的代理行为建模提供了实证基础。
当前挑战
该数据集在构建和使用中面临多重挑战。首先,领域层面,现有代理研究缺乏真实、细粒度的轨迹数据,尤其是深度研究中“检索-生成”迭代循环的中间状态,难以支撑对代理推理与纠错机制的深入分析,限制了模型的自我改进能力。其次,构建过程中,深度研究轨迹的生成涉及对40余个领域的任务覆盖,需确保模型在每轮检索后正确整合新源并修正草稿,而聊天会话则需在无网络、仅含Python标准库的沙盒中执行工具调用,极大限制了可用工具范围,增加了行为多样性与真实性平衡的难度。此外,数据规模仅为866个会话,且预览功能因文件过多而超时,可能影响数据集的可访问性和社区采用,制约了大规模预训练与评估的应用。
常用场景
经典使用场景
该数据集以HuggingFace Session-Traces格式收录了866场由OptiQ Lab驱动的完整智能体会话,涵盖605场深度研究轨迹与261场多轮工具调用日志。这些轨迹详细记录了从任务规划、初稿生成到基于草稿的迭代搜索直至引文报告产出的全流程,以及模型在沙箱环境中对web_search、python、terminal等工具的自主抉择与执行反馈。研究者可借此剖析智能体在真实任务中的推理链路、工具调用策略及错误恢复机制,为复现与基准测试提供高保真的行为样本。
衍生相关工作
该数据集已衍生出若干相关基准与工具。其姊妹数据集OptiQ Code Traces采用同构格式记录了软件工程任务中的智能体轨迹,二者共同构成了覆盖研究探索与编码实践的轨迹体系。围绕这些数据,社区可能发展出针对智能体规划质量、引用准确性、工具调用效率的自动评估指标,并催生用于轨迹压缩、行为克隆或策略学习的训练集。此外,其生成工具mlx-optiq亦成为本地化智能体实验的重要基础设施。
数据集最近研究
最新研究方向
当前,智能体轨迹数据的研究正聚焦于如何从真实交互中提炼可泛化的工具调用策略与推理模式。OptiQ Lab Traces数据集以其866个完整会话,覆盖深度研究(TTD-DR循环)与多轮工具调用代理两大范式,为这一方向提供了稀缺的细粒度观测窗口。其价值在于不仅记录模型决策过程,更通过检索缺口驱动的迭代改稿、沙箱工具执行结果及引用计数等元数据,揭示检索增强生成与自主代理的循环优化机理。该数据集的发布恰逢本地化、小型化智能体系统兴起,为评估模型在受控环境下的规划、工具选择与自我修正能力提供了基准,对推动可解释、可审计的代理系统研究具有范式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务