遇见数据集

ml-intern-sessions

收藏
Hugging Face2026-06-14 更新2026-06-15 收录
官方服务:

资源简介:

ML Intern会话轨迹数据集是一个包含从本地ML Intern运行上传的编码代理会话轨迹的集合,专门设计用于文本生成任务,特别关注代理轨迹和编码代理领域。数据以JSON Lines格式存储,每个文件对应一个完整的ML Intern会话,这些会话被转换为Claude-Code风格的事件流,以便与Hugging Face代理轨迹查看器兼容。每个会话记录包含用户消息、助手消息、工具调用、工具结果、模型元数据和时间戳等丰富信息。会话文件按日期组织在sessions/YYYY-MM-DD/<session_id>.jsonl的目录结构中。需要特别注意的是,该数据集未经过全面的编辑或人工审核,仅应用了自动化的最佳努力清理来移除常见的密钥模式(如Hugging Face、GitHub、AWS和提供商API令牌)。数据集可能包含敏感信息,包括提示词、代码、终端输出、文件路径、仓库名称、私有任务上下文、工具输出或来自本地开发环境的其他数据。使用时应保持适当谨慎,特别是在更改仓库可见性之前,因为轨迹可能包含私人或无关内容、失败的实验、用户意外粘贴的凭据以及从本地文件或服务复制的输出。

The ML Intern session trajectory dataset is a collection of encoded agent session trajectories uploaded from local ML Intern runs. This dataset is specifically designed for text generation tasks, with a focus on agent trajectories and the encoded agent domain. The data is stored in JSON Lines format, with each file corresponding to a complete ML Intern session that has been converted into a Claude-Code style event stream for compatibility with the Hugging Face agent trajectory viewer. Each session record contains rich information such as user messages, assistant messages, tool calls, tool results, model metadata, and timestamps. Session files are organized in a directory structure of sessions/YYYY-MM-DD/<session_id>.jsonl by date. It is important to note that this dataset has not undergone comprehensive editing or human review, and only automated best-effort cleaning has been applied to remove common key patterns (such as Hugging Face, GitHub, AWS, and provider API tokens). The dataset may contain sensitive information, including prompts, code, terminal output, file paths, repository names, private task contexts, tool outputs, or other data from local development environments. Appropriate caution should be exercised when using it, especially before changing repository visibility, as trajectories may contain private or irrelevant content, failed experiments, credentials accidentally pasted by users, and outputs copied from local files or services.

创建时间:
2026-06-09
原始信息汇总

数据集概述

  • 名称: ML Intern Session Traces
  • 语言: 英语 (en)
  • 许可证: 其他 (other)
  • 任务类别: 文本生成 (text-generation)
  • 标签: agent-traces, coding-agent, ml-intern, session-traces, claude-code, hf-agent-trace-viewer
  • 配置: 默认配置,训练集数据来源为 sessions/**/*.jsonl 路径下的所有 JSON Lines 文件

数据内容

  • 数据集包含来自本地 ML Intern 运行的编码智能体会话记录,每个会话对应一个独立的 JSON Lines 文件。
  • 文件存储路径格式:sessions/YYYY-MM-DD/<session_id>.jsonl
  • 每条记录为转换为 Claude-Code 风格事件流的会话数据,兼容 Hugging Face Agent Trace Viewer。
  • 记录内容可包括:用户消息、助手消息、工具调用、工具结果、模型元数据和时间戳。

数据清洗与审查

  • 未进行全面的脱敏或人工审查
  • ML Intern 仅对 Hugging Face、GitHub、AWS 等常见服务商 API 令牌进行自动尽力清洗,不提供隐私保障。
  • 会话可能包含敏感信息,如提示词、代码、终端输出、文件路径、仓库名称、私有任务上下文、工具输出等本地开发环境数据。
  • 使用者应将每个会话视为潜在敏感数据,在公开数据集前务必人工审查每一条会话内容。

注意事项

  • 编码智能体记录可能包含:私有或与任务无关的内容、失败的实验、用户意外粘贴的凭据、从本地文件或服务复制的输出。
  • 在更改仓库可见性前,务必谨慎评估数据安全性。
搜集汇总
数据集介绍
ml-intern-sessions 数据集图片
构建方式
该数据集通过收集ML Intern编码智能体的本地会话轨迹构建而成。每个会话被转换为Claude-Code风格的事件流格式,以JSON Lines文件形式存储于`session/`目录下,并按日期(`YYYY-MM-DD/`)和会话ID组织。构建过程中,系统自动运用最佳努力策略对常见密钥模式(如Hugging Face、GitHub、AWS等API令牌)进行脱敏处理,但未进行全面的去敏复核或人工审查。数据集默认提供训练集划分,所有会话文件汇总为一个统一的数据源。
使用方法
该数据集适用于文本生成任务,尤其面向编码智能体的行为分析与轨迹研究。使用者可通过Hugging Face Agent Trace Viewer加载JSON Lines文件以可视化会话流,或直接解析文件进行模型训练与评估。鉴于数据敏感性,推荐在非公开环境中使用,并手动审查内容后再决定是否公开。默认配置下,使用`load_dataset()`函数即可加载所有`session/**/*.jsonl`文件,无需额外参数设置。
背景与挑战
背景概述
近年来,大型语言模型驱动的编程代理在自动化软件开发任务中展现出巨大潜力,然而其行为轨迹的公开数据集却极为稀缺,限制了该领域的可重复研究和系统评测。ml-intern-sessions数据集由Hugging Face团队于近期构建,旨在收集和共享来自ML Intern编程代理的真实会话记录。该数据集以JSON Lines格式存储,每条记录包含用户信息、助手响应、工具调用及结果、模型元数据和时间戳等结构化信息。作为首个大规模、开放式的编程代理对话轨迹资源,它为研究代码生成、工具使用、多轮交互中的智能体行为提供了宝贵的基础数据,对推动智能编程助手的评估与改进具有重要意义。
当前挑战
该数据集所应对的核心挑战在于编程代理领域长期缺乏真实、多样的交互日志,导致模型训练与评测多依赖于合成数据或受限的封闭环境。构建过程中,隐私与安全是首要难题:会话轨迹可能包含敏感凭证、私有代码路径、终端输出及项目上下文,尽管实施了自动脱敏,但无法保证完全去除所有机密信息。此外,数据质量的不可控性显著——用户输入中夹杂的无关话题、失败实验、误粘贴的密码,以及工具输出的噪声,均可能干扰模型的泛化能力。如何在开放共享与隐私保护之间取得平衡,并建立有效的审查机制,是当前制约该数据集广泛应用的主要瓶颈。
常用场景
经典使用场景
在人工智能体研究领域,特别是编码智能体(coding agent)的行为分析与能力评估中,ml-intern-sessions数据集扮演着不可或缺的角色。该数据集收录了ML Intern编码智能体在本地运行过程中产生的完整会话轨迹,每一条会话均以JSON Lines格式独立存储,包含用户消息、助手消息、工具调用及结果、模型元数据与时间戳等关键信息。研究者可借助这些结构化的会话记录,深入剖析智能体在多轮交互中的决策逻辑、工具调用模式与错误恢复策略,从而为更高效、更鲁棒的编码智能体设计与优化奠定实证基础。
解决学术问题
该数据集直击编码智能体研究领域的核心痛点,即缺乏真实、复杂、长尾的交互轨迹数据来支撑智能体行为建模与能力量化评估。传统的基准测试集往往局限于静态、简化的问题样本,难以反映真实开发环境中的多任务交织、上下文依赖与意外事件。ml-intern-sessions通过提供来自实际ML Intern运行的未经过滤会话序列,使学术界得以探究智能体在开放场景下的工具使用习惯、任务迁移能力以及失败案例中的学习机制。这些数据极大丰富了对于智能体自主行为与人类协作模式的认知,有力推动了更安全、更可解释的编码智能体系构建。
实际应用
在企业级软件开发与科研计算场景中,编码智能体的应用正从辅助代码补全向自动化任务执行演进。ml-intern-sessions数据集所提供的真实会话轨迹,直接服务于智能体服务的运维监测与质量保障。通过分析会话中的工具调用耗时、错误类型分布与用户反馈模式,开发团队可以精准定位智能体的性能瓶颈与行为异常。此外,该数据集还能用于训练自动化的会话摘要与诊断模型,帮助工程师快速理解智能体在特定任务中的表现逻辑,从而在持续集成与部署流程中实现对智能体行为的智能监控与动态调优。
数据集最近研究
最新研究方向
该数据集聚焦于编码智能体(coding agent)在真实开发环境中的会话轨迹记录与分析,属于AI辅助编程与智能体行为学研究的前沿交叉领域。随着Claude Code、smolagents等工具兴起,智能体在机器学习项目中自主执行代码生成、工具调用与调试的能力成为热点。该数据集收录了ML Intern运行时产生的非隐私脱敏的多模态交互事件流,涵盖用户指令、助手响应、工具调用及其结果与时间戳等关键维度,为理解智能体在复杂编程任务中的决策过程、错误恢复机制和协作模式提供了宝贵的自然态行为记录。其意义在于,通过公开这些未经过滤的语料,研究者可直接观察智能体在无人工标注环境下的真实表现,推动更具鲁棒性的代码智能体训练与评估方法的发展,也为揭示智能体与人类开发者交互中的潜在安全与隐私挑战提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务