遇见数据集

intercode-deepseek-coder-6.7b

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集是DeepSeek-Coder-6.7B-Instruct模型在InterCode环境中生成的智能体轨迹集合,用于智能体可解释性研究。模型使用贪婪解码(温度0,种子0)通过本地vLLM OpenAI端点与InterCode Gym环境交互,每步生成一个动作,最多10轮,保留每个生成token的选定概率和top-5对数概率。奖励由InterCode的执行评分器计算。环境在无Docker的情况下运行:bash使用Alpine rootfs的proot,python使用本地进程,SQL使用本地MariaDB和Spider开发集。数据集包含三个子任务:intercode-bash(200个episodes,平均奖励0.743,解决48个)、intercode-python(261个episodes,平均奖励0.379,解决88个)、intercode-sql(50个episodes,平均奖励0.542,解决26个)。python和SQL运行提前停止,仅包含已收集的episodes。数据目录结构为<env>/<run-id>/01-trajectory/,包含metadata.json、validation.json、trajectories.jsonl或trajectory-shards/。每条轨迹记录包括run_id、environment、index、query、gold、reward、success、steps、outcome、messages(完整对话历史)、generations(每步的助手文本、解析动作、token列表及对数概率、观察结果)、evaluation_info(评分细节)以及通过extend_full_seq.py添加的full_seq字段(用于MICE读取器)。

This dataset is a collection of agent trajectories generated by the DeepSeek-Coder-6.7B-Instruct model in the InterCode environment, used for research on interpretability of agents. The model uses greedy decoding (temperature 0, seed 0) to interact with the InterCode Gym environment via a local vLLM OpenAI endpoint, generating one action per step for up to 10 rounds, and retains the probabilities of selected tokens and top-5 log probabilities for each generated token. Rewards are computed by the execution scorer of InterCode. The environment runs without Docker: bash uses proot with Alpine rootfs, python uses local processes, and SQL uses local MariaDB with the Spider development set. The dataset contains three sub-tasks: intercode-bash (200 episodes, average reward 0.743, 48 solved), intercode-python (261 episodes, average reward 0.379, 88 solved), and intercode-sql (50 episodes, average reward 0.542, 26 solved). The python and SQL runs stopped early, only containing collected episodes. The data directory structure is <env>/<run-id>/01-trajectory/, containing metadata.json, validation.json, trajectories.jsonl or trajectory-shards/. Each trajectory record includes run_id, environment, index, query, gold, reward, success, steps, outcome, messages (full conversation history), generations (assistant text, parsed action, token list with log probabilities, observations per step), evaluation_info (scoring details), and a full_seq field added by extend_full_seq.py (used by the MICE reader).

创建时间:
2026-08-29
原始信息汇总

数据集概述

该数据集为 DeepSeek-Coder-6.7B InterCode pass-1 agent trajectories,由 agent-interpretability 流水线的 pass-1(轨迹生成)阶段产出,记录了代码智能体在 InterCode Gym 环境中的交互轨迹。

核心内容

  • 模型:deepseek-ai/deepseek-coder-6.7b-instruct,贪婪解码(温度 0,种子 0)。
  • 环境:InterCode Gym,包括 bash、python、sql 三种,均以 无 Docker 方式运行。
  • 运行方式:通过本地 vLLM OpenAI 端点驱动,每回合一个动作,最多 10 回合;记录每个生成 token 的选定及 top-5 log-probs。
  • 奖励:使用 InterCode 自带的基于执行的评分器。

数据组成

环境 run-id 回合数 状态 平均奖励 解决数
intercode-bash 20260828T190903Z_temp0_seed0 200 / 200 完成 0.743 48
intercode-python 20260828T185616Z_temp0_seed0 261 / 974 提前停止 0.379 88
intercode-sql 20260828T204327Z_temp0_seed0 50 / 1034 提前停止 0.542 26

python 和 sql 的运行未完成即停止,其 metadata.json 的 status 为 stopped_early,summary 仅反映已收集的回合。分片清单已重新生成,使部分运行自洽。

文件结构

<env>/<run-id>/01-trajectory/ metadata.json 运行配置 + 汇总 validation.json 事后验证报告(如存在) trajectories.jsonl 每个 episode 一条 JSON 记录(bash) trajectory-shards/ trajectories-<start>-<end>.jsonl(python、sql,每 25 条一个分片) trajectory-shards.json 分片清单 + 哈希(python、sql)

记录字段

每条 episode 记录包含:

  • 元数据:run_id、environment、index、query、gold、reward、success、steps、outcome(submitted / step_limit 等)。
  • messages:完整聊天记录(system / user / assistant / observation)。
  • generations[]:每回合的 assistant_text、parsed_action、tokens[](含 token、bytes、logprob、top_logprobs[])、observation、usage/finish。
  • evaluation_info:评分详情(python 为逐测试结果,sql 为 agent/eval 行)。
  • 富化数据(来自 add_full_seq.py):full_seq(聊天模板后的 token ids)、prompt_len、turns[],可适配 MICE 逐字节读取器。

复现方法

代码位于 priyankamary/agent-interpretability 仓库的 srujana 分支,路径为: emil/scripts/01-trajectory/{intercode-bash,intercode-python,intercode-sql}/ 需设置 INTERCODE_*_NODOCKER=1MODEL_ID=deepseek-ai/deepseek-coder-6.7b-instruct

搜集汇总
数据集介绍
intercode-deepseek-coder-6.7b 数据集图片
构建方式
该数据集源自agent-interpretability管线的pass-1轨迹生成阶段,以deepseek-ai/deepseek-coder-6.7b-instruct模型为核心,通过本地vLLM OpenAI端点,在InterCode Gym环境中以贪婪解码(温度0,种子0)驱动,每回合仅执行一个动作,最多10回合,并保留每个生成令牌及其前五候选的对数概率。环境运行采用无Docker方案,分别通过proot在Alpine rootfs中执行bash任务,以本地进程运行python_server.py处理Python任务,以及利用本地mariadbd与Spider基准处理SQL任务,执行语义与官方Docker镜像保持一致。
特点
该数据集涵盖bash、python、sql三个子环境,分别包含200、261、50个回合,平均奖励分别为0.743、0.379、0.542,其中部分运行因提前停止而状态标记为stopped_early。每条记录详实保存了对话轮次、生成令牌的top-5对数概率、动作解析结果及执行反馈,并附有post-hoc验证报告与分片清单,确保数据自洽。尤为独特的是,通过add_full_seq.py脚本为记录增补了聊天模板化的令牌id序列与轮次信息,从而同时支持MICE字节精确读取,为解释性研究提供了双重视角。
使用方法
研究者可借助HuggingFace datasets库直接加载该数据集,依据环境配置选择intercode-bash、intercode-python或intercode-sql子集,每条样本包含查询、基准答案、奖励及完整交互轨迹。通过解析messages与generations字段,可深入分析模型在代码生成任务中的决策过程,结合对数概率信息研究不确定性。对于需要追踪执行细节的实验,evaluation_info字段提供了细粒度的评估结果,而新增的full_seq字段则支持将数据直接输入MICE读取器进行字节级建模,便于在可解释性、模型行为分析及代码智能体性能评估等研究中复用。
背景与挑战
背景概述
在人工智能与代码生成领域交汇的前沿,可解释性研究正逐渐成为理解大语言模型(LLM)行为与决策过程的关键路径。intercode-deepseek-coder-6.7b数据集由Priyanka Mary及其团队于2026年创建,旨在通过记录DeepSeek-Coder-6.7B-Instruct模型在InterCode环境中的完整交互轨迹,为代码代理的可解释性提供实证基础。该数据集的核心研究问题围绕模型在交互式编码任务中的行动选择与推理过程,特别是通过token级对数概率和完整消息历史,揭示模型如何逐步解决编程挑战。数据集的问世填补了高质量、细粒度代理轨迹的空白,为后续的机制可解释性研究、模型行为分析和安全评估提供了宝贵资源,在代码智能与LLM对齐领域产生了初步影响力,促进了可复现的研究范式。
当前挑战
该数据集在构建与应用中面临多重挑战。领域层面,代码代理需处理长程依赖、工具调用和动态环境反馈,其状态空间庞大且动作序列高度复杂,给轨迹建模与解释带来显著困难;同时,跨环境(bash、Python、SQL)的语义差异要求统一的评估标准,而InterCode的执行反馈受限于非Docker宿主机,可能导致执行语义与完整容器环境存在细微偏差。构建过程中,数据集遭遇了运行中断问题,Python与SQL环境的任务进度因资源限制被迫提前终止,导致轨迹收集不完整,平均奖励低(Python为0.379,SQL为0.542),部分任务无法解决,这影响了数据集的统计代表性与下游训练的有效性。此外,无Docker环境下通过proot或本地服务模拟的沙箱可能存在安全与隔离隐患,增加了数据一致性与可复现性的挑战。
常用场景
经典使用场景
该数据集以代码智能体在交互式环境中的轨迹为核心,记录了DeepSeek-Coder-6.7B模型在InterCode基准上逐轮决策的完整过程。其经典使用场景聚焦于代码智能体的行为分析与性能评估,研究者可借此剖析模型在Bash、Python及SQL三类任务中的策略选择、动作执行与奖励反馈机制,从而深入理解代码生成与工具调用的协同效应。
衍生相关工作
该数据集催生了众多后续研究工作,包括基于轨迹的代码智能体解释性分析、密码级推理可视化以及决策路径对比研究。其提供的丰富令牌级概率信息,为探索模型置信度校准、错误纠偏机制及提示敏感性等课题奠定了基础。相关衍生工作已在神经符号推理、交互式代码生成等领域形成重要分支,推动了可解释人工智能与代码智能体的交叉融合。
数据集最近研究
最新研究方向
该数据集聚焦于代码智能体可解释性研究的前沿,通过记录DeepSeek-Coder-6.7B在InterCode环境中的完整执行轨迹与细粒度token级概率信息,为探究代码生成模型的决策机理提供了宝贵素材。其数据涵盖了bash、python、sql三类典型编程任务,并保留了每步动作、观察与奖励信号,支持对智能体行为进行深度剖析。当前热点在于利用此类轨迹数据开展心智对齐与安全可控的代码生成研究,揭示模型在复杂任务中的推理路径与失败模式,进而推动可解释、可干预的下一代代码智能体发展,对提升自动化编程的可靠性与透明度具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务