遇见数据集

CCWhat Dataset

收藏
github2026-06-15 更新2026-06-16 收录
数据链接:
官方服务:

资源简介:

CCWhat 数据集是一个用于标准化和记录 Agent Session 中切分出的 Task 的数据集,采用四层结构,包括 manifest.json(数据集元信息)、dataset.jsonl(任务定义索引)、traces/(任务执行过程详情)和 scores.jsonl(评分占位)。该数据集支持本地保存和导出为压缩包,用于追踪和分析 AI Agent 的行为。

The CCWhat dataset is a standardized dataset for recording and documenting segmented Tasks within Agent Sessions. It adopts a four-layer structure, including manifest.json (dataset metadata), dataset.jsonl (task definition index), traces/ (detailed task execution process records), and scores.jsonl (score placeholder). This dataset supports local storage and export as a compressed package, and is used for tracking and analyzing the behavior of AI Agents.

创建时间:
2026-06-03
原始信息汇总

codelenagent 数据集概述

数据集版本与定位

  • 当前版本v2.0.0 preview(Task Dataset Builder:数据标准化)
  • 核心功能:将 Agent Session 中切分出的 Task 清洗为标准 Dataset 格式,实现数据标准化。

数据集结构

数据集采用四层结构,根目录为 ccwhat-dataset/,包含以下文件:

文件/目录 说明
manifest.json 数据集元信息,包括 schema_version、tool、session、counts 等
dataset.jsonl 任务定义索引,每行一个 task
traces/ Task 执行过程详情目录
scores.jsonl 评分占位文件,第一版为空

dataset.jsonl

仅存储任务定义,包含字段:

  • id
  • input.instruction
  • input.repo
  • expected.success_criteria
  • metadata.agentmetadata.session_idmetadata.task_sourcemetadata.trace_path

traces/*.json

存储完整执行过程,包含:

  • events、commands、files.read/changed
  • changes、patches、errors、final_claim、repo_state

scores.jsonl

第一版为空,预留用于后续 evaluator 追加评分。

manifest.json

包含 schema_version、tool、session、counts 等元信息。

数据存储与导出

  • 本地存储:可保存到 ~/.ccwhat/datasets/ 本地 Registry
  • 导出格式:可导出为 dataset-*.tar.gz 压缩包
  • 格式校验:由 Dataset validator 自动校验

v1.0.0 历史功能

  • Session Trace 双视图:默认视图展示主执行 Step,调试视图展示完整 Turn 时间线(含 system/context/permission/snapshot/queue 等内部事件)
  • 自动任务切分:从长 Session 中自动识别多个 Coding Task,切分后切换为 Task→会话→Step/Turn 树形结构
  • Turn Detail 完整证据:展示选中 Turn 的完整 tool input/output、thinking 全文、internal event 结构化字段、可展开 raw JSON 和定位信息
  • 三 Agent 支持:覆盖 Claude Code(VS Code)、Codex、OpenCode 三类 Agent
搜集汇总
数据集介绍
CCWhat Dataset 数据集图片
构建方式
CCWhat Dataset的构建源于对AI编程Agent会话过程的深度解析。首先通过自动任务切分,从长时Agent会话中识别出多个独立的编码任务,进而将每个任务定义标准化为dataset.jsonl条目,包含任务ID、指令、仓库信息及成功标准等。随后,每个任务的完整执行轨迹被存储为traces目录下的JSON文件,详细记录了事件、命令、文件读写变更、补丁与错误等。此外,scores.jsonl为后续评分预留,而manifest.json则汇总了数据集的元信息,最终形成具有四层结构的标准化数据集,可本地保存或导出为压缩包。
特点
该数据集的核心特点在于其精细的四层结构设计,实现了任务定义与执行轨迹的清晰分离,便于针对性分析与评估。traces目录提供了Agent行为的完整可追溯视图,包括工具调用、文件操作与错误信息,为研究AI编程行为提供了丰富证据。此外,数据集支持多Agent类型(Claude Code、Codex等),覆盖了从调试到生产的多场景需求,并通过自动校验确保格式一致性,为后续的评分与模型优化奠定了坚实的数据基础。
使用方法
使用CCWhat Dataset时,首先需通过安装CCWhat工具录制Agent会话,或从本地Registry的~/.ccwhat/datasets/目录中加载已有数据集。用户可借助ccwhat export命令列出并导出特定会话的压缩包,再利用ccwhat import命令还原会话进行离线分析。数据集支持通过网页查看器实时追踪Agent行为,或通过编程接口解析dataset.jsonl与traces文件,以进行任务拆分、行为模式挖掘与性能评估。整体流程从录制、导出到分析,形成闭环,适用于AI编程Agent的可视化调试与系统性研究。
背景与挑战
背景概述
CCWhat数据集诞生于大型语言模型驱动的代码智能体(如Claude Code、Codex、OpenCode)在软件开发场景中快速普及的背景下。由PacemakerG团队于2024年创建,该数据集的核心研究问题是如何系统化记录、标准化切分与量化评估代码智能体执行多步骤编程任务时的完整行为轨迹。作为CCWhat工具链的衍生成果,数据集采用四层结构(manifest.json、dataset.jsonl、traces/、scores.jsonl),将原始Agent会话中复杂的交互日志清洗为结构化任务单元,包含指令输入、仓库上下文、执行步骤与执行结果等维度。该数据集填补了代码智能体行为透明度与可审计性的空白,为后续评估框架和Agent行为分析研究提供了标准化基准,对提升AI辅助编程的可靠性与可解释性具有重要推动作用。
当前挑战
CCWhat数据集面临多重挑战。在领域问题层面,核心挑战是代码智能体的行为可审计性:现有Agent在高自由度交互中常出现误读指令、跳过关键步骤或生成不准确结果的现象,却缺乏标准化的行为记录与量化评估体系。此外,Agent幻觉性操作(如虚假声明已读取文件但实际未执行)的检测与标记仍缺乏有效机制。在数据集构建过程中,挑战集中于长会话中多任务的自动切分精度与边界定义一致性,需要区分主执行步骤与系统内部事件(如权限校验、快照保存),同时确保敏感信息(如API密钥、授权令牌)的自动脱敏而不破坏行为证据的完整性。评分体系(scores.jsonl)的初始空白状态也意味着度量标准尚待建立,难以直接支持下游评估任务的自动化开展。
常用场景
经典使用场景
在人工智能与软件工程交叉领域,CCWhat Dataset被广泛用于构建和评估代码智能体的行为可解释性系统。该数据集记录了多种编码智能体(如Claude Code、Codex、OpenCode)在执行编程任务时的完整操作轨迹,包括工具调用、文件读写、命令执行等底层细节。研究者常将其作为基准数据,用于训练能够检测智能体是否真实执行指令的监控模型,或者开发可视化用户界面来追溯智能体的决策过程。其精细化的四层数据结构——从任务定义到执行痕迹再到评分标注——为剖析智能体行为模式提供了标准化的切片工具。
实际应用
在工业实践中,CCWhat Dataset最显著的应用场景是赋能企业级代码智能体的行为审计与安全合规。软件公司和AI开发团队利用该数据集构建的监控流水线,能够实时捕获编码助手在敏感代码库中的每一次操作——从读取环境变量到修改生产配置——从而防止因智能体误操作引发的数据泄露或服务中断。此外,审计人员和测评机构也利用该数据集的评分占位结构(scores.jsonl),开发针对代码智能体的黑盒/白盒测试套件,在模型上线前验证其是否会‘阳奉阴违’。银行、医疗等高度监管的行业中,该数据集已成为保证AI编码工具符合GDPR或HIPAA等合规要求的标准化沙箱。
衍生相关工作
该数据集问世后,衍生出多项具有里程碑意义的研究工作。最经典的包括基于CCWhat的‘智能体行为指纹识别’算法,该算法通过解析每个Step中工具调用顺序与参数分布,提炼出特定模型或系统版本的行为特征,从而实现了对未被识别的代码模型溯源。另一项代表性成果是‘对话式代码审查自动标注器’,它利用该数据集中Turn级别的内部事件序列,训练出能够自动识别智能体是否‘走捷径’或‘跳过验证’的判别模型。此外,研究者还基于CCWhat的双视图体系开发了逆向对齐(reverse alignment)方法论——通过回放执行痕迹来反向推导智能体在错误理解指令时的推理偏差,开辟了交互式代码修复的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务