遇见数据集

wop/my-personal-codex-data

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个编码助手对话日志集合,通过DataClaw工具导出,旨在对抗Anthropic的数据政策,促进数据共享。数据集包含57个会话、20个项目,总计约7560万输入令牌和88.1万输出令牌。数据记录了多种AI模型(如deepseek-v4-flash-free、claude-haiku-4-5-20251001、gpt-5-4等)在编码任务中的对话,包括用户请求、助手响应、工具使用(如bash命令)及结构化内容(如图像附件)。每个会话以JSONL格式存储,包含会话ID、项目名称、模型、时间戳、消息列表和统计信息。数据集适用于文本生成、编码助手、工具使用和代理编码等NLP任务。

This dataset is a collection of coding assistant conversation logs exported via the DataClaw tool, intended to counter Anthropic's data policies and promote data sharing. It contains 57 sessions and 20 projects, totaling approximately 75.6 million input tokens and 881,000 output tokens. The dataset records coding task conversations across multiple AI models (e.g., deepseek-v4-flash-free, claude-haiku-4-5-20251001, gpt-5-4, etc.), including user requests, assistant responses, tool usage (such as bash commands), and structured content like image attachments. Each session is stored in JSONL format, containing session ID, project name, model, timestamp, message list, and statistical information. This dataset is applicable to NLP tasks such as text generation, coding assistants, tool usage, and agent-based coding.

提供机构:
wop
搜集汇总
数据集介绍
wop/my-personal-codex-data 数据集图片
构建方式
该数据集名为my-personal-codex-data,旨在记录编码代理(coding agent)与用户之间的多轮对话交互。数据通过DataClaw工具导出,源自真实的编程协作场景,涵盖多个项目及系列会话。每条记录以JSONL格式存储,包含会话唯一标识、所属项目、使用模型、时间戳等元信息,以及完整的消息序列。消息结构详尽,支持用户文本、附件、助手的思考过程与工具调用记录,保留工具执行结果及其原始输出字段,构建了一套高度结构化的编程对话数据集。
使用方法
该数据集主要面向文本生成与对话建模任务。用户可通过HuggingFace Datasets库便捷加载,使用`load_dataset("wop/my-personal-codex-data", split="train")`即可获取。数据中每条消息的`role`字段区分用户与助手角色,`content`记录语义核心内容,`content_parts`与`tool_uses`等字段则保留了多模态输入及工具交互的细节。适用于训练或评测编码助手模型的对话能力、工具使用规划与长上下文理解,亦可用于分析不同模型在真实场景下的行为差异。
背景与挑战
背景概述
Coding Agent Conversations数据集由研究者Peter Omallet于2025年创建,旨在记录多模型编程助手的交互日志。该数据集收录了13种前沿大语言模型(如deepseek-v4-flash-free、claude-haiku-4-5-20251001、gpt-5-4等)在20个编程项目中的57次会话,累计包含约7570万输入token和88万输出token。其核心研究问题聚焦于Agentic Coding场景下多模型协作的行为模式与工具调用效率,通过对会话中用户请求、模型思考链、工具调用结果等结构化信息的完整保留,为分析编程助手的决策逻辑与交互质量提供了宝贵资源。该数据集在AI辅助编程领域具有独特价值,尤其为研究模型在真实代码修复、项目开发等任务中的表现差异奠定了数据基础。
当前挑战
该数据集面临多重挑战。在领域问题层面,编程助手对话数据的长上下文依赖与多工具调用轨迹使得传统序列建模方法难以有效捕捉决策路径,现有评估框架也缺乏衡量agent在复杂编程任务中自主规划与纠错能力的统一指标。在构建过程中,跨模型会话的异构数据格式(如不同模型的thinking字段定义差异)需要精细的标准化处理;同时,会话中包含的大量base64编码图像与原始工具响应均需设计弹性解析策略以兼容数据源的动态变化,确保数据结构完整性与可复现性。
常用场景
经典使用场景
my-personal-codex-data数据集收录了57段编码助手与人类开发者之间的完整对话会话,涵盖20个实际项目、超过75M输入token及881K输出token。该数据集以会话形式清晰记录了用户指令、模型思考链、工具调用序列及其反馈结果,尤其擅长捕获多轮交互中模型逐步引导完成代码调试、功能开发与架构分析的过程。研究者和开发者可借助这一资源,深入分析大语言模型在真实编程场景下的推理路径与工具调用模式,为构建更精准、更善解人意的代码生成系统提供坚实基础。
解决学术问题
该数据集为探究编码型大语言模型在多轮交互中的推理行为提供了稀缺的自然主义语料,有效缓解了学术研究中长期存在的真实编程对话数据匮乏的难题。通过记录模型在何时调用bash命令、如何解释执行结果、以及如何基于视觉附件(如图片)理解用户意图,研究者能够量化分析模型从任务理解到代码产出的完整认知链条。这有助于揭示模型在复杂项目语境下的错误模式、工具选择偏好与上下文利用策略,从而推动更鲁棒、更可解释的编码智能体研究。
实际应用
在实际工程中,my-personal-codex-data可作为微调与评估编码助手的基准语料,帮助企业级AI工具(如Cursor、Codex CLI)提升在真实项目中的响应质量与工具调用准确性。例如,开发者可据此训练模型更精准地理解多文件项目结构、在长时间对话中维持上下文一致、以及安全高效地执行终端命令。此外,该数据集还可用于构建编码教学辅助系统,使模型能够像经验丰富的程序员那样,逐步引导初学者完成从需求澄清到代码审查的完整开发流程。
数据集最近研究
最新研究方向
该数据集聚焦于编码助手的多模型对话日志,涵盖了来自DeepSeek、GPT、Claude等前沿大语言模型的数十个会话记录,记录了真实编程场景中人类与智能体在代码生成、调试和工具调用等任务上的交互细节。其核心价值在于为agentic coding、工具使用与多模态交互的研究提供了丰富的高质量语料,尤其是在当前大模型能力飞速迭代、开源与商业模型并存的背景下,该数据集可助力探索不同模型在协作编程中的表现差异与对话模式。同时,该项目以“数据公地”理念回应了当下关于AI训练数据开放性与版权壁垒的热点争议,通过公开此类交互日志,推动了透明、共享的科研生态建设,对理解智能体交互行为与推动模型对齐研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务