遇见数据集

juyoung-trl/paper8-trace-2026-05-27

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个Claude Code会话跟踪数据集,名为paper8,记录了2026年5月26日至27日的会话。数据集包含完整的会话记录,以JSONL格式存储,每行代表一个事件(如用户和助手之间的交互、工具调用及其结果)。此外,还包括一个工具结果文件夹,其中包含会话期间从PDF文件中提取的图像附件,这些图像以每页JPG格式保存。数据集的背景是在nationallab-bench/papers/paper8项目中工作期间捕获的。

This is a Claude Code session trace dataset named paper8, capturing a session from May 26, 2026 to May 27, 2026. The dataset contains a full session transcript in JSONL format, with one event per line (including user/assistant turns, tool calls, and results). It also includes a tool-results folder with image attachments extracted from PDFs during the session, saved as per-page JPGs. The session was recorded while working in the nationallab-bench/papers/paper8 project.

提供机构:
juyoung-trl
搜集汇总
数据集介绍
juyoung-trl/paper8-trace-2026-05-27 数据集图片
构建方式
该数据集源于对Claude Code代理在完成特定学术论文复现任务过程中的完整会话轨迹进行系统性采集与整理。具体而言,数据集以JSONL格式存储了一份详尽的会话日志,每条记录对应一次独立的事件,涵盖了用户与助手的多轮交互、工具调用指令及其对应的执行结果。此外,数据集中还单独提取了会话期间从PDF文档中解析出的图像附件,以按页分割的JPG格式保存,构成了多模态辅助信息。这种构建方式使得研究者能够完整回溯智能代理在真实科研场景下的决策与执行链条。
使用方法
研究者可直接加载JSONL文件以解析每一条会话事件,按时间戳排序后重构出完整的代理交互流程。图像附件文件夹需与日志文件配合使用,通过事件中记录的附件索引与对应JPG文件建立关联,从而在分析工具调用结果时能同步查看视觉上下文。该数据集适用于训练和评估面向科研场景的智能代理模型,尤其适合用于研究多步工具调用策略、长上下文推理以及人机协作中的错误恢复机制。
背景与挑战
背景概述
该数据集名为paper8-trace-2026-05-27,记录了2026年5月26日至27日期间,科研人员在名为'paper8'的项目中使用Claude Code进行交互式编程的完整会话轨迹。数据的采集与整理由nationallab-bench研究团队完成,其核心研究问题聚焦于大语言模型在复杂科研工作流中的代理行为分析,尤其是代码生成与交互决策的轨迹可复现性。作为Claude Code会话轨迹的公开样例,该数据集为理解语言模型驱动的代码代理机制提供了第一手资料,对交互式AI软件开发与科学研究自动化的实证研究具有重要参考价值。
当前挑战
当前面临的挑战主要包括三个方面:其一,领域问题层面,传统研究依赖静态代码库或预设任务评估代理性能,难以捕捉真实科研场景中多轮交互、动态纠错与策略演化的复杂行为,本数据集旨在填补这一空白;其二,构建过程中,会话轨迹需精确映射每次用户指令与模型响应的对应关系,同时压缩图像附件、工具调用结果等多模态数据,对存储格式与完整性提出技术挑战;其三,数据隐私方面,需在公开轨迹中去除敏感信息,同时保证关键交互细节不被破坏,平衡开放共享与安全合规之间的矛盾。
常用场景
经典使用场景
在人工智能与软件工程交叉领域,代码代理(Code Agent)的行为追踪数据集日益成为研究者洞察智能编程助手工作机理的关键资源。paper8-trace-2026-05-27 数据集以 Claude Code 在学术论文复现任务中的完整会话轨迹为核心,记录了从用户指令、模型推理到工具调用与结果反馈的每一帧交互事件。其经典使用场景聚焦于代理工作流的细粒度行为分析,研究者可基于多轮对话与工具调用链,还原智能体在复杂编程任务中的决策路径、纠错策略与上下文管理模式。该数据集为理解代码代理在真实科研环境中的协作模式提供了不可多得的原始素材。
解决学术问题
该数据集直面代码代理可解释性与行为建模领域的核心瓶颈:缺乏真实、连续、包含多模态交互痕迹的开放式编程会话数据。借助 JSONL 结构化事件流与提取自 PDF 的多页图像信息,研究者得以系统探究智能体在长周期任务中的知识演进规律、工具选择偏误以及错误恢复机制。这一数据资源为构建高保真的代理行为仿真器、评估提示策略对任务完成质量的因果影响、以及训练下一代可解释代码模型奠定了实证基础。从方法论层面,它推动了软件开发自动化研究从静态代码补全向动态过程理解的重要跃迁。
实际应用
在实际工程与科研协作场景中,该数据集可被直接用于代码代理产品的质量评估与迭代优化。企业 AI 团队可据此复现典型复现工作流,测试模型在面对模糊指令、多文件编辑与外部工具依赖时的鲁棒性与效率。教育科技领域可基于会话轨迹开发编程辅导系统的教学案例库,帮助学生理解专家级开发者与 AI 助手的协同推理过程。此外,数据集中包含的 PDF 图像附件,为多模态编程助手在图表理解与文档对齐任务上的性能评测提供了宝贵的真实场景测试集。
数据集最近研究
最新研究方向
该数据集聚焦于AI智能体(Agent)在科研场景中的操作轨迹追踪,尤其是通过Claude Code等编码助手完成学术论文复现或实验设计的全流程记录。当前前沿研究方向正从静态基准评测转向动态、长周期、多工具协作的智能体行为建模,该数据集捕捉了2026年5月26日至27日期间用户在真实科研项目中的逐步操作,涵盖用户与助手的交互轮次、工具调用及其结果回传,为研究智能体的规划能力、工具使用效率与错误恢复机制提供了高保真素材。这一方向与近期热点的智能体可靠性、可复现性及透明性需求一脉相承,尤其在大模型辅助科学研究日益普及的背景下,为理解智能体如何协调多步复杂任务、处理非结构化数据(如PDF图像提取)提供了关键实证,推动从孤立的单任务评估向生态化、过程化研究范式的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务