遇见数据集

ContextEcho

收藏
github2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

ContextEcho 是一个用于衡量前沿LLM在长代理编码会话(数千个工具使用轮次、连续使用数小时)中训练助手角色是否漂移的基准。它包含一个25探针身份套件和工具,可快照真实Claude Code会话前缀,分支对话状态,并在分支上探测任何聊天完成API目标,而不干扰主会话。数据集包括捐赠的会话转录和约42K的每单元JSON响应。

ContextEcho is a benchmark designed to measure whether the trained assistant's role drifts in state-of-the-art LLMs during long agentic coding sessions—sessions with thousands of tool use turns and hours of continuous runtime. It includes a 25-probe identity kit and tools that can snapshot real Claude Code session prefixes, branch the conversation state, and probe any chat completion API targets on the branches without interfering with the main session. The dataset consists of donated session transcripts and approximately 42K per-unit JSON responses.

创建时间:
2026-06-05
原始信息汇总

ContextEcho 数据集详情

数据集简介

ContextEcho 是一个用于评估前沿大语言模型在长时间智能编码会话中“人格漂移”(Persona Drift)现象的基准测试。它包含 25 个探针的身份测试套件和运行框架,通过在真实 Claude Code 会话前缀中创建快照、分叉对话状态,并在不干扰主会话的情况下探测任意聊天补全 API 目标。

该数据集由 Accenture 在 2026 年的 arXiv 预印本中发布。

关键发现

研究在来自 10 个组织的 24 个前沿模型上,基于三个匿名化的真实 Claude Code 会话(包含 3,746 到 9,716 轮对话)进行了测量,主要发现包括:

  1. 漂移具有普遍性,并非特定模型系列独有:人格漂移现象出现在多个组织中,而非仅限于某一个模型系列。
  2. 上下文压缩无法可靠地重置人格漂移:会话内的上下文压缩未能恢复训练好的助手人格。
  3. 单次锚定可以恢复人格:一个大约 110 个 token 的锚定回合可以恢复受测目标在训练中的语言风格,并持续超过 20 轮对话。
  4. 下游影响取决于模式:在工具使用模式下,漂移可能有所帮助;但在无工具聊天模式下,它会破坏格式约定并导致输出长度膨胀。

已发布数据集内容

数据集托管在 Hugging Face 上,文件名为 contextecho2026/persona-drift-contextecho,包含以下内容:

  • 3 个经过脱敏的捐赠会话:位于 data/sessions/ 目录下,大小约 310 MB。
  • 41,921 个单元级 JSON 评估结果:位于 results/ 目录下,大小约 705 MB。覆盖了包括跨上下文压缩轨迹、23 个模型目标面板、25 个探针 × 12 个位置的扩展面板、A-锚定缓解、跨裁判审计、漂移起始扫描、压力测试表面符合性、SWE-Bench 风格延续性任务、以及 TerminalBench 全新任务等多项实验。
  • 数据表文件DATASHEET.md,遵循 Datasheets-for-Datasets 格式。
  • 元数据文件croissant.json,符合 ML Commons Croissant 1.0 标准。
  • 许可文件LICENSE-DATA(CC-BY-SA-4.0)和 LICENSE-CODE(Apache-2.0 参考)。

个人身份信息(PII)的脱敏已通过 13 种模式的 grep 审计验证,确认 0 个命中。

数据集目的与应用

ContextEcho 基准测试旨在衡量前沿大语言模型(如 Claude)的“助手人格”在经过数千次工具调用、持续数小时的使用后是否能够保持不变。它提供了一个标准化的评估框架,用于检测和量化长期会话中的身份一致性。

许可信息

  • 代码(本仓库):Apache-2.0
  • 数据(已发布的数据集):CC-BY-SA-4.0(根据捐赠者同意模板)
搜集汇总
数据集介绍
ContextEcho 数据集图片
构建方式
ContextEcho数据集源自对前沿大型语言模型在长智能编码会话中角色一致性演变的系统研究。其构建过程以三份经过匿名化处理、包含3746至9716轮交互的真实Claude Code会话为基础,设计了涵盖25个探针题项的身份探测套件。研究者通过捕获会话前缀状态、分叉对话分支,在不干扰主会话进程的前提下,于分支上调用目标模型的聊天补全API进行探测,并针对来自10家机构的24个前沿模型展开了跨压缩轨迹、多位置面板扩展、锚点缓解及压力测试等多维实验,最终形成了包含41921个逐单元JSON评估结果的丰富语料库。
特点
该数据集最鲜明的特征在于揭示了角色漂移作为一种普遍现象,广泛存在于不同机构与模型家族之中,而非特定系列的专属问题。研究发现,会话内的上下文压缩技术无法可靠地修复被训练的角色寄存器,但一个约110个令牌的单次锚点干预却能有效恢复角色一致性,并持续影响后续20轮以上的交互行为。此外,漂移的下游效应呈现模式依赖性,在工具辅助场景中可能有利于任务延续,而在无工具的对话模式下则会导致格式约定失效与输出长度膨胀。
使用方法
用户可通过Hugging Face平台下载经严格隐私审计的会话转录与JSON评估数据,利用数据仓库提供的DATASHEET.md与croissant.json元数据进行探索。运行实验时,需配置目标模型的API密钥,执行自包含的实验运行器,这些运行器具备幂等性,支持中断后继续执行。代码仓库中的交互式演示功能允许用户输入任意探针,实时观测有锚点与无锚点两个分支的响应差异及漂移评分,从而直观理解不同干预策略的效果。
背景与挑战
背景概述
随着大型语言模型在长时工具交互场景中的广泛应用,其稳定维持预设助手人格(Assistant Persona)成为关键挑战。2026年,Ding等人联合多所机构推出了ContextEcho基准测试,旨在系统评估前沿语言模型在长时间代理编码会话(涵盖数千轮工具调用、数小时持续交互)中的人格漂移现象。该研究基于24个前沿模型(来自10个机构)的实测数据,揭示了人格漂移具有跨模型家族的普遍性,且现有会话压缩策略难以有效恢复模型训练时习得的角色注册。ContextEcho的贡献在于首次构建了包含25个探测项的智能体人格稳定性评估框架,为长上下文场景下的模型可控性研究提供了标准化测试工具。
当前挑战
ContextEcho主要面临三重挑战:首先,在领域问题层面,长时序编码会话中模型人格稳定性难以保证,实验发现人格漂移普遍存在于各组织模型,且常规上下文压缩方法无法可靠重置模型状态,这直接威胁着智能体系统在复杂任务中的行为可预测性。其次,在基准构建过程中,数据集需要处理长达数千轮的真实会话日志,涉及超过4万次逐单元JSON评估,对PII脱敏验证提出了严苛要求(需通过13种正则表达式的零命中审计)。此外,跨会话的人格漂移测量需精确区分上下文影响与模型固有行为偏差,为此研究团队设计了分支会话状态快照探测方法,在维护主会话连贯性的前提下实现零干扰的人格状态评估。
常用场景
经典使用场景
ContextEcho数据集专为评测前沿大语言模型在长时间代理编码会话中的人格漂移现象而设计。其核心使用场景涵盖:在数千轮工具调用、数小时连续交互的复杂上下文中,通过25个身份探测探针系统性地检测模型是否偏离其预训练助手的角色特征。该基准存储了真实的Claude Code会话片段,并能在不干扰主会话的前提下,对任何遵循聊天补全API的目标模型进行分支状态探测,从而精准量化人格一致性退化程度。
实际应用
在实际应用中,ContextEcho为构建可靠的长周期AI编程助手提供了关键质量保障手段。开发者可利用该数据集的探测框架,在大规模部署前验证模型是否能在连续数小时的编码协作中维持一致的助手风格与响应规范。该工作特别适用于企业级代码辅助工具、自动编程代理平台以及需要长时间人机协作的开发环境,确保AI助手不会因长期交互而出现格式合同违背、输出长度异常膨胀等问题,从而提升用户体验与系统可靠性。
衍生相关工作
ContextEcho数据集催生了多项开创性研究方向。其核心发现推动了锚定恢复策略(A-anchor)的提出,通过在上下文中嵌入短小精悍的人格锚点有效抑制漂移。该基准还与SWE-bench、TerminalBench等任务套件深度整合,用于评估人格漂移在下游任务中的影响模式。此外,其开源框架与贡献者排行榜机制吸引了学界持续共建,推动了跨模型人格稳定性的比较研究以及免内存压缩替代方案的探索,为人机交互中的AI行为可控性开辟了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务