遇见数据集

ContextWeave

收藏
arXiv2026-08-05 更新2026-08-07 收录
官方服务:

资源简介:

ContextWeave是由复旦大学、上海创新研究院和字节跳动联合构建的纵向工作流基准数据集,旨在评估语言代理在真实办公场景中利用记忆提升下游任务性能的能力。该数据集包含从14位参与者数月工作流中重建的1,005个可执行任务,其中568个为核心评估任务,涵盖指令、容器化环境、轨迹及评分细则。通过严格的隐私脱敏、任务重构和可控轨迹对齐流程,数据集保留了真实工作流的时序依赖和用户偏好。该基准聚焦于衡量记忆对工作空间质量和个性化偏好对齐的改进效果,并诊断相关性、连续性、可解性和误导鲁棒性,旨在推动记忆系统超越单纯检索,实现可靠的经验复用与工作流延续。

ContextWeave is a longitudinal workflow benchmark dataset jointly constructed by Fudan University, Shanghai Institute of Innovation and ByteDance, which aims to evaluate the capability of language agents to leverage memory to enhance the performance of downstream tasks in real-world office scenarios. This dataset includes 1,005 executable tasks reconstructed from the multi-month workflows of 14 participants, among which 568 are core evaluation tasks covering instructions, containerized environments, execution trajectories and scoring criteria. Through strict privacy de-identification, task reconstruction and controllable trajectory alignment procedures, the dataset retains the temporal dependencies and user preferences of real-world workflows. This benchmark focuses on measuring the improvement effect of memory on workspace quality and personalized preference alignment, as well as diagnosing correlation, continuity, solvability and robustness against misleading information, with the goal of advancing memory systems beyond simple retrieval to achieve reliable experience reuse and workflow continuity.

创建时间:
2026-08-05
原始信息汇总

ContextWeave 数据集详情

概述

ContextWeave 是一个用于评估编码智能体在长期个人工作日志任务中记忆系统的基准测试集。每个任务提供参考工作区状态、参考消息历史、任务元数据和评估规则。在智能体运行前注入记忆组件,基准测试会比较有记忆与无记忆基线的行为差异,并与参考记录进行对比。

数据集内容

数据组成

  • data/tasks/:包含任务元数据、参考轨迹、资源和图像引用
  • data/meetings/:包含选定任务使用的会议和上下文资源
  • data/metrics/:包含偏好规则和参考历史摘录,其中:
    • preference/:按人员分类的全局偏好规则
    • relevance/:按人员分类的参考历史摘录

数据格式

对于每个人员,data/tasks/<person>/ 包含:

  • workflow.json:子任务起始镜像信息
  • message_logs/:每个子任务的参考消息日志(JSON 格式)
  • task/:任务说明、注释和参考文档变更
  • _resources/:子任务使用的文件和中间件资源

data/metrics/preference/<person>.json 包含全局偏好规则;data/metrics/relevance/<person>.json 包含语义相关性评估所需的任务 ID 和摘录文本。

数据压缩包

基准数据以压缩归档文件形式提供:data/task_data.tar.zst,需通过 tar --zstd -xf task_data.tar.zst 命令解压后使用。

论文信息

该数据集出自 arXiv 论文 “ContextWeave: A Real-World Workflow Benchmark”(arXiv:2608.04830),作者包括 Wang Bo、Yao Yuqian、Wang Enxi 等,由复旦大学、上海创新研究院和字节跳动联合开发。

引用方式

如需引用 ContextWeave,建议使用以下 BibTeX 格式:

bibtex @article{wang2026contextweave, title={ContextWeave: A Real-World Workflow Benchmark}, author={Wang, Bo and Yao, Yuqian and Wang, Enxi and Jin, Luozhijie and Liu, Yang and Suo, Yiran and Cai, Yuxuan and Zhou, Enyu and Gao, Yufei and Guo, Honglin and Huai, Tianyu and Ji, Li and Lei, Zhikai and Li, Bufan and Lin, Lizhi and Liu, Jinxiu and Yang, Jie and Zhou, Jiazheng and Zhou, Maosen and Qian, Pengfang and Liu, Shichun and Liu, Guanshan and Zheng, Hao and Yu, Yunhao and Yan, Hang and Kang, Jihua and Chen, Xinchi and Qiu, Xipeng}, journal={arXiv preprint arXiv:2608.04830}, year={2026} }

搜集汇总
数据集介绍
ContextWeave 数据集图片
构建方式
ContextWeave基准的构建根植于真实世界工作流,而非人工设计的任务序列。研究团队从一项开源项目中采集了14名参与者历时数月的工作记录,通过任务流提取、隐私保护处理、指令生成、观察与环境重构、执行验证及受控轨迹对齐等一系列严谨步骤,将原始活动痕迹转化为1005个可执行任务,涵盖568个核心评估任务。每个任务均配备指令、容器化环境、执行轨迹与任务级评分细则,并经过LLM辅助分割与人工校验,确保任务边界清晰、语义保真。通过受控的模拟API与静态资源物化,补全了缺失的观测信息,最终构建出忠实反映真实工作流时序依赖与用户特定偏好的纵向基准。
特点
ContextWeave的核心特质在于其纵向真实性与下游导向评估的深度融合。基准保留了跨任务的时序依赖与稀疏隐性的用户特定偏好,超越了传统检索或问答式记忆评估的局限。其多样性显著,覆盖写作、数据分析、编程、调试等九类真实代理活动,任务轨迹长度跨度大,最长可达212K tokens。基准设计了Workspace Score与Preference Score双重下游指标,辅以相关性、连续性、可解性与幻觉鲁棒性四类诊断指标,精准刻画记忆对代理行为的改善路径。实验揭示,基于具体上下文经验的记忆比摘要式记忆更能支持工作流延续,但也更易受误导性记忆影响,这一发现为记忆系统设计提供了关键洞见。
使用方法
使用ContextWeave时,研究者需遵循其受控评估协议。对于每个核心任务,代理从规范化的任务前状态出发,在隔离的Docker环境中独立执行,仅通过是否注入历史记忆来区分条件。通过对比有无记忆条件下的Workspace Score与Preference Score,可量化记忆组件的贡献。基准支持灵活替换基础模型与记忆组件,其配套的诊断指标能深入剖析记忆的检索质量、行为效应与潜在风险。全量运行成本约200美元,提供了平衡真实性与可复现性的评测方案。研究者可依托GitHub仓库获取完整资源,复现或扩展实验,以探究记忆系统在持久工作流中的实际效能。
背景与挑战
背景概述
ContextWeave基准由复旦大学与字节跳动的研究团队于2026年联合推出,旨在弥合语言智能体从孤立任务向长时程、有状态工作流迁移时对记忆系统评估的缺失。该基准基于14位参与者的真实办公工作流,经严格的隐私去标识化处理,重建为1005个可执行任务,其中568个为核心评估任务,并配套容器化环境、轨迹数据与任务级评分标准。其核心研究问题在于:忆起的过往经验能否切实提升智能体在跨会话工作流中的下游表现。通过对比有无记忆条件下的工作区得分与偏好得分,ContextWeave揭示了记忆从检索导向转向动作导向的重要性,为记忆系统的评估提供了真实、可控且可复现的基准平台,对智能体记忆研究领域产生了深远影响。
当前挑战
ContextWeave面临的挑战集中于两大层面。其一,领域内的根本难题在于:现有评估多将记忆简化为检索或问答,无法真实反映记忆对长程、跨会话任务完成的促进作用,且真实工作流中的依赖关系稀疏、隐含且高度个体化,重复试验式评估难以捕捉。其二,基准构建过程中,需在隐私保护与任务结构保真之间取得平衡,需从残缺的日志中重建指令与环境,并需通过轨迹对齐防止执行漂移,同时确保评估的可复现性与成本可控性。此外,记忆相关性之外的行动力、连续性、可解性与幻觉鲁棒性等维度,也为评估协议的设计带来严峻考验。
常用场景
经典使用场景
ContextWeave作为一项纵向基准测试,其核心应用场景在于评估语言智能体在长时间跨度、状态依赖的真实办公工作流中的记忆能力。该数据集通过重构14位参与者在数月间的工作记录,构建了1005个可执行任务,其中568个为核心评估任务。每个任务均配备指令、容器化环境、执行轨迹与特定评估标准,使得研究者能够在受控条件下,对比智能体在有或无历史记忆接入时的下游任务表现,从而精准衡量记忆组件对工作流连续性与个体偏好契合度的贡献。此基准突破了传统孤立任务评估的局限,为记忆增强型智能体的开发提供了接近现实复杂度的测试平台。
实际应用
在实际应用中,ContextWeave可服务于办公自动化智能体的记忆系统开发与优化。企业可利用该基准测试不同记忆组件(如摘要型、上下文经验型)在真实工作流中的效能,从而选择或设计更契合自身业务需求的记忆方案。例如,通过对比有记忆与无记忆条件下的工作区质量与偏好对齐程度,开发人员能够识别出哪些历史信息对任务续作至关重要,进而优化记忆的存储、检索与利用策略。此外,该数据集还可用于评估不同基础模型在相同记忆组件下的表现差异,指导模型选型与调优,最终提升智能体在文档处理、数据分析、代码编写等场景中的实用性与用户满意度。
衍生相关工作
ContextWeave的发布预期将催生一系列衍生研究。其一,基于其纵向工作流设计,后续工作可能扩展至更多领域与参与者,构建跨行业、跨文化的工作记忆基准。其二,该数据集强调的‘下游性能导向’评估理念,或促使研究者开发新的记忆架构,如融合总结与原始经验优势的混合记忆系统,旨在平衡可操作性与鲁棒性。其三,其诊断指标(如幻觉鲁棒性、可解性)为记忆系统的细粒度优化提供了方向,可能孕育出针对记忆误导的防御机制或主动验证策略。此外,该基准亦可与现有智能体框架(如Codex、SWE-bench)结合,推动记忆组件与执行策略的协同进化,促进通用人工智能助手在长时任务中可靠性的提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务