遇见数据集

VitaBench 2.0

收藏
github2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

VitaBench 2.0是一个用于评估个性化与主动代理在长期用户交互中的基准,它将VitaBench从一次性任务扩展到长期、多会话的用户交互,要求代理在跨越数天、数周或数月的碎片化对话和行为中推断、利用和更新用户偏好。该基准模拟了代理与用户在日常生活场景中跨多个会话的持续关系,支持通过可扩展内存接口进行系统分析,比较三种代表性内存架构。

VitaBench 2.0 is a benchmark for evaluating personalized and proactive agents in long-term user interactions. It extends the original VitaBench from one-off tasks to long-term, multi-session user interactions, requiring agents to infer, leverage, and update user preferences during fragmented conversations and behaviors spanning days, weeks, or months. This benchmark simulates the sustained multi-session relationship between agents and users in daily life scenarios, supports systematic analysis via a scalable memory interface, and enables comparison of three representative memory architectures.

创建时间:
2026-05-26
原始信息汇总

VitaBench 2.0 数据集概述

VitaBench 2.0 是一个用于评估大语言模型(LLM)在长期用户交互中个性化和主动行为的基准测试。它扩展自 VitaBench,将评估从一次性任务提升到长期的、多会话的用户交互场景。

核心理念

该基准测试旨在衡量AI代理是否能够:

  • 从日常碎片化交互中推断用户偏好
  • 利用并随时间更新这些偏好
  • 预期用户不断变化的需求
  • 主动代表用户采取行动

这与VitaBench 1.0(仅关注完成单一复杂生活服务请求)形成对比。

评估场景

  • 模拟代理与用户在日常生活场景中的持续关系,跨越多个会话。
  • 用户偏好会随时间变化,先前的承诺需要被遵守,正确的行动需要重建或检索早期上下文。

支持的记忆架构

为了进行系统分析,VitaBench 2.0 提供了一个可扩展的记忆接口,支持三种代表性记忆架构的对比:

  • 完整上下文 (Full Context):将整个交互历史附加到提示中,是模型可以使用的理论上限。
  • 自主记忆 (Agentic Memory):代理自主决定将信息写入或读出一个结构化记忆存储。
  • 检索增强生成记忆 (RAG Memory):将过去的交互分块、嵌入并按需检索。

重要发现

在完整上下文设置下,即使是目前最先进的模型(SOTA)也只能达到约 50% 的 Avg@4 分数,并且在更现实的记忆设置(自主记忆和RAG记忆)下表现更差。这表明,长期个性化的主动行为对于当前的LLM代理来说仍然是一个开放的挑战。

排行榜摘要

排行榜根据完整上下文设置下的 Avg@4 分数进行排序,并分别列出了非思考模型和思考模型的性能。

非思考模型

在非思考模型中,DeepSeek-V4-Pro 在完整上下文设置下取得了最高的 Avg@4 分数(0.456),Kimi-K2.6 在自主记忆设置下的 Pass@4 分数最高(0.674),DeepSeek-V4-Pro 在检索增强生成记忆设置下的 Avg@4 分数最高(0.424)。

思考模型

在思考模型中,Claude-Opus-4.6 在完整上下文设置下取得了最高的 Avg@4 分数(0.503)和 Pass^4 分数(0.337),DeepSeek-R1-0528 在自主记忆设置下取得了最高的 Pass@4 分数(0.712),DeepSeek-V4-ProClaude-Opus-4.6 并列在检索增强生成记忆设置下取得最高的 Avg@4 分数(0.430)。

关键评估指标

  • Avg@4:每项任务进行4次独立运行的平均成功率(单次尝试)。
  • Pass@4:在4次运行中至少有一次成功的任务比例(最佳4次)。
  • Pass^4:所有4次运行都成功的任务比例(一致性)。

许可协议

该项目采用 MIT 许可证。

搜集汇总
数据集介绍
VitaBench 2.0 数据集图片
构建方式
VitaBench 2.0 的构建源于对大型语言模型在长期、多会话用户交互中表现出的个性化和主动性能力的迫切需求。该基准将单次任务扩展至跨越数天、数周乃至数月的生活场景,通过模拟用户与代理之间持续演进的关系来构建评估体系。具体而言,每个评估任务包含多个会话片段,其中用户偏好会自然漂移、先前的承诺需要被遵守、早期对话上下文必须被检索或重构以正确执行当前操作。为了支持系统性分析,研究者设计了一套可扩展的记忆接口,允许在三种代表性记忆架构(全上下文、代理记忆、RAG 记忆)下进行受控对比实验,从而科学地衡量模型在长期交互中的记忆利用与个性化推理能力。
特点
该数据集的核心特色在于其高度模拟真实世界长期交互的复杂性。它不再停留于单次请求的完成度,而是深入考察代理能否从日常碎片化互动中推断、运用并持续更新用户偏好,如用户兴趣的随时间漂移、跨会话承诺的追踪以及早期信息的召回与整合。通过引入全上下文、代理记忆与RAG记忆三种记忆架构的可控对比机制,VitaBench 2.0 为细粒度剖析模型在个性化建模与主动交互中的短板提供了标准化的实验框架。评测指标涵盖平均成功率(Avg@4)、最佳成功率(Pass@4)与一致性成功率(Pass^4),从多个维度揭示当前最先进模型在长期时间跨度下面临的严峻挑战。
使用方法
使用 VitaBench 2.0 时,研究者需加载其提供的多会话交互评估任务集,并依据任务描述配置代理的记忆架构接口。数据集的评估脚本支持三种预设记忆模式:全上下文模式将所有历史交互拼接至提示中作为上限参考、代理记忆模式让模型自主决策读写结构化存储、RAG 记忆模式则通过分块嵌入与按需检索实现信息访问。用户可调用指定的 API 或本地模型进行推理,通过多次独立滚动执行(如 4 次)收集结果,并利用内置的评分函数计算 Avg@4、Pass@4 与 Pass^4 等指标。详细的代码、评估脚本与示例将在 GitHub 仓库中随数据集一同发布,便于复现与扩展。
背景与挑战
背景概述
VitaBench 2.0由美团长猫团队于近期构建,旨在评估大型语言模型作为智能体在长期、多会话用户交互中的个性化与主动服务能力。核心研究问题聚焦于智能体能否从跨日、周、月的碎片化日常交互中推断、利用并持续更新用户偏好,进而在动态场景中预判需求并主动代劳。该基准将VitaBench从单次任务拓展至时间跨度漫长的连续关系模拟,并引入全上下文、自主记忆与检索增强记忆三种记忆架构进行系统对比。实验表明,即使当前最优模型在理想全上下文设置下仅达约50%的Avg@4得分,而在实际记忆约束下性能进一步衰减,深刻揭示了持久个性化与主动交互仍是LLM智能体领域亟待突破的前沿课题。
当前挑战
VitaBench 2.0所面临的挑战主要体现在两个层面。领域问题层面,传统基准聚焦于单次明确指令的任务完成,而现实场景中用户意图往往隐含于长时跨度的碎片化行为中,要求智能体具备偏好漂移追踪、历史承诺记忆与上下文重构能力,这对模型的持久个性化建模与主动推理构成了系统性困难。构建过程层面,设计模拟真实人类日常生活的多会话情境极具复杂性,需精细刻画偏好的渐进演变与突发变化,同时构建可控的记忆接口以隔离不同记忆机制的效果,还要确保评估指标(如Avg@4、Pass@4、Pass^4)能忠实反映鲁棒性与一致性,对数据质量与实验设计提出了严苛要求。
常用场景
经典使用场景
VitaBench 2.0的设计理念源于对大型语言模型在长期、多会话用户交互中表现出的个性化和主动性的深度考量。在日常生活场景中,用户的意图往往潜藏于碎片化的日常互动之中,要求智能体具备从离散对话与行为中推断、利用并持续更新用户偏好的能力。该基准测试的核心评估范式涵盖三大经典的内存架构——全上下文、智能体记忆与检索增强生成记忆,以此系统性地检验智能体跨越多日乃至数月的时间跨度,如何从历史交互中提取有效信息并做出适时响应。通过模拟用户偏好漂移、过往承诺保留等现实挑战,VitaBench 2.0为衡量智能体在真实世界长期协作中的理解力与主动性提供了严谨的标准化测试平台。
解决学术问题
VitaBench 2.0针对当前大语言模型研究中长期存在的关键学术难题提供了有力的评测方案:如何赋予智能体超越一次性任务完成的持久化个性建模与主动服务能力。传统基准多聚焦于单轮或短程交互表现,难以揭示智能体在面对时间维度上偏好演变、情境重构及先验承诺遵守时的真实能力边界。该数据集通过引入跨会话偏好漂移与记忆依赖的任务设计,填补了对智能体长期用户理解与主动决策能力系统性评估的空白。其意义在于,它不仅揭示了即便最先进的模型在全程上下文条件下也仅能达到约50%的成功率,更暴露出当前模型在真实记忆机制约束下性能显著衰减的窘境,从而为代理记忆架构、长期上下文推理及个性化对齐等方向的研究提供了切实的压力测试与推进动力。
衍生相关工作
VitaBench 2.0的提出催生了一系列具有沿袭性的研究课题与方法创新。基于其对三大记忆架构的标准化比较,后续工作可围绕智能体记忆结构的优化展开,例如探索混合记忆策略以平衡检索效率与上下文丰富度。该数据集还推动了偏好建模技术的发展,促使研究者设计更精细的隐式偏好推断算法,以应对用户意图随时间的自然演变。此外,针对其在全程上下文条件下仍表现有限的关键发现,衍生出对长序列注意力机制与上下文压缩技术的改进探索。更广泛地,VitaBench 2.0所倡导的长期主动服务评估理念已渗透至多智能体协作、人机信任建模等交叉领域,成为衡量智能体社会化能力的重要参照点,促使学术社区重新审视并定义下一代人机交互中的智能度量标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务