VitaBench 2.0
收藏资源简介:
VitaBench 2.0是一个用于评估个性化与主动代理在长期用户交互中的基准,它将VitaBench从一次性任务扩展到长期、多会话的用户交互,要求代理在跨越数天、数周或数月的碎片化对话和行为中推断、利用和更新用户偏好。该基准模拟了代理与用户在日常生活场景中跨多个会话的持续关系,支持通过可扩展内存接口进行系统分析,比较三种代表性内存架构。
VitaBench 2.0 is a benchmark for evaluating personalized and proactive agents in long-term user interactions. It extends the original VitaBench from one-off tasks to long-term, multi-session user interactions, requiring agents to infer, leverage, and update user preferences during fragmented conversations and behaviors spanning days, weeks, or months. This benchmark simulates the sustained multi-session relationship between agents and users in daily life scenarios, supports systematic analysis via a scalable memory interface, and enables comparison of three representative memory architectures.
VitaBench 2.0 数据集概述
VitaBench 2.0 是一个用于评估大语言模型(LLM)在长期用户交互中个性化和主动行为的基准测试。它扩展自 VitaBench,将评估从一次性任务提升到长期的、多会话的用户交互场景。
核心理念
该基准测试旨在衡量AI代理是否能够:
- 从日常碎片化交互中推断用户偏好
- 利用并随时间更新这些偏好
- 预期用户不断变化的需求
- 主动代表用户采取行动
这与VitaBench 1.0(仅关注完成单一复杂生活服务请求)形成对比。
评估场景
- 模拟代理与用户在日常生活场景中的持续关系,跨越多个会话。
- 用户偏好会随时间变化,先前的承诺需要被遵守,正确的行动需要重建或检索早期上下文。
支持的记忆架构
为了进行系统分析,VitaBench 2.0 提供了一个可扩展的记忆接口,支持三种代表性记忆架构的对比:
- 完整上下文 (Full Context):将整个交互历史附加到提示中,是模型可以使用的理论上限。
- 自主记忆 (Agentic Memory):代理自主决定将信息写入或读出一个结构化记忆存储。
- 检索增强生成记忆 (RAG Memory):将过去的交互分块、嵌入并按需检索。
重要发现
在完整上下文设置下,即使是目前最先进的模型(SOTA)也只能达到约 50% 的 Avg@4 分数,并且在更现实的记忆设置(自主记忆和RAG记忆)下表现更差。这表明,长期个性化的主动行为对于当前的LLM代理来说仍然是一个开放的挑战。
排行榜摘要
排行榜根据完整上下文设置下的 Avg@4 分数进行排序,并分别列出了非思考模型和思考模型的性能。
非思考模型
在非思考模型中,DeepSeek-V4-Pro 在完整上下文设置下取得了最高的 Avg@4 分数(0.456),Kimi-K2.6 在自主记忆设置下的 Pass@4 分数最高(0.674),DeepSeek-V4-Pro 在检索增强生成记忆设置下的 Avg@4 分数最高(0.424)。
思考模型
在思考模型中,Claude-Opus-4.6 在完整上下文设置下取得了最高的 Avg@4 分数(0.503)和 Pass^4 分数(0.337),DeepSeek-R1-0528 在自主记忆设置下取得了最高的 Pass@4 分数(0.712),DeepSeek-V4-Pro 和 Claude-Opus-4.6 并列在检索增强生成记忆设置下取得最高的 Avg@4 分数(0.430)。
关键评估指标
- Avg@4:每项任务进行4次独立运行的平均成功率(单次尝试)。
- Pass@4:在4次运行中至少有一次成功的任务比例(最佳4次)。
- Pass^4:所有4次运行都成功的任务比例(一致性)。
许可协议
该项目采用 MIT 许可证。




