遇见数据集

MYPCBENCH

收藏
arXiv2026-06-15 更新2026-06-17 收录
数据链接:
官方服务:

资源简介:

MYPCBENCH是由卡内基梅隆大学团队创建的一个用于评估个性化智能计算机使用代理的基准数据集,其核心在于构建了一个模拟真实个人计算机环境的可复现Linux桌面系统。该数据集包含184个任务,覆盖了17个预登录的模拟网络应用及完整桌面堆栈,数据总量包括1,812笔银行交易、2,398封电子邮件等丰富记录,所有数据均基于电视剧《办公室》中的角色Michael Scott的个人身份生成,确保跨应用一致性。数据集的创建过程通过确定性生成管道,从统一的用户身份规范中同步生成多应用数据,并利用编码代理进行质量验证。该数据集主要应用于评估人工智能代理在真实个人计算机环境中的个性化任务执行能力,旨在解决现有基准测试在模拟用户历史数据和跨应用上下文方面的不足,推动个性化助手技术的发展。

MYPCBENCH is a benchmark dataset developed by the team at Carnegie Mellon University for evaluating personalized intelligent computer usage agents. Its core component is a reproducible Linux desktop system that simulates a real-world personal computing environment. This dataset includes 184 tasks, covering 17 pre-logged simulated web applications and a complete desktop stack. It contains a rich set of records, such as 1,812 bank transactions and 2,398 emails, among other data. All data is generated based on the personal identity of Michael Scott, a character from the TV series *The Office*, to ensure cross-application consistency. The dataset is created via a deterministic generation pipeline, which synchronously generates multi-application data from a unified user identity specification, and utilizes coding agents for quality validation. This dataset is primarily used to assess the personalized task execution capabilities of AI agents within real personal computer environments, aiming to address the limitations of existing benchmarks in simulating user historical data and cross-application context, thereby advancing the development of personalized assistant technologies.

提供机构:
卡内基梅隆大学
创建时间:
2026-06-15
搜集汇总
数据集介绍
MYPCBENCH 数据集图片
构建方式
MYPCBENCH 构建于一个可复现的 Linux 桌面环境之上,采用 Docker 容器封装 QEMU/KVM 虚拟机,运行 Ubuntu 24.04 与 GNOME 桌面。环境中集成了 17 个模拟真实消费服务的预登录网页应用、LibreOffice 办公套件及预置浏览历史的 Firefox 浏览器。所有数据源自单一规范角色 Michael Scott 的 JSON 配置文件,通过确定性 Python 流水线生成 1,812 条银行交易、2,398 封邮件、679 个日历事件等跨应用一致的记录,确保一次旅行在六类应用中留下关联痕迹。整个环境从基础快照启动,任务间通过快照回滚实现状态重置。
特点
该数据集的核心特点在于三方面:跨应用一致性,如一次餐饮预订同时更新预约应用、银行交易和聊天记录;角色连贯性,基于《办公室》剧集填充角色社交网络、财务档案与日常偏好,使数据具有真实人物背景;现实保真度,每个网页应用克隆真实产品的界面与工作流,而非静态模拟。184 个任务源自 OpenClaw 社区的真实用户请求,涵盖六种行为类型,其中 68% 的任务涉及多个应用交互,40% 跨越不同领域类别,深度考验智能体的个性化服务能力。
使用方法
研究者通过统一智能体框架驱动模型,该框架将各提供商的计算机使用 API 映射至 OSWorld 的 pyautogui 动作空间,并辅以 bash 工具。每步接收 1280×800 桌面截图,在 100 步预算内执行点击、键入、滚动等操作。评估采用大语言模型裁判,依据每任务平均 6.5 条自然语言评分细则对完整轨迹进行单项评判,计算加权得分与完美完成率。环境已开源为 Docker 镜像,支持直接加载或通过 QEMU 启动,任务、评分细则及评估代码均随数据集发布。
背景与挑战
背景概述
MYPCBENCH 由卡内基梅隆大学的 Lawrence Keunho Jang 等研究人员于 2026 年创建,旨在填补现有计算机使用智能体基准测试与真实个人助手部署之间的鸿沟。当前大多数基准测试在非个性化环境中评估智能体,忽略了用户完整的数字生活——包括上下文、历史数据和已登录账户。该数据集构建了一个基于 Linux 桌面的可重复评估环境,内嵌 17 个模拟真实网络应用,并以《办公室》角色 Michael Scott 作为单一规范用户,共定义 184 项任务,每项均源自 OpenClaw 社区的真人请求。MYPCBENCH 揭示了最强模型仅能完全解决 55.4% 的任务,深刻影响了以个性化为核心的智能体评估研究方向。
当前挑战
该数据集面临多重挑战:首先,在领域问题层面,现有基准无法测试智能体在跨应用、跨历史数据的个性化场景中的真实表现,例如处理需登录或涉及个人信息的网站任务,而这是个人助手必须驱动的核心场景。其次,在构建过程中,研究人员需解决跨应用数据一致性问题——确保一次旅行在银行、日历、邮件等应用中留下相互关联的记录;同时需生成一个深度丰富的规范用户身份,涵盖 1,812 笔银行交易、2,398 封邮件等海量数据,并保证可重现性。此外,184 项任务需通过手动筛选和社区请求转换,确保实体名称与种子数据匹配,再经多位作者逐项审核,过程繁琐且耗时。
常用场景
经典使用场景
在个性化智能体评估领域,MYPCBENCH被设计为检验计算机使用智能体作为个人助理的能力。当前主流基准测试多在非个性化环境中运行,忽视用户数字生活中的历史数据与登录账户状态。MYPCBENCH通过构建一个包含17个预登录网络应用和完整桌面栈的Linux环境,并以迈克尔·斯科特这一具体身份进行全端数据填充,使得智能体必须依据用户的历史记录、跨应用上下文和个人偏好执行任务。其经典使用场景聚焦于智能体在真实桌面环境中,利用个人化信息完成诸如银行转账、餐厅预订、邮件往来等多步骤操作,从而衡量模型在个性化情境下的综合表现。
衍生相关工作
MYPCBENCH的发布催生了多项围绕个性化计算机使用智能体的后续研究。其数据生成管线与跨应用一致性设计为同类基准提供了可复现的范式,如Claw-Eval、ClawBench和WildClawBench等基准借鉴了MYPCBENCH的长期任务与多应用程序交互理念。此外,该工作推动了个人化基准与智能体设计之间的闭环迭代:开源的环境、任务集与评分裁判使得研究者能够测试模型在个性化桌面环境中的泛化能力,并针对性地改进代理策略。后续工作可能进一步扩展至多身份设定、更丰富的应用生态与真实敏感数据处理,从而加速个人计算机使用智能体从实验室走向生产环境的落地进程。
数据集最近研究
最新研究方向
当前,MYPCBENCH引领的个性化计算机使用代理研究前沿聚焦于跨应用身份一致性与长时程任务规划。该基准挑战传统评估中缺乏用户真实历史数据的局限,通过构建包含17个预登录网络应用、超过1800笔银行交易及10746次网页浏览的完整Linux桌面环境,系统性地检验智能代理在个人化场景下的表现。研究揭示了前沿模型在跨应用协调(7个以上应用时最优模型仅达36%完成率)、模式推断(如推断用户小费习惯)等高阶任务上的显著瓶颈,并识别出三类典型失败模式:过早终止、用户界面绕过及幻象数据生成。这一方向推动了从静态工具评估向真正个人助手的转变,为模型在个性化部署前的安全验证提供了关键基准。
相关研究论文
  • 1
    MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents卡内基梅隆大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务