遇见数据集

SentinelBench

收藏
arXiv2026-06-06 更新2026-06-09 收录
官方服务:

资源简介:

SentinelBench是由微软研究院等机构开发的开源基准测试集,专注于评估AI代理在时间演化监控任务中的性能表现。该数据集包含100个任务,覆盖电子邮件、日历、金融、社交网络等10个合成Web环境,每个环境配备高保真界面和脚本化事件序列,数据量包括260封邮件、200条消息及多种合成内容,通过生成式模型构建了100个用户角色和201个实体以确保内容一致性。数据集创建过程涉及设计被动、主动及无操作三类任务,并区分绝对与相对判定标准,通过系统化流程生成任务场景和评估指标。其应用领域旨在解决AI代理在长时监控任务中资源消耗与响应速度的权衡问题,为智能体在持续注意力策略下的行为优化提供标准化评估框架。

SentinelBench is an open-source benchmark developed by Microsoft Research and other institutions, focusing on evaluating the performance of AI Agents in time-evolving monitoring tasks. This benchmark consists of 100 tasks spanning 10 synthetic Web environments including email, calendar, finance, social networks and others. Each environment is equipped with high-fidelity interfaces and scripted event sequences. The dataset contains 260 emails, 200 messages and various synthetic contents, and 100 user roles and 201 entities are constructed via generative models to ensure content consistency. The dataset creation process involves designing three types of tasks: passive, active and no-operation, distinguishing between absolute and relative judgment criteria, and generating task scenarios and evaluation metrics through a systematic workflow. Its application scenarios aim to address the trade-off between resource consumption and response speed of AI Agents in long-term monitoring tasks, and provide a standardized evaluation framework for behavior optimization of agents under continuous attention strategies.

创建时间:
2026-06-04
原始信息汇总

数据集概述:Sentinel Environments

Sentinel Environments 是一个基准测试,用于评估人工智能代理在长时间监控任务中的表现。该基准包含 10 个高保真度的 Web 应用副本,测试代理是否能够 “等待”、“监控” 并在条件满足时才“行动”。每个环境都会回放一个脚本化的事件时间线;代理需要注意到正确的时机并做出响应,而不在过程中浪费资源进行轮询。

环境

该基准提供了 10 个环境,每个环境有 10 个监控场景(共 100 个)。

环境 模仿应用 表面 数据类型
MicroMail 电子邮件 (Gmail/Outlook) 收件箱、文件夹、附件、搜索 合成图像
MicroChat 团队消息 (Slack/Teams) 团队、频道、私聊、通话 合成图像
MicroDin 专业网络 (LinkedIn) 动态、联系人、职位、消息 合成图像
MicroHub 代码托管 (GitHub) 仓库、问题、拉取请求、提交、发布 纯文本 (JSONL)
MicroHood 股票交易 (Robinhood) 投资组合、订单、关注列表、新闻 纯文本 (JSONL)
MicroGram 照片分享 (Instagram) 动态、故事、私信、活动 合成图像
MicroTube 视频平台 (YouTube) 动态、播放器、评论、订阅 合成视频/图像
MicroFy 音乐流媒体 (Spotify) 曲目、播放列表、艺术家、歌词 合成音频
MicroLendar 日历 (Google Calendar) 月/周/日视图、事件、任务 纯文本 (JSONL)
MicroScholar 学术搜索 (Google Scholar) 搜索、论文、作者、提醒 纯文本 (JSONL)

场景机制

每个场景是一个 JSON 文件,包含以下关键字段:

  • condition_at: 成功条件最早可能成立的仿真时间(以秒为单位)。
  • kill_at: 主干终止运行的仿真时间(固定为630秒)。
  • event_timeline_end: 事件时间线的右边界(固定为720秒)。
  • events: 一系列事件,例如预加载邮件。
  • eval_sql: 用于评估代理是否成功的SQL查询。

成功条件: 代理的最终结果需要同时满足两个条件:

  1. eval_sql 返回真值。
  2. 代理在 condition_at 时间点或之后访问了 /contact 端点。

系统要求

  • 操作系统: Linux (Ubuntu 20.04+), macOS, 或 Windows WSL2
  • Python: 3.11+
  • Node.js: 18+
  • API 密钥: 仅代理需要(取决于评估的模型),主干本身不需要。

快速开始

  1. 设置依赖: 运行 ./start.sh 或手动设置 Python 虚拟环境并安装依赖,构建 SQLite 数据库,启动API服务器 (uvicorn server.server:app --host 0.0.0.0 --port 8000)。
  2. 启动前端: 在 frontend 目录下运行 npm ci; npm run dev,访问 http://localhost:5173 手动使用环境。
  3. 运行评估: 在主目录下配置 eval_config.yaml 文件,然后运行 python -m server.eval_harness run <会话名> --config eval_config.yaml。使用 grade 命令汇总结果。
  4. 运行时调整: 通过 eval_config.yaml 中的 speed_factor 参数控制仿真时钟相对于现实时间的速度。speed_factor=4.0 时最快(4倍速),speed_factor=0.25 时最慢(1/4倍速)。kill_at 超时时间会相应调整。

仓库结构

sentinel_environments/ ├── server/ # FastAPI 后端 │ ├── handlers/ # 按环境划分的请求处理程序 │ ├── scripts/ # 构建数据库的脚本 │ ├── server.py # 主 FastAPI 应用 │ ├── eval_harness.py # 评估运行器 │ ├── run_simulation.py # 场景回放工具 │ └── timing.py # 时间常量 ├── scenarios/ # 场景 JSON 文件 │ └── <环境名>/ # 命名规则: <目标>-<标准>-<活动>.json ├── data/catalogs/ # 不可变的目录数据 (用户, JSONL) ├── data/public/ # 前端使用的静态媒体文件 ├── frontend/ # React + Vite + TypeScript 前端 ├── data_generation/ # 合成媒体生成管线 └── tests/ # 测试套件

引用

bibtex @misc{maldaner2026sentinelbenchbenchmarklongrunningmonitoring, title={SentinelBench: A Benchmark for Long-Running Monitoring Agents}, author={Matheus Kunzler Maldaner and Adam Fourney and Amanda Swearngin and Hussein Mozannar and Gagan Bansal and Maya Murad and Rafah Hosn and Saleema Amershi}, year={2026}, eprint={2606.05342}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2606.05342}, }

许可

本项目基于 MIT License 许可。

搜集汇总
数据集介绍
SentinelBench 数据集图片
构建方式
SentinelBench的构建基于十个合成Web环境,包括邮件、日历、金融、专业社交网络和娱乐等应用。研究团队首先利用生成式模型创建了100个用户画像和201个实体对象,并为每个环境填充相应的合成内容,如邮件、消息、帖子和股票价格等。在此基础上,通过AI编码代理生成100个监控任务场景,每个场景包含自然语言提示、预定义的事件时间线和用于评估的SQL查询。任务分为被动式、主动式和无操作三类,并进一步按绝对标准与相对标准进行划分。所有任务均经过自动化单元测试和人工审核双重验证,以确保其清晰性和可行性。
使用方法
使用SentinelBench时,研究者只需提供一个可执行的Shell命令模板,其中包含任务提示和起始URL的占位符。评估框架会自动为每个任务填充这些参数,启动仿真并计算指标。代理可以通过访问/contact端点来标记任务完成,服务器随后执行SQL查询以判定任务是否成功。基准要求代理在任务结束时自行报告令牌使用情况,以计算输入令牌数、输出令牌数和总成本。研究者可以通过调节speed_factor参数压缩或延长任务时长,从而在不同时间尺度下比较代理的监控效率。
背景与挑战
背景概述
随着人工智能代理承担越来越长时间跨度的任务,其行为模式正面临根本性挑战——传统的持续行动策略在需要“等待并监控”的场景中往往适得其反。为系统性地衡量代理在此类时序演化监控任务上的表现,来自佛罗里达大学与微软研究院的研究团队于2026年推出了SentinelBench基准测试。该基准包含覆盖邮件、日历、金融、职业社交及娱乐等领域的10个合成网络环境,共计100项任务,每个环境均具备实时网页界面与可回放的脚本化事件序列。SentinelBench不仅评估任务完成率,还首次将反应时间与资源消耗纳入度量体系,揭示了响应性与成本之间的内在权衡,为长时运行监控代理的研究提供了标准化的评测平台,对推动智能代理从“贪婪执行”向“耐心监控”的范式转变具有重要意义。
当前挑战
SentinelBench所面临的核心挑战源于其独特的领域问题定位。传统基准假定环境变化均由代理动作驱动,而时序监控任务要求代理识别外部事件的发生时机,这颠覆了经典交互范式。在构建过程中,团队遭遇多重困难:其一,如何设计兼顾真实感与可控性的合成环境,确保100项任务在10分钟窗口内具备可重复性;其二,任务生成需覆盖被动/主动、绝对/相对两对独立维度,并混入20项无操作任务以防止代理投机策略;其三,事件时序的人工编排可能阻碍未来基于真实分布的训练策略;其四,环境作为轻量级仿制品,长时间交互可能暴露边界,需要持续注入新功能以维持评测的全面性。
常用场景
经典使用场景
在人工智能代理逐步承担起跨越分钟乃至小时级别的长期任务之际,传统的连续行动范式——即代理通过持续调用工具、刷新页面或搜索替代方案来强行推动任务进展——已显露出明显的局限性。SentinelBench应运而生,作为一个专为时间演化监测任务精心设计的开源基准测试,它深刻聚焦于那些要求代理并非持续行动,而是在环境中耐心守望、感知外部事件的发生并适时响应的场景。该基准涵盖了十个合成网络环境中的一百项任务,横跨电子邮件、日历、金融、专业社交网络与娱乐等多个领域,每个环境均提供实时网页界面并回放脚本化的事件序列,从而精准模拟了网页状态随时间动态变化的复杂监测情境。
解决学术问题
SentinelBench的诞生填补了现有学术研究体系中一个显著的空白——绝大多数针对代理系统的基准测试均假设环境是反应式的,即状态变化仅发生于代理的直接行动之后,从而忽视了那些环境独立于代理行为而自主演进的监测类任务。该基准系统性地衡量了代理在任务完成率、反应时间与资源消耗之间的微妙权衡,揭示出响应速度与成本之间的本质张力。通过引入主动与被动任务、绝对与相对判断准则以及无操作任务等多维度的设计,SentinelBench使得研究者能够深入探究代理在等待策略、条件识别与资源分配等方面的行为差异,为理解代理在长时间跨度下的行为模式提供了坚实的实验基础与量化分析框架。
实际应用
在实际应用层面,SentinelBench所代表的监测范式具有广泛而深远的现实意义。无论是金融市场上等待股票价格触及指定阈值后执行交易,还是专业社交网络中监控新职位发布并自动投递简历,抑或是代码托管平台上观察仓库星标数量达到里程碑后触发通知,这些场景均要求代理具备在非持续干预条件下精准感知与高效响应的能力。该基准特别适用于评估各类“哨兵式”代理——这类代理被部署于后台持续监控环境变化,一旦预设条件达成便迅速执行相应操作,从而避免了传统轮询策略所造成的不必要资源浪费与高昂成本。此外,SentinelBench也为诸如定时任务代理、事件驱动型工作流自动化系统以及持续性网页监控服务的性能评估提供了可靠的参照标准。
数据集最近研究
最新研究方向
在长期运行的人工智能代理研究中,SentinelBench的提出标志着一个关键转向,即从传统的连续动作模式迈向可持续监控的智能策略前沿。该数据集聚焦于时间演化的监控任务,通过模拟电子邮件、日历、金融、职业社交和娱乐等十个合成网络环境中的百项任务,系统评估代理在等待外部事件发生时的响应效率、资源消耗与任务完成率的权衡。当前热点方向围绕如何设计具备“忍耐力”的代理,使其在环境中主动等待而非盲目轮询,例如对比sleep与wait_for工具的效果表明,后者在任务时长延长至40分钟时可将成本降低近十倍。这一工作不仅填补了现有基准在非反应性、异步演化场景下的空白,更深刻影响了面向长时间自主工作的代理体系架构设计,推动了人工智能向更高效、更贴合物联网与实时监控需求的实用化演进。
相关研究论文
  • 1
    SentinelBench: A Benchmark for Long-Running Monitoring Agents佛罗里达大学; 微软研究院·AI Frontiers · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务