SentinelBench
收藏资源简介:
SentinelBench是由微软研究院等机构开发的开源基准测试集,专注于评估AI代理在时间演化监控任务中的性能表现。该数据集包含100个任务,覆盖电子邮件、日历、金融、社交网络等10个合成Web环境,每个环境配备高保真界面和脚本化事件序列,数据量包括260封邮件、200条消息及多种合成内容,通过生成式模型构建了100个用户角色和201个实体以确保内容一致性。数据集创建过程涉及设计被动、主动及无操作三类任务,并区分绝对与相对判定标准,通过系统化流程生成任务场景和评估指标。其应用领域旨在解决AI代理在长时监控任务中资源消耗与响应速度的权衡问题,为智能体在持续注意力策略下的行为优化提供标准化评估框架。
SentinelBench is an open-source benchmark developed by Microsoft Research and other institutions, focusing on evaluating the performance of AI Agents in time-evolving monitoring tasks. This benchmark consists of 100 tasks spanning 10 synthetic Web environments including email, calendar, finance, social networks and others. Each environment is equipped with high-fidelity interfaces and scripted event sequences. The dataset contains 260 emails, 200 messages and various synthetic contents, and 100 user roles and 201 entities are constructed via generative models to ensure content consistency. The dataset creation process involves designing three types of tasks: passive, active and no-operation, distinguishing between absolute and relative judgment criteria, and generating task scenarios and evaluation metrics through a systematic workflow. Its application scenarios aim to address the trade-off between resource consumption and response speed of AI Agents in long-term monitoring tasks, and provide a standardized evaluation framework for behavior optimization of agents under continuous attention strategies.
数据集概述:Sentinel Environments
Sentinel Environments 是一个基准测试,用于评估人工智能代理在长时间监控任务中的表现。该基准包含 10 个高保真度的 Web 应用副本,测试代理是否能够 “等待”、“监控” 并在条件满足时才“行动”。每个环境都会回放一个脚本化的事件时间线;代理需要注意到正确的时机并做出响应,而不在过程中浪费资源进行轮询。
环境
该基准提供了 10 个环境,每个环境有 10 个监控场景(共 100 个)。
| 环境 | 模仿应用 | 表面 | 数据类型 |
|---|---|---|---|
| MicroMail | 电子邮件 (Gmail/Outlook) | 收件箱、文件夹、附件、搜索 | 合成图像 |
| MicroChat | 团队消息 (Slack/Teams) | 团队、频道、私聊、通话 | 合成图像 |
| MicroDin | 专业网络 (LinkedIn) | 动态、联系人、职位、消息 | 合成图像 |
| MicroHub | 代码托管 (GitHub) | 仓库、问题、拉取请求、提交、发布 | 纯文本 (JSONL) |
| MicroHood | 股票交易 (Robinhood) | 投资组合、订单、关注列表、新闻 | 纯文本 (JSONL) |
| MicroGram | 照片分享 (Instagram) | 动态、故事、私信、活动 | 合成图像 |
| MicroTube | 视频平台 (YouTube) | 动态、播放器、评论、订阅 | 合成视频/图像 |
| MicroFy | 音乐流媒体 (Spotify) | 曲目、播放列表、艺术家、歌词 | 合成音频 |
| MicroLendar | 日历 (Google Calendar) | 月/周/日视图、事件、任务 | 纯文本 (JSONL) |
| MicroScholar | 学术搜索 (Google Scholar) | 搜索、论文、作者、提醒 | 纯文本 (JSONL) |
场景机制
每个场景是一个 JSON 文件,包含以下关键字段:
- condition_at: 成功条件最早可能成立的仿真时间(以秒为单位)。
- kill_at: 主干终止运行的仿真时间(固定为630秒)。
- event_timeline_end: 事件时间线的右边界(固定为720秒)。
- events: 一系列事件,例如预加载邮件。
- eval_sql: 用于评估代理是否成功的SQL查询。
成功条件: 代理的最终结果需要同时满足两个条件:
eval_sql返回真值。- 代理在
condition_at时间点或之后访问了/contact端点。
系统要求
- 操作系统: Linux (Ubuntu 20.04+), macOS, 或 Windows WSL2
- Python: 3.11+
- Node.js: 18+
- API 密钥: 仅代理需要(取决于评估的模型),主干本身不需要。
快速开始
- 设置依赖: 运行
./start.sh或手动设置 Python 虚拟环境并安装依赖,构建 SQLite 数据库,启动API服务器 (uvicorn server.server:app --host 0.0.0.0 --port 8000)。 - 启动前端: 在
frontend目录下运行npm ci; npm run dev,访问http://localhost:5173手动使用环境。 - 运行评估: 在主目录下配置
eval_config.yaml文件,然后运行python -m server.eval_harness run <会话名> --config eval_config.yaml。使用grade命令汇总结果。 - 运行时调整: 通过
eval_config.yaml中的speed_factor参数控制仿真时钟相对于现实时间的速度。speed_factor=4.0时最快(4倍速),speed_factor=0.25时最慢(1/4倍速)。kill_at超时时间会相应调整。
仓库结构
sentinel_environments/ ├── server/ # FastAPI 后端 │ ├── handlers/ # 按环境划分的请求处理程序 │ ├── scripts/ # 构建数据库的脚本 │ ├── server.py # 主 FastAPI 应用 │ ├── eval_harness.py # 评估运行器 │ ├── run_simulation.py # 场景回放工具 │ └── timing.py # 时间常量 ├── scenarios/ # 场景 JSON 文件 │ └── <环境名>/ # 命名规则: <目标>-<标准>-<活动>.json ├── data/catalogs/ # 不可变的目录数据 (用户, JSONL) ├── data/public/ # 前端使用的静态媒体文件 ├── frontend/ # React + Vite + TypeScript 前端 ├── data_generation/ # 合成媒体生成管线 └── tests/ # 测试套件
引用
bibtex @misc{maldaner2026sentinelbenchbenchmarklongrunningmonitoring, title={SentinelBench: A Benchmark for Long-Running Monitoring Agents}, author={Matheus Kunzler Maldaner and Adam Fourney and Amanda Swearngin and Hussein Mozannar and Gagan Bansal and Maya Murad and Rafah Hosn and Saleema Amershi}, year={2026}, eprint={2606.05342}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2606.05342}, }
许可
本项目基于 MIT License 许可。

- 1SentinelBench: A Benchmark for Long-Running Monitoring Agents佛罗里达大学; 微软研究院·AI Frontiers · 2026年




