SimBench
收藏数据链接:
官方服务:
资源简介:
SimBench是一个用于评估偏好条件化代理规划能力的基准数据集,包含用户、任务和模拟上下文(Sims),用于个性化实验。数据集包括47个任务实例、9个典型用户配置文件、3个黄金计划以及模拟定义元数据,覆盖日历、研究、旅行和通信等4个领域。
SimBench is a benchmark dataset for evaluating the planning capabilities of preference-conditioned agents. It includes users, tasks, and simulated contexts (Sims) for personalized experiments. The dataset contains 47 task instances, 9 typical user profiles, 3 gold-standard plans, and simulation-defining metadata, covering four domains including calendar, research, travel and communication.
创建时间:
2026-05-06
原始信息汇总
数据集概述
SimBench 是一个用于评估“偏好条件代理规划”能力的基准测试数据集。其核心概念是通过结构化的 Sims(情境切面)来模拟用户,而非扁平的用户画像。一个任务会激活一个或多个按优先级排序的 Sims,正确的计划取决于哪些 Sims 被激活以及如何解决它们的冲突。
数据规模与构成
| 项目 | 数量 |
|---|---|
| 总任务数 | 47 |
| 领域 | 日历 (17)、研究 (11)、旅行 (10)、通讯 (9) |
| 难度 | 中等 (25)、高 (15)、困难 (3)、低 (4) |
| 标准用户 | 9 |
| 黄金计划 | 3 |
数据结构
数据集中包含以下关键文件结构:
data/simbench/tasks/: 包含 47 个任务实例,每个任务指定了激活的 Sims、可用工具及冲突类型。data/simbench/users/: 包含 9 个标准用户画像,以 Sims 数组形式呈现,例如 Jordan Chen(多情境专业人士)、Alexa Morgan(初创公司运营者)等。data/simbench/gold_plans/: 为最困难的多个 Sims 任务提供 3 个参考计划。data/simbench/metadata/sims.json: 所有 Sim 定义的索引。schemas/: 包含任务、Sim、计划、工具和评估输出的 JSON Schema 定义文件。evaluation/: 包含评估指标代码(Tier 1 确定性指标、Tier 2 LLM 评判器)、评分器和检查脚本。
核心概念与格式
- Sim 格式: 每个 Sim 覆盖一个情境切面(如工作、健康),包含优先级、约束条件和沟通风格。仲裁规则是:当活动的 Sims 冲突时,较早的 Sim 在软约束上拥有更高优先级,而硬约束始终覆盖软约束。
- 任务格式: 任务 JSON 文件包含
active_sims(激活的 Sim ID 有序列表)、available_tools(可用工具)和conflict_types(声明的冲突类别)。 - 计划格式: 代理输出必须为符合 Schema 的 JSON 对象,包含步骤列表、假设和冲突解决策略。
评估指标
SimBench 采用两级评估指标:
- 第一级 — 确定性指标(无需 LLM):PC(计划正确性)衡量与黄金计划中按工具名称和必要参数键匹配的步骤比例;CRA(冲突解决准确性)评估计划声明的冲突策略是否与黄金计划匹配。
- 第二级 — LLM 评判器:PA(偏好遵从度)评估计划满足激活 Sims 优先级和约束的程度;IS(干扰分数)评估未激活 Sims 的偏好是否不恰当地泄露到计划中。此级别需使用 OpenAI API。
使用方式
- 评分单个计划: 可使用
evaluation.metrics中的score_tier1函数进行第一级评分。 - 运行 LLM 评判: 通过命令行运行
evaluation.llm_judge模块,需设置OPENAI_API_KEY。 - 验证计划: 使用
evaluation.sanity_check脚本验证计划是否符合 Schema。
许可与引用
- 许可: 采用 MIT 许可证。
- 引用: 可在研究中引用
@misc{shah2026simbench, ...}。所有用户和场景均为合成的,不涉及真实个人数据。
搜集汇总
数据集介绍

构建方式
SimBench数据集的构建根植于对偏好条件式智能体规划能力的评估需求,通过将用户建模为一组结构化、类型化的上下文层面(即Sims)来突破传统扁平用户画像的局限。数据集涵盖了日历、研究、旅行与通信四个领域,共包含47个任务实例、9个规范用户画像及3个高难度参考计划。每个任务实例以JSON格式明确指定激活的Sims、可用工具、冲突类型及难度等级,而用户画像则由多个Sim数组构成,每个Sim独立覆盖工作、健康、家庭等特定上下文层面,并定义了优先级权重、硬约束条件及沟通风格等属性。仲裁规则规定了当Sims之间产生冲突时,较早激活的Sim在软约束上享有更高优先权,而硬约束始终凌驾于软约束之上。这种结构化设计使得数据集能够系统性地考察智能体在多重偏好约束下的规划能力。
使用方法
使用SimBench时,研究者首先通过pip安装所需依赖包,然后加载任务JSON文件与对应用户画像Sims数据。对于单一计划的评估,可调用evaluation模块中的score_tier1函数,传入任务、参考计划和待评估计划,即可获得确定性的PC与CRA得分。如需进行完整的两阶段评估,可通过命令行运行llm_judge脚本并设置OpenAI API密钥,同时指定任务文件、计划文件与用户目录,从而获得偏好遵从度和干扰分数。研究者也可使用sanity_check脚本对自定义计划的JSON格式进行模式验证,确保其符合预定义的plan.schema规范。数据集鼓励研究者基于现成的参考计划进行复现,也支持修改或新增Sims配置来测试不同偏好组合下的规划效果,适用于智能体规划、人机交互与偏好建模等研究方向。
背景与挑战
背景概述
SimBench是由Chirag Shah于2026年创建的一项基准测试,旨在评估AI代理在偏好条件约束下的规划能力——即同一任务因用户偏好与约束的差异而生成不同且正确规划方案的能力。该数据集的核心创新在于将用户表征为结构化上下文刻面(Sims),而非扁平化档案或事实检索集合,每个Sim涵盖工作、健康、家庭等特定领域。通过激活多个Sim并按优先级排序,SimBench模拟了真实世界中用户偏好复杂交织的场景。其包含47个任务实例、9个规范用户档案及3个黄金规划,覆盖日历、研究、旅行与通信四大领域,为偏好感知的智能规划研究提供了系统化的评估框架。
当前挑战
SimBench所解决的领域问题核心在于智能代理需同时满足用户多重偏好与硬约束,并在冲突时进行合理仲裁——这超越了传统单一目标优化的规划范式。构建过程中面临的挑战包括:首先,如何设计层次分明的Sim结构以涵盖真实用户的多元且动态变化的偏好层级;其次,需定义明确的仲裁规则(如硬约束优先于软约束、高权重Sim优先),以量化评估冲突解决准确性;此外,需合成无隐私风险的虚拟用户数据,确保场景真实性与可控性;最后,开发双层次评价指标(确定性指标与LLM评判器)以兼顾客观性与语义理解,平衡评估的可复现性与深度。
常用场景
经典使用场景
在人工智能与用户建模的交叉领域中,SimBench被广泛用于评估智能体在偏好条件规划任务中的表现。其核心设计围绕模拟真实用户的上下文多面性展开,通过将用户拆解为工作、健康、家庭等结构化Sim单元,构建出复杂的偏好冲突与优先级层次。研究者通常利用SimBench的47个跨域任务(涵盖日历、研究、旅行、通信四大领域)来测试AI系统在激活不同Sim组合时能否生成符合优先级仲裁规则的合理规划。该基准特别适合模拟那些需要同时满足多个用户角色约束的常见场景,例如为一位兼顾工作健康需求的商务旅行者制定行程,从而为理解AI在个性化多目标决策中的能力提供了标准化的实验平台。
解决学术问题
SimBench从根本上解决了学术界在评估AI偏好规划能力时缺乏结构化用户表示的问题。传统方法常将用户简化为扁平档案或事实检索结果,忽视了人类决策中情境依赖和冲突解决的关键动态特性。该数据集首次提出通过Sim数组与优先级权重对用户偏好进行形式化建模,并引入Plan Correctness(PC)和Conflict Resolution Accuracy(CRA)等确定性指标,使研究者能够量化智能体在不同冲突类型(如优先级冲突、约束冲突)下的规划准确性。这一创新填补了现有基准在偏好条件规划、尤其是多Sim交互中冲突消解策略评估的理论空白,推动了更具解释性的用户建模研究发展,同时为个性化系统的鲁棒性分析奠定了方法论基础。
实际应用
在实际应用中,SimBench的技术范式已渗透至多个需要高度个性化决策支持的工业场景。例如,智能旅行规划系统可依据用户的Sim配置(如工作成本约束与健康睡眠偏好),自动生成兼顾预算与身体需求的行程方案。在智能办公助手领域,SimBench的优先级仲裁规则被用于优化日历管理,当会议安排与家庭承诺冲突时,系统能按预定义的Sim优先级自动调整时间分配。此外,研发团队在开发对话式AI时,借鉴其通信风格Sim字段来调整助理的回复语气——若用户Sim设定为'brief and practical',系统将自动缩短回答长度并突出关键信息。这些应用显著降低了用户配置成本,提升了机器决策与人类真实需求之间的契合度。
数据集最近研究
最新研究方向
在人工智能规划与决策领域,偏好条件式智能体规划正成为前沿焦点,SimBench应运而生,旨在评估AI智能体根据用户个性化偏好与约束生成差异化、正确计划的能力。该基准通过结构化的Sim概念——将用户分解为工作、健康、家庭等多维上下文要素——模拟真实世界中用户需求的动态冲突与优先级仲裁,推动智能体从单一任务规划转向上下文感知的精细决策。与当前对个性化AI助手及交互系统可靠性的关注相呼应,SimBench聚焦于冲突解决准确性和偏好遵循度,为评估智能体在复杂约束下的逻辑一致性与用户适配性提供了严谨框架,对智能体系统的人机协同研究具有重要推进意义。
以上内容由遇见数据集搜集并总结生成



