VibeSearchBench
收藏资源简介:
VibeSearchBench是一个用于模糊多轮主动搜索的数据集,包含200个任务,分为专业研究和日常生活两个子集,涵盖20个领域。每个任务包括一个模糊的初始查询和真实的知识图谱,支持基于人物角色的渐进式披露评估。数据集包含qid、question、user_persona、nodes和triples等字段,并通过三元组F1作为主要评估指标。
VibeSearchBench is a dataset designed for fuzzy multi-turn proactive search. It consists of 200 tasks divided into two subsets: professional research and daily life, covering 20 domains. Each task includes an ambiguous initial query and a real knowledge graph, supporting progressive disclosure evaluation based on user personas. The dataset contains fields such as qid, question, user_persona, nodes, and triples, with triplet F1 as its primary evaluation metric.
VibeSearchBench 数据集概述
核心特性
VibeSearchBench 是一个专注于多轮主动搜索的基准测试数据集,包含 200 个任务,覆盖 20 个领域。其核心定位体现在三个关键词上:
- Hardest(最难):模糊的多轮主动搜索任务,模拟真实场景
- Verifiable(可验证):基于无模式知识图谱的评估体系
- Long-horizon(长周期):基于人物画像的渐进式信息披露
任务类别
数据集分为两个子集,各包含 100 个任务:
| 子集 | 数量 | 描述 |
|---|---|---|
pro |
100 | 专业研究类任务——文献综述、市场分析、技术尽职调查 |
daily |
100 | 日常生活类任务——购物、旅行、生活方式(带偏好演变) |
每个任务由一条模糊的初始查询和一个对应的真实知识图谱组成。
数据集字段
数据集托管于 Hugging Face:VibeSearchBench/VibeSearchBench
| 字段 | 描述 |
|---|---|
qid |
唯一任务标识符 |
question |
完整的带约束研究查询 |
user_persona |
用于渐进式信息披露模拟器的人物画像 |
nodes / triples |
真实知识图谱(节点和三元组) |
评估指标
采用两阶段的 LLM-as-judge 评估方法:
- 节点匹配:LLM 将预测实体与真实实体匹配(支持别名/翻译感知)
- 三元组匹配:对匹配的实体对,LLM 判断关系语义等价性
主要指标:三元组 F1 值。当前最佳成绩为 30.3(Claude Opus 4.6, OpenClaw)。
完整排行榜可在项目页面查看:https://vibebench.github.io/VibeSearchBench.github.io/leaderboard.html
项目结构
VibeSearchBench/ ├── agent/ # 智能体实现 │ ├── general_agent.py # 通用智能体(OpenAI 兼容) │ ├── openclaw_agent.py # OpenClaw 智能体封装 │ ├── llm.py # LLM 客户端工具 │ ├── prompts.py # 提示模板 │ └── toolkit.py # 工具集(搜索/访问/Python) ├── eval/ # 评估模块 │ ├── grader.py # 评分客户端 │ └── evaluator.py # KG 评估(节点F1、三元组F1) ├── scripts/ # 运行脚本 ├── viberesearch_query_synthesis/ # 查询合成模块 ├── website/ # 静态站点模板 ├── tasks/ # 任务 JSON 文件 ├── results/ # 输出目录 ├── model_config.yaml # LLM 模型配置 └── run.py # 主入口
依赖项
openai aiohttp httpx tqdm transformers json_repair
许可证
本项目采用 MIT 许可证。




