veAgentBench
收藏资源简介:
VeAgentBench数据集是基于特定场景下代理应用的设计,旨在测试和评估全流程代理开发框架(如veADK)生成的代理质量。该数据集重点关注代理在工具调用、知识库检索、内存管理以及整体性能方面的能力评估。它包含四个子数据集,分别针对教育辅导、财务分析、法律援助和个人助理场景,共484个问题,其中145个问题公开可用。
The VeAgentBench dataset is designed for agent applications in targeted scenarios, with the core goal of testing and evaluating the quality of agents generated by full-process agent development frameworks (e.g., veADK). This dataset prioritizes the assessment of agents' capabilities across tool calling, knowledge base retrieval, memory management, and overall system performance. It comprises four sub-datasets tailored for educational tutoring, financial analysis, legal aid, and personal assistant scenarios respectively, containing a total of 484 questions, out of which 145 are publicly accessible.
VeAgentBench 数据集概述
数据集基本信息
- 数据集名称: VeAgentBench
- 许可证: CC BY-NC 4.0
- 首次发布时间: 2025年11月25日
- 总问题数量: 484个
- 公开问题数量: 145个
数据集设计目标
专注于测试和评估由全流程智能体开发框架生成的智能体质量,重点评估智能体在工具调用、知识库检索、记忆管理和整体性能方面的能力。
数据集结构
配置信息
- 教育辅导子数据集: dataset/educational_tutoring.csv
- 金融分析子数据集: dataset/financial_analysis.csv
- 法律援助子数据集: dataset/legal_aid.csv
- 个人助理子数据集: dataset/personal_assistant.csv
项目目录结构
dataset/ # 数据集文件目录 agents/ # 示例智能体实现 knowledge/ # 知识库文件目录
子数据集详情
法律援助子数据集
- 问题数量: 总计250个,公开70个
- 设计目标: 围绕"分层知识检索能力"设计,覆盖RAG知识库完全覆盖和覆盖不足的场景
- 数据来源: 公共法律条款和案例数据库
- 评估重点: 知识检索能力
金融分析子数据集
- 问题数量: 总计57个,公开20个
- 设计目标: 聚焦金融场景中的"多工具协作需求"
- 数据来源: AKshare项目提供的公开金融数据
- 评估重点: 多工具协作能力、深度研究能力
教育辅导子数据集
- 问题数量: 总计74个,公开25个
- 设计目标: 测试智能体的"RAG信息提取准确性"
- 数据来源: 公共教育教材和辅导材料
- 评估重点: 信息提取准确性、记忆获取关键信息能力
个人助理子数据集
- 问题数量: 总计103个,公开30个
- 设计目标: 从简单到复杂考察智能体在实际任务场景中的工具调用能力
- 数据来源: 基于日常任务和评估目标手动设计
- 评估重点: 工具调用、事件总结、用户画像能力
数据集优势
- 场景导向设计:模拟真实世界智能体行为
- 多维度评估:全面评估智能体能力
- 提供示例智能体:基于火山引擎veADK实现
使用要求
- 法律援助和教育辅导智能体需要配置RAG知识库
- 个人助理智能体需要从火山引擎MCP市场获取相关API KEY
- 使用veADK框架运行示例智能体
许可限制
- 仅限学术研究使用
- 禁止商业用途
- 采用CC BY-NC 4.0许可证




