SaaSBench
收藏资源简介:
SaaSBench是一个专为智能体基准测试设计的任务输入数据集,包含30个独立任务,每个任务都源自一个真实的开源软件即服务(SaaS)项目。每个任务提供两个核心文件:一份自然语言编写的产品需求文档(PRD),以及一个用于澄清PRD中模糊或歧义点的知识库文件。数据集的主要目的是为评估智能体在理解复杂软件需求并据此生成代码或解决方案的能力提供标准化的输入。数据以结构化形式组织,可通过HuggingFace datasets库加载,每个数据行代表一个任务,包含任务ID、需求文档文本和知识库JSON字符串三个字段。
SaaSBench is a task input dataset specifically designed for agent benchmarking. It contains 30 independent tasks, each derived from a real open-source Software as a Service (SaaS) project. Each task provides two core files: a product requirement document (PRD) written in natural language, and a knowledge base file to clarify ambiguous or unclear points in the PRD. The main purpose of the dataset is to provide standardized inputs for evaluating agents ability to understand complex software requirements and generate code or solutions accordingly. The data is organized in a structured format and can be loaded via the HuggingFace datasets library, with each data row representing a task and containing three fields: task ID, requirement document text, and knowledge base JSON string.
SaaSBench 数据集概述
SaaSBench 是一个专为智能体(agent)基准测试设计的数据集,包含30个自包含的任务,每个任务均源自真实的开源SaaS项目。
任务构成
每个任务包含两种文件:
- task.md:自然语言产品需求文档(PRD),描述任务的目标和要求。
- knowledge_base.json:针对PRD中模糊内容的澄清说明,以JSON格式存储。
数据集结构
- 语言:英文
- 许可协议:Apache-2.0
- 任务类型:文本生成
- 配置:仅包含
default配置 - 数据文件:
data/train.jsonl,训练集
数据列说明
数据集共有三列:
task_id(字符串):任务唯一标识符。task_md(字符串):任务PRD的原始文本内容。knowledge_base(JSON字符串):知识库的JSON格式字符串,可解析为字典。
加载方式
- 通过Hugging Face Datasets库:使用
load_dataset("SaaSBench/SaaSBench")加载,返回一个包含30个样本的数据集。 - 直接下载原始文件:使用
snapshot_download下载,文件路径为{路径}/tasks/<task_id>/task.md和{路径}/tasks/<task_id>/knowledge_base.json。
补充说明
该数据集仅托管任务输入,评估框架相关代码托管于GitHub仓库,不包含在此数据集中。




