SWE-Pro
收藏资源简介:
SWE-Pro 是一个用于评估语言模型和LLM代理在真实世界软件优化任务上性能的基准数据集。该数据集收集了来自流行Python代码库的优化场景,并以专家人工提交的pull request作为性能目标的黄金标准。数据集包含102个测试样本,每个样本包含完整的优化场景信息。数据结构包括:唯一标识符(id, scenario_id)、源代码库信息(repo, pr_number)、版本控制信息(baseline_sha, reference_sha)、任务描述(task, entry_point, whats_new)、执行环境元数据(docker)、结构化代码上下文(oracle_context)、性能场景参数(params)以及核心测试用例(core_tests)。数据集特别适用于评估模型在代码优化、性能改进等软件工程任务上的能力。
SWE-Pro is a benchmark dataset for evaluating the performance of language models and LLM agents on real-world software optimization tasks. The dataset collects optimization scenarios from popular Python codebases and uses expert-submitted pull requests as the gold standard for performance goals. The dataset contains 102 test samples, each with complete optimization scenario information. The data structure includes: unique identifiers (id, scenario_id), source code repository information (repo, pr_number), version control information (baseline_sha, reference_sha), task description (task, entry_point, whats_new), execution environment metadata (docker), structured code context (oracle_context), performance scenario parameters (params), and core test cases (core_tests). The dataset is particularly suitable for evaluating the capabilities of models in software engineering tasks such as code optimization and performance improvement.
数据集概述:SWE-Pro
基本信息
- 数据集名称: SWE-Pro
- 许可证: MPL-2.0
- 数据集大小: 约 19.13 MB(下载大小约 6.83 MB)
- 样本数量: 102 个实例(测试集)
- 类别规模: n<1K(小于1000个实例)
数据集目标
SWE-Pro 是一个基准数据集,用于评估语言模型和基于 LLM 的智能体在真实世界软件优化任务上的表现。该数据集从流行的 Python 代码仓库中收集优化场景,以专家人工提交的 Pull Request 作为性能优化的黄金参考标准。
数据字段说明
| 字段 | 类型 | 描述 |
|---|---|---|
id |
整数 | 实例的唯一数字标识符 |
scenario_id |
字符串 | 唯一场景标识符(例如 pandas-50778) |
repo |
字符串 | 优化任务的源代码仓库 |
pr_number |
整数 | 对应优化的 Pull Request 编号 |
baseline_sha |
字符串 | 优化前(基线版本)的提交 SHA |
reference_sha |
字符串 | 优化后(金标准解决方案)的提交 SHA |
task |
字符串 | 优化任务的自然语言描述 |
entry_point |
字符串 | 待评估的目标 API、函数或方法 |
whats_new |
字符串 | 描述优化的变更日志摘要 |
docker |
对象 | 基线和参考版本的执行环境元数据 |
oracle_context |
对象 | 从基线仓库提取的结构化代码上下文 |
params |
列表[对象] | 用于构建性能场景的参数定义 |
core_tests |
列表[字符串] | 从仓库测试套件中选出的正确性测试 |
嵌套字段详解
| 嵌套字段 | 类型 | 描述 |
|---|---|---|
docker.baseline.tag |
字符串 | 基线版本的 Docker 镜像标签 |
docker.baseline.digest |
字符串 | 基线版本的 Docker 镜像摘要 |
docker.reference.tag |
字符串 | 参考版本的 Docker 镜像标签 |
docker.reference.digest |
字符串 | 参考版本的 Docker 镜像摘要 |
oracle_context.file_context |
列表[对象] | 相关源文件的文件级上下文 |
file_context.file_path |
字符串 | 源文件的路径 |
file_context.raw_code |
字符串 | 源文件的原始内容 |
params.name |
字符串 | 参数名称 |
params.short_indicator |
字符串 | 场景定义中使用的简短标识符 |
params.values |
列表[字符串] | 参数的允许取值 |
params.explanation |
字符串 | 参数在场景中作用的描述 |
数据拆分
- 测试集 (test): 包含 102 个实例,总大小为 19,133,916 字节。
配置信息
- 配置名称: default
- 数据文件: 测试集数据位于
data/test-*路径下。




