官方服务:
资源简介:
A sample UI log for Robidium tool
应用场景:
创建时间:
2020-06-20
相关数据集
princeton-nlp/SWE-bench
SWE-bench是一个用于测试系统自动解决GitHub问题能力的数据集。该数据集收集了来自12个流行Python项目的2,294个Issue-Pull Request对。评估通过单元测试验证进行,使用PR后的行为作为参考解决方案。数据集包含多个特征,如repo、instance_id、base_commit、patch等,每个特征都有详细的描述。数据集的结构包括dev、test和train三个分
Hugging Face2024-06-27 更新1160
SWE-bench_oracle_cl100k
### Dataset Summary SWE-bench is a dataset that tests systems’ ability to solve GitHub issues automatically. The dataset collects 2,294 Issue-Pull Request pairs from 12 popular Python. Evaluation is
魔搭社区2026-04-28 更新190
lrxl/AutoDetect-results
该数据集包含了AutoDetect在不同模型上的测试结果,涉及三个基本任务:指令跟随、数学和编码。每个模型在特定任务上的结果存储在相应的文件夹中,文件夹内包含不同子任务的结果,记录在名为`log.json`的文件中。`log.json`文件中的键包括`init_points`、`new_points`和不同的测试点。`init_points`指的是子任务中的测试点列表,`new_points`包含
Hugging Face2024-06-25 更新70
BugSwarm
BugSwarm是由加州大学戴维斯分校的研究团队开发的一个数据集,旨在为软件质量的实验评估提供大规模、多样化和真实的数据集。该数据集通过自动化工具从持续集成服务中挖掘出3091对失败和修复的版本,这些版本都封装在Docker容器中,确保了数据的可重现性。BugSwarm不仅支持对软件缺陷检测、定位和修复工具的评估,还通过持续更新保持数据集的时效性,反映了当前软件开发中的实际问题。该数据集的应用领域
arXiv2019-07-23 更新310
TESTEVO-BENCH
TESTEVO-BENCH是由滑铁卢大学与谷歌联合创建的一个可执行、动态更新的基准测试数据集,专注于测试与代码协同演化的研究。该数据集包含1,255个任务,涵盖测试生成与测试更新两个核心赛道,数据来源于152个开源Java项目的59,950条候选协同演化记录,并经过严格的构建、执行与语义验证流程筛选而成。其创建过程通过三阶段自动化流水线实现,包括从提交历史中挖掘候选对、基于执行的清洗以及任务构建,
arXiv2026-07-03 更新140



