遇见数据集

live0

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

liaochu/live0数据集是一个与SWE-bench-Live兼容的任务数据集,专为软件工程基准测试设计。该数据集包含302个任务实例,仅提供测试分割。每个实例代表一个代码修复或改进任务,涉及从GitHub仓库提取的拉取请求相关信息。数据集中包含丰富的结构化字段,如仓库名称、拉取请求编号、问题编号列表、基础提交哈希、代码补丁、测试补丁、问题描述、提示文本、提交URL列表、创建时间戳、测试命令列表、日志解析器标识以及任务难度评估(包括涉及的文件数、代码块数和代码行数)。特别地,数据集提供了两类测试集合:FAIL_TO_PASS测试(共1691个),用于验证问题修复;PASS_TO_PASS测试(共72722个),用于确保现有功能不被破坏。数据集总大小约为16.9 MB,采用Apache-2.0许可证。该数据集适用于评估和开发自动化代码修复、程序合成、测试生成以及软件工程智能体等任务。

The liaochu/live0 dataset is a task dataset compatible with SWE-bench-Live, designed for software engineering benchmarking. It contains 302 task instances, provided only in a test split. Each instance represents a code repair or improvement task, involving information extracted from pull requests in GitHub repositories. The dataset includes rich structured fields, such as repository name, pull request number, issue number list, base commit hash, code patch, test patch, problem statement, hints text, commit URL list, creation timestamp, test command list, log parser identifier, and task difficulty assessment (including the number of files, code blocks, and lines of code involved). Specifically, the dataset provides two types of test sets: FAIL_TO_PASS tests (total 1691) for verifying issue fixes, and PASS_TO_PASS tests (total 72722) to ensure existing functionality is not broken. The total dataset size is approximately 16.9 MB, licensed under Apache-2.0. This dataset is suitable for evaluating and developing automated code repair, program synthesis, test generation, and software engineering agents.

创建时间:
2026-06-18
原始信息汇总

数据集名称

liaochu/live0

数据集描述

一个与 SWE-bench-Live 兼容的任务数据集。

数据集规模

  • 总数据量: 16,986,559 字节
  • 划分: 仅包含 test 划分
    • 样本数: 302
    • FAIL_TO_PASS 测试数: 1,691
    • PASS_TO_PASS 测试数: 72,722

数据特征

字段名 类型 描述
repo string 仓库名称
pull_number string 拉取请求编号
instance_id string 实例ID
issue_numbers sequence[string] 相关联的issue编号
base_commit string 基础提交哈希
patch string 代码补丁(patch)
test_patch string 测试补丁(test patch)
problem_statement string 问题陈述
hints_text string 单条提示文本
all_hints_text string 所有提示文本
commit_urls sequence[string] 提交URL列表
created_at timestamp[s] 创建时间
commit_url string 提交URL
test_cmds sequence[string] 测试命令列表
log_parser string 日志解析器
difficulty struct 包含 files(int64)、hunks(int64)、lines(int64) 难度度量(文件数、hunk数、行数)
FAIL_TO_PASS sequence[string] 从失败到通过的测试
PASS_TO_PASS sequence[string] 从通过到通过的测试

许可证

Apache-2.0

数据集配置

  • 配置名称: default
  • 数据文件: data/test-*(仅包含 test 划分)
搜集汇总
数据集介绍
live0 数据集图片
构建方式
该数据集名为live0,是基于SWE-bench-Live框架构建的兼容性任务数据集。其构建方式聚焦于真实世界的软件工程场景,从公开代码仓库中提取出302个独立的修复任务。每个任务以Pull Request为核心,记录了仓库名称、PR编号、实例ID、关联问题编号以及基准提交哈希等关键元数据。数据集还包含了完整的补丁(patch)和测试补丁(test_patch),并附带了问题陈述(problem_statement)与多种提示文本(hints_text),以确保任务背景的丰富性。此外,通过记录测试命令(test_cmds)、日志解析器(log_parser)以及一系列提交URL,构建了从问题到修复的完整溯源链路。难度指标通过文件数、块数和行数三个维度量化,使得每个任务的可解性评估更加精确。
特点
live0数据集的核心特点在于其高度结构化的字段体系与大规模测试用例的整合。其302个任务共携带1691个FAIL_TO_PASS测试和72722个PASS_TO_PASS测试,为模型评估提供了丰富的回归与验证场景。数据类型涵盖字符串、时间戳、序列和嵌套结构,尤其通过难度字段中的files、hunks和lines定量描述修复复杂度,使得任务难度分布一目了然。数据集采用Apache-2.0许可证,确保了广泛的商用与学术使用权限。整个数据集以单一test集形式发布,大小约为16.99MB,易于下载与处理。其与SWE-bench-Live的兼容性保证了评估结果的可比性,适合用于自动化代码修复、补丁生成和软件工程智能化等研究方向。
使用方法
使用live0数据集时,用户可通过HuggingFace的datasets库直接加载,指定配置名为'default'并访问test分片。加载后,每个样本包含repo、pull_number和instance_id等识别字段,可据此定位原始代码仓库与PR。基础使用流程包括:利用base_commit获取代码基线,结合patch或test_patch生成修复结果,并通过test_cmds执行测试以验证修复正确性。数据集提供FAIL_TO_PASS和PASS_TO_PASS测试列表,方便构建端到端的自动化评估流水线。提示文本all_hints_text可辅助大型语言模型理解问题上下文。对于需要难度筛选的研究,可解析difficulty字段中的整数指标进行任务分级。所有字段支持通过Python字典访问,便于灵活集成至各类机器学习或软件工程实验中。
背景与挑战
背景概述
开源软件生态的蓬勃发展催生了海量代码库,然而自动化软件维护与缺陷修复仍面临严峻挑战。在此背景下,live0数据集于近期由研究团队构建并发布,旨在为软件工程领域的自动化补丁生成与代码修复任务提供标准化评估基准。该数据集以SWE-bench-Live为兼容框架,汇聚了302个真实世界任务实例,涵盖来自多个主流开源仓库的缺陷修复场景。每个实例均包含问题描述、补丁文件、测试命令及难度指标等结构化信息,有效支撑了基于机器学习与程序分析方法的代码修复研究。凭借其高质量标注与开源许可,live0已成为评估代码大模型修复能力的重要测试平台,推动了软件自动化领域的学术进步。
当前挑战
live0数据集所解决的领域问题核心在于自动化代码缺陷修复,其挑战主要体现于两方面。其一,真实世界代码仓库中的缺陷类型多样且与上下文高度耦合,模型需理解复杂的依赖关系与业务逻辑方能生成精确补丁,传统规则方法与现有学习模型在此任务上表现仍不理想。其二,数据集构建过程中面临巨大技术困难:从海量提交历史中筛选有效缺陷实例需兼顾噪声控制与任务代表性,同时需设计可靠的自动化测试验证体系以确保补丁的正确性与有效性。此外,跨仓库、跨语言的泛化能力评估亦构成持续挑战,对数据集的时效性与规模提出了更高要求。
常用场景
经典使用场景
在软件工程与人工智能交叉研究的前沿领域,live0数据集作为SWE-bench-Live兼容的任务数据集,为评估大语言模型在真实世界软件维护场景中的代码修复能力提供了标准化的评测基准。该数据集收录了302个来自活跃开源仓库的测试任务,每个任务包含问题陈述、补丁文件、测试命令及丰富的上下文信息(如关联议题编号、基础提交哈希等),使其成为验证模型理解复杂代码库、定位缺陷并生成有效补丁能力的经典平台。研究者常利用该数据集开展零样本或少样本条件下的自动程序修复实验,系统衡量模型在真实PR场景下修复失败测试的泛化性能。
实际应用
在实际工程应用中,live0数据集可直接服务于持续集成/持续部署(CI/CD)流程中的智能代码审查辅助工具开发。例如,集成噪声标注和函数调用图分析的模型可基于该数据集训练,自动检测代码变更引入的新故障,并向开发者提供修复建议。该数据集还能支撑开源社区维护工具的迭代,通过分析历史补丁模式,生成与项目编码规范一致的热修复方案,显著减少人工排查时间。此外,基于其结构化特征(如diff元数据与多模态测试命令),企业可构建面向微服务架构的分支预测系统,在代码合并前预警潜在回归缺陷。
衍生相关工作
围绕live0数据集已涌现一系列重要衍生工作:SWE-agent框架将其作为核心支撑,验证了基于对话式交互的自动化修复工具在复杂仓库上的有效性;SWE-bench系列通过扩展该数据集的构建方法论,创建了覆盖数千个真实缺陷的更大规模评测集合,推动了大模型代码能力的纵向对比研究。此外,部分工作聚焦于数据增强策略,如通过合成变异测试和问题重述生成困难样本,或将静态分析工具的输出与补丁上下文对齐以优化模型推理。这些衍生研究共同深化了对模型在真实软件演化中应对非平稳缺陷分布能力的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务