遇见数据集

inclusionAI/SWE-CARE

收藏
Hugging Face2025-10-21 更新2025-10-25 收录
官方服务:

资源简介:

SWE-CARE(软件工程-全面分析和审查评估)是一个全面性感知基准,用于评估大型语言模型在仓库级别的代码审查任务。数据集包含来自流行的开源Python和Java仓库的实际代码审查场景,以及全面的元数据和参考审查评论。

SWE-CARE (Software Engineering - Comprehensive Analysis and Review Evaluation) is a comprehensiveness-aware benchmark for evaluating Large Language Models (LLMs) on repository-level code review tasks. The dataset features real-world code review scenarios from popular open-source Python and Java repositories, with comprehensive metadata and reference review comments.

提供机构:
inclusionAI
搜集汇总
数据集介绍
inclusionAI/SWE-CARE 数据集图片
构建方式
在软件工程领域,代码审查是保障代码质量的关键环节,而大规模语言模型的评估亟需贴近真实场景的基准数据集。SWE-CARE数据集基于GitHub上流行的开源Python仓库构建,通过系统收集真实的拉取请求(Pull Request)及其关联的代码评审记录,形成了包含上下文信息的代码审查任务。每个实例均整合了问题描述、待审查的代码变更(以Git diff格式呈现)、人工撰写的参考评审意见以及最终的合并补丁,确保了数据来源的可靠性与生态代表性。
特点
该数据集具备鲜明的全面性意识特性,不仅涵盖基础代码变更信息,还提供了丰富的元数据,如问题域分类(如Bug修复、功能新增)、难度等级(简单/中等/困难)以及预估审查工作量(1-5级)。其核心亮点在于包含了多行注释的精确行号定位与代码片段上下文,使得模型能够学习到细粒度的代码审查逻辑。此外,数据集划分了包含7086个实例的开发集与671个实例的测试集,为模型训练与标准化评估提供了清晰的分界。
使用方法
研究者可通过HuggingFace Datasets库便捷加载数据集,例如使用`load_dataset("inclusionAI/SWE-CARE", split="test")`直接获取测试集以进行基准测试。数据集与官方评估框架SWE-CARE深度集成,支持通过`load_code_review_dataset()`函数加载实例,并利用其丰富的字段(如`patch_to_review`与`reference_review_comments`)构建端到端的代码审查生成与评估流水线。详细的评估指标与基线结果可在配套论文中找到,便于复现与对比研究。
背景与挑战
背景概述
代码审查是软件工程中确保代码质量与团队协作效率的关键环节,然而传统的人工审查流程耗时费力,且易受个体经验差异影响。为应对这一挑战,SWE-CARE(Software Engineering - Comprehensive Analysis and Review Evaluation)数据集由InclusionAI团队于2025年创建,其核心研究问题聚焦于如何全面评估大语言模型在仓库级代码审查任务中的表现。该数据集精心收集了来自热门开源Python和Java仓库的真实代码审查场景,包含超过7000条开发实例和671条测试实例,并辅以丰富的元数据和人工审查注释。作为首个关注审查全面性的基准,SWE-CARE填补了现有评估体系在代码审查深度与粒度上的空白,为自动化代码审查研究提供了标准化评测平台,对推动软件工程智能化发展具有重要影响力。
当前挑战
SWE-CARE数据集所面临的挑战主要涵盖两个层面。在领域问题层面,现有代码审查评估往往局限于简单缺陷检测,难以衡量模型对逻辑完整性、代码风格一致性及潜在安全风险的全面理解能力,因此构建一个能够刻画审查深度与覆盖度的综合指标成为关键难题。在数据集构建层面,从海量开源仓库中筛选出具有高质量审查注释的实例极具挑战性,需精确匹配提交补丁与人工评论的对应关系,并处理跨文件、跨函数的复杂上下文。此外,确保不同难度等级和问题领域(如错误修复、功能添加、重构)的样本分布均衡,以避免评估偏差,亦是一项艰巨任务。
常用场景
经典使用场景
SWE-CARE数据集专为评估大语言模型在仓库级代码审查任务中的表现而设计,其经典使用场景聚焦于端到端的代码审查评价。研究者可将待审查的代码补丁(patch)与问题描述、上下文提示等信息输入模型,要求模型生成审查意见,再通过与数据集中人工撰写的参考审查评论进行比对,量化模型在审查全面性、准确性和细粒度上的能力。该过程覆盖了从缺陷修复到功能添加等多种问题域,为衡量模型对真实世界代码变更的理解与反馈提供了标准化测试平台。
衍生相关工作
SWE-CARE的发布催生了一系列围绕代码审查评估与模型优化的研究工作。其衍生工作包括基于该基准设计新的评价指标,如审查全面性得分和评论粒度匹配度,以及探索多轮对话式审查框架以提升交互质量。此外,研究者利用数据集中丰富的元数据训练专门针对代码审查的微调模型,或结合检索增强生成技术引入类似问题的历史审查案例,从而生成更具上下文感知性的评论。这些工作共同推动了从静态补丁分析向动态、协作式审查智能的演进。
数据集最近研究
最新研究方向
在软件工程领域,代码审查作为保障代码质量与团队协作效率的核心环节,正迎来大语言模型(LLM)驱动的自动化评估范式变革。SWE-CARE数据集应运而生,聚焦于仓库级别的代码审查任务,通过整合来自热门开源Python仓库的真实Pull Request数据、问题上下文、代码变更补丁及人工审查评论,构建了一个具备全面性感知的基准测试平台。当前前沿研究热点在于利用该数据集系统评估LLM在理解复杂代码库、生成精准审查意见及捕捉潜在缺陷方面的能力,尤其关注模型对审查全面性的衡量——即能否覆盖人工审查中涉及的语义、逻辑与风格等多维度要素。该数据集的发布不仅填补了端到端代码审查评估中高质量、细粒度基准的空白,还为自动化代码审查工具从学术实验走向工业落地提供了关键验证支撑,其影响力正随着软件工程智能化转型的加速而持续扩大。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务