遇见数据集

patchrecoverygym-laguna

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

PatchRecoveryGym for Laguna 是一个可复现的评估和强化学习环境数据集,旨在测试编码代理在依赖迁移修复任务中从错误首次尝试恢复的能力。该数据集基于真实的依赖迁移修复场景(例如Pydantic v1→v2、Ruff严格性),每个任务包含任务描述、错误的首次尝试及其失败测试输出,要求生成修正后的最小补丁。奖励机制基于隐藏测试是否通过(二进制,不可操纵)。数据集包含一个6任务的分割(recoverybench-upgradegym-6.jsonl)和一个保留的3任务分割用于验证选择器。数据规模为小于1K样本,适用于文本生成(代码)任务,特别关注代理编码中的恢复弱点评估。使用场景包括编码代理性能测试、验证器/选择器研究(通过144个候选重新排序表)以及强化学习环境。数据集由Poolside Research Hackathon提交,作为Laguna XS.2的基准测试。

PatchRecoveryGym for Laguna is a reproducible evaluation and reinforcement learning environment dataset designed to test the ability of coding agents to recover from erroneous first attempts in dependency migration repair tasks. The dataset is based on real-world dependency migration scenarios (e.g., Pydantic v1→v2, Ruff strictness), with each task containing a task description, an erroneous first attempt and its failed test output, requiring the generation of a minimal corrected patch. The reward mechanism is based on whether hidden tests pass (binary, non-manipulable). The dataset includes a split of 6 tasks (recoverybench-upgradegym-6.jsonl) and a held-out split of 3 tasks for validator selection. The data scale is less than 1K samples, suitable for text generation (code) tasks, with a focus on evaluating recovery weaknesses in agent coding. Use cases include coding agent performance testing, validator/selector research (via a 144-candidate reranking table), and reinforcement learning environments. The dataset was submitted by the Poolside Research Hackathon as a benchmark for Laguna XS.2.

创建时间:
2026-05-30
原始信息汇总

数据集概述:PatchRecoveryGym for Laguna

数据集名称: PatchRecoveryGym for Laguna
提交者: Kannappan Sirchabesan (@kannappans)
许可证: other
任务类别: 文本生成
语言: 代码
标签: poolside-hackathon, laguna, verifiers, software-engineering, eval, reinforcement-learning
大小: n<1K(少于1000个样本)


核心目标与测试内容

  • 目的: 测试编码智能体在第一次尝试错误后能否恢复并修正正确,聚焦于真实但常被低估的“恢复”能力短板。
  • 测试方式: 每个任务包含一个真实的依赖迁移修复问题(例如 Pydantic v1→v2、Ruff 严格性调整),模型接收三项输入:
    1. 任务描述
    2. 错误的第一次尝试
    3. 该尝试失败时的测试输出 模型需生成一个正确的、最小化的补丁。奖励机制为:隐藏测试是否全部通过?(二值判断,不可欺骗)。
  • 关键区别: 大多数基准测试评估“从零开始解决”,而该数据集专门孤立评估从错误中恢复的能力。

主要结果(基于 6 任务 v0 子集,使用 Poolside Laguna XS.2 模型)

实验设置 pass@1 pass@8 说明
基础模型(原始补丁) 0.250 0.833 具备恢复能力,但首次尝试成功率低
+ 确定性应用感知修复 0.500 1.000 补丁规范化缩小了差距
无隐藏测试的选择器(不窥探测试) 5/6 任务 无需隐藏测试即可正确选择候选
  • 核心发现: Laguna 模型本身拥有恢复能力(pass@8 为 0.833),但生成结果不稳定;通过确定性应用感知修复和无隐藏测试的选择器,可以将大部分能力转化为可用的单次答案。
  • 参考解决方案得分为 6/6,验证了测试框架的有效性(错误尝试失败,正确补丁通过)。

使用方式

bash prime env install kannappan/patchrecoverygym-laguna prime eval run kannappan/patchrecoverygym-laguna -m poolside/laguna-xs.2 -n 6

  • Prime Hub 环境: https://app.primeintellect.ai/dashboard/environments/kannappan/patchrecoverygym-laguna

数据与附加资源

  • 重新排序挑战: 包含 144 个候选生成结果,附有补丁文本、隐藏标签和跟踪特征,适用于验证器/重排序器/重试策略研究 → 文件位置:outputs/reranking_challenge/
  • 主要数据文件: data/recoverybench-upgradegym-6.jsonl(6 任务子集),另有一个保留的 3 任务子集用于新鲜的选择器验证。
  • 完整证据包: JUDGE_PACKET.md 包含所有评估结果、复现命令、审计记录及保留验证集详情。

诚实声明

  • 未声称官方微调后的 pass@1 改进:虽然完成了托管强化学习,但最终的隐藏评估结果为 0/6(记录了日志与回放之间的差距,建议作为下一步)。
  • 严格选择器的 6/6 结果是事后压力测试,而非经过新鲜子集验证的。
  • 不涉及 FP4、推测解码或路由专业化等声明,详见配套量化提交。

深入阅读

  • 📄 完整裁判包(内嵌所有内容): JUDGE_PACKET.md
  • ⚡ 概述性记分卡: submission/final_scorecard.md
  • 🧩 配套提交(量化): https://huggingface.co/poolside-laguna-hackathon/laguna-xs2-nvfp4-attention
搜集汇总
数据集介绍
patchrecoverygym-laguna 数据集图片
构建方式
PatchRecoveryGym for Laguna 数据集专为评估和强化编码代理的纠错恢复能力而设计,其构建聚焦于真实的依赖迁移修复任务,例如 Pydantic v1 到 v2 的迁移或 Ruff 严格性调整。每个任务实例包含三项核心输入:目标任务描述、一个错误的初次尝试代码以及该尝试的失败测试输出。模型需基于这些信息生成一个最小的正确补丁。奖励机制采用二值化的隐藏测试结果,确保模型必须真正通过所有隐藏测试,无法通过取巧方式获得高分,从而精准衡量代理从自身错误中恢复的能力。数据集规模较小(少于1千个样本),包含一个6任务的公开拆分和一个3任务的保留拆分,用于验证选择器的泛化性能。
使用方法
数据集使用极为便捷,可通过 Prime Hub 命令 `prime env install kannappan/patchrecoverygym-laguna` 安装环境,并通过 `prime eval run kannappan/patchrecoverygym-laguna -m poolside/laguna-xs.2 -n 6` 启动评估,其中 `-n` 参数指定采样次数。用户可参考完整的法官数据包(JUDGE_PACKET.md)获取所有评估结果、复现命令及审计信息。对于进阶研究,`outputs/reranking_challenge/` 目录下的144个候选补丁提供了丰富的特征数据,可用于训练验证器或优化重试策略。注意,官方未宣称微调后首次通过率提升,且严格选择器的6/6成绩为事后压力测试,需谨慎解读。
背景与挑战
背景概述
在人工智能与软件工程的交叉领域,代码智能体(coding agent)的能力评估日益成为研究焦点。由Poolside Research Hackathon基础赛道贡献者Kannappan Sirchabesan于近期推出的PatchRecoveryGym for Laguna数据集,聚焦于代码智能体在错误首次尝试后的恢复能力——这一长期被忽视但至关重要的代理编程弱点。该数据集围绕真实依赖迁移修复任务(如Pydantic v1至v2的迁移、Ruff严格性提升等)构建,旨在系统评估模型是否能够基于错误输出和测试失败反馈实现自我修正。其核心研究问题在于:现有基准多测试从零开始编写代码的能力,而鲜有衡量智能体从自身错误中调整与重建的能力。该数据集通过提供确定的隐藏测试奖励机制和144个候选方案的重新排序表,为验证器与选择器研究提供了标准化测试平台,对提升代码智能体的稳健性与可靠性具有重要推动作用。
当前挑战
本数据集所应对的领域问题挑战在于:当前主流代码生成基准(如HumanEval、MBPP)主要评估从零到一的编程能力,而忽略了智能体在现实场景中频繁遭遇的“首次错误后恢复”需求,导致模型对错误反馈的适应性严重不足。在数据集构建过程中,亦面临多重技术挑战:首先,如何构建具有真实依赖迁移背景的修复任务,并确保错误首次尝试具有合理的“看似合理但实际失败”的特性,以准确模拟实际开发环境中的错误模式;其次,设计不可作弊的二元隐藏测试奖励机制,避免模型依赖简单模式匹配或测试窥探;最后,验证基准有效性的过程中,需确保参考解决方案全数通过(6/6),而错误首次尝试全部失败,以维护评估的真实性。数据集的6任务子集虽揭示了Laguna模型在pass@8时将恢复能力提升至0.833,但pass@1仅0.250,即模型具备能力却无法稳定输出,这进一步突出了在单次执行中实现可靠恢复的挑战。
常用场景
经典使用场景
PatchRecoveryGym for Laguna 是一个专为评估和强化学习设计的可复现环境,其核心使用场景在于测试代码智能体从错误首次尝试中恢复的能力。该数据集聚焦于依赖迁移修复任务,例如 Pydantic v1 到 v2 的升级或 Ruff 严格性调整,为研究者提供了一个隔离“纠错能力”而非从头解决问题的标准化评估平台。通过提供任务描述、错误首次尝试及其失败的测试输出,模型需生成正确的最小补丁,并以隐藏测试是否通过作为唯一奖励信号,从而精准衡量代码智能体的鲁棒性与适应性。
解决学术问题
该数据集解决了现有代码生成基准测试中一个被忽视的关键问题:多数评测聚焦于从零开始编写正确代码,而忽视了模型在实际应用中从自身错误中恢复的能力。PatchRecoveryGym 通过引入“错误恢复”这一独立维度,揭示了当前最先进模型(如 Laguna XS.2)虽具备恢复潜力(pass@8 达 0.833),但在首次尝试时可靠性不足的现状。其意义在于推动学术界重新定义代码智能体的评估标准,强调“纠错”与“不确定性管理”作为核心能力的重要性,并为人机协作编程场景中的安全性与可信度研究奠定基础。
实际应用
在实际应用中,PatchRecoveryGym 可深度融入以下场景:一是作为持续集成/持续部署(CI/CD)流水线中的自动修复模块,帮助开发团队快速从代码迁移错误中恢复;二是作为编程辅助工具的强化学习训练环境,提升 Copilot 类模型在用户错误输入后的纠正建议质量;三是用于研发“确定性应用感知修复”策略(如研究结果中 pass@1 从 0.250 提升至 0.500 的方法),进而部署于生产级代码审查系统,降低人工排查成本。此外,其隐藏测试奖励机制可直接嵌入 Agentic Coding 平台,增强自主编程代理的迭代优化能力。
数据集最近研究
最新研究方向
该数据集聚焦于代码生成模型在编程任务中的错误恢复能力,这是当前大模型在软件工程应用中常被忽视却至关重要的薄弱环节。传统基准测试多侧重于从零开始解决问题的能力,而PatchRecoveryGym-Laguna通过模拟真实开发场景中模型初次尝试失败后、依据错误信息进行最小化补丁修正的修复路径,系统性地评估并提升模型的自纠错能力。研究揭示了Laguna XS.2模型虽具备潜在的恢复能力(pass@8达0.833),但在首次尝试中表现不稳定(pass@1仅0.250),而结合确定性应用感知修复与无隐式测试的选择器,可将恢复成功率提升至接近完美的水平。这一方向不仅为强化学习环境中的代码智能体训练提供了精细化评测手段,更推动了从单纯生成正确代码向具备鲁棒错误纠正能力的实用编程助手演进,对提升AI辅助开发工具的可靠性与实用性具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务