patchrecoverygym-laguna
收藏资源简介:
PatchRecoveryGym for Laguna 是一个可复现的评估和强化学习环境数据集,旨在测试编码代理在依赖迁移修复任务中从错误首次尝试恢复的能力。该数据集基于真实的依赖迁移修复场景(例如Pydantic v1→v2、Ruff严格性),每个任务包含任务描述、错误的首次尝试及其失败测试输出,要求生成修正后的最小补丁。奖励机制基于隐藏测试是否通过(二进制,不可操纵)。数据集包含一个6任务的分割(recoverybench-upgradegym-6.jsonl)和一个保留的3任务分割用于验证选择器。数据规模为小于1K样本,适用于文本生成(代码)任务,特别关注代理编码中的恢复弱点评估。使用场景包括编码代理性能测试、验证器/选择器研究(通过144个候选重新排序表)以及强化学习环境。数据集由Poolside Research Hackathon提交,作为Laguna XS.2的基准测试。
PatchRecoveryGym for Laguna is a reproducible evaluation and reinforcement learning environment dataset designed to test the ability of coding agents to recover from erroneous first attempts in dependency migration repair tasks. The dataset is based on real-world dependency migration scenarios (e.g., Pydantic v1→v2, Ruff strictness), with each task containing a task description, an erroneous first attempt and its failed test output, requiring the generation of a minimal corrected patch. The reward mechanism is based on whether hidden tests pass (binary, non-manipulable). The dataset includes a split of 6 tasks (recoverybench-upgradegym-6.jsonl) and a held-out split of 3 tasks for validator selection. The data scale is less than 1K samples, suitable for text generation (code) tasks, with a focus on evaluating recovery weaknesses in agent coding. Use cases include coding agent performance testing, validator/selector research (via a 144-candidate reranking table), and reinforcement learning environments. The dataset was submitted by the Poolside Research Hackathon as a benchmark for Laguna XS.2.
数据集概述:PatchRecoveryGym for Laguna
数据集名称: PatchRecoveryGym for Laguna
提交者: Kannappan Sirchabesan (@kannappans)
许可证: other
任务类别: 文本生成
语言: 代码
标签: poolside-hackathon, laguna, verifiers, software-engineering, eval, reinforcement-learning
大小: n<1K(少于1000个样本)
核心目标与测试内容
- 目的: 测试编码智能体在第一次尝试错误后能否恢复并修正正确,聚焦于真实但常被低估的“恢复”能力短板。
- 测试方式: 每个任务包含一个真实的依赖迁移修复问题(例如 Pydantic v1→v2、Ruff 严格性调整),模型接收三项输入:
- 任务描述
- 错误的第一次尝试
- 该尝试失败时的测试输出 模型需生成一个正确的、最小化的补丁。奖励机制为:隐藏测试是否全部通过?(二值判断,不可欺骗)。
- 关键区别: 大多数基准测试评估“从零开始解决”,而该数据集专门孤立评估从错误中恢复的能力。
主要结果(基于 6 任务 v0 子集,使用 Poolside Laguna XS.2 模型)
| 实验设置 | pass@1 | pass@8 | 说明 |
|---|---|---|---|
| 基础模型(原始补丁) | 0.250 | 0.833 | 具备恢复能力,但首次尝试成功率低 |
| + 确定性应用感知修复 | 0.500 | 1.000 | 补丁规范化缩小了差距 |
| 无隐藏测试的选择器(不窥探测试) | — | 5/6 任务 | 无需隐藏测试即可正确选择候选 |
- 核心发现: Laguna 模型本身拥有恢复能力(pass@8 为 0.833),但生成结果不稳定;通过确定性应用感知修复和无隐藏测试的选择器,可以将大部分能力转化为可用的单次答案。
- 参考解决方案得分为 6/6,验证了测试框架的有效性(错误尝试失败,正确补丁通过)。
使用方式
bash prime env install kannappan/patchrecoverygym-laguna prime eval run kannappan/patchrecoverygym-laguna -m poolside/laguna-xs.2 -n 6
- Prime Hub 环境: https://app.primeintellect.ai/dashboard/environments/kannappan/patchrecoverygym-laguna
数据与附加资源
- 重新排序挑战: 包含 144 个候选生成结果,附有补丁文本、隐藏标签和跟踪特征,适用于验证器/重排序器/重试策略研究 → 文件位置:
outputs/reranking_challenge/ - 主要数据文件:
data/recoverybench-upgradegym-6.jsonl(6 任务子集),另有一个保留的 3 任务子集用于新鲜的选择器验证。 - 完整证据包:
JUDGE_PACKET.md包含所有评估结果、复现命令、审计记录及保留验证集详情。
诚实声明
- 未声称官方微调后的 pass@1 改进:虽然完成了托管强化学习,但最终的隐藏评估结果为
0/6(记录了日志与回放之间的差距,建议作为下一步)。 - 严格选择器的 6/6 结果是事后压力测试,而非经过新鲜子集验证的。
- 不涉及 FP4、推测解码或路由专业化等声明,详见配套量化提交。
深入阅读
- 📄 完整裁判包(内嵌所有内容):
JUDGE_PACKET.md - ⚡ 概述性记分卡:
submission/final_scorecard.md - 🧩 配套提交(量化): https://huggingface.co/poolside-laguna-hackathon/laguna-xs2-nvfp4-attention




