遇见数据集

RSIBench-Data

收藏
arXiv2026-07-28 更新2026-07-30 收录
官方服务:

资源简介:

RSIBench-Data是由Evolvent AI与新加坡国立大学联合创建的基准数据集,旨在评估大型语言模型作为数据驱动研究者的能力,聚焦于递归自我改进中的后训练数据合成研究。该数据集包含软件工程、终端使用、科学问答和数学等六个基准任务,通过固定训练接口和共享服务实现可控实验环境,确保研究过程的可审计性。数据集构建过程采用封闭循环研究范式,研究者智能体需基于反馈迭代优化训练数据策略,并利用沙盒化评估机制生成监督信号。其核心应用在于系统评估智能体能否将模型失败证据转化为有效的训练数据,从而推动自动化后训练研究的发展,为递归自我改进提供可衡量的测试平台。

RSIBench-Data is a benchmark dataset jointly created by Evolvent AI and the National University of Singapore. It is designed to evaluate the capabilities of large language models as data-driven researchers, with a focus on post-training data synthesis research in the context of recursive self-improvement. This dataset includes six benchmark tasks, such as software engineering, terminal usage, scientific question answering, mathematics and other related domains, and builds a controllable experimental environment through fixed training interfaces and shared services, ensuring the auditability of the research workflow. The dataset construction follows a closed-loop research paradigm, where researcher AI agents need to iteratively optimize training data strategies based on feedback, and generate supervision signals via sandboxed evaluation mechanisms. Its core application is to systematically assess whether AI agents can convert model failure evidence into effective training data, thereby promoting the advancement of automated post-training research and providing a measurable test platform for recursive self-improvement.

创建时间:
2026-07-28
原始信息汇总

RSIBench-Data 数据集概述

核心目标

RSIBench-Data 用于评估数据生成代理在固定预算(时间与成本)下,能否通过合成目标基准测试专属的后训练数据来改进目标模型。代理根据实际时钟时间和 Tinker 成本预算,迭代创建训练数据、启动 LoRA SFT、评估生成的检查点,并选择最终提交结果。

系统特性

  • 闭环数据优化:在明确的时间和成本预算内,循环执行数据生成、训练、评估、检查与迭代。
  • 真实后训练:每次尝试均使用 Tinker LoRA SFT,并生成用于评估代理的采样器检查点。
  • 隔离云评估:Harbor 代理与任务环境在每次尝试的独立 E2B 沙箱中运行。
  • 多编排器支持:同一工作区契约支持 Claude Code 和 Codex 两种编排器。
  • 基准测试专属配置:每个配置固定了提示词、数据集、Harbor 代理、评估形态和允许的种子工厂。
  • 可审计工件:保留训练输入、估算数据、模型使用情况、Harbor 轨迹、验证器输出及最终选择记录。

基准测试配置

目标基准测试 官方数据集 Harbor 代理 任务数 尝试次数 种子工厂
swe-bench-verified 本地 seed-23 随机 SWE-bench Verified 子集 mini-swe-agent 100 1 SWE-smith, SWE-Gym, swe-factory
swe-bench-multilingual 本地 seed-23 随机 SWE-bench Multilingual 子集 mini-swe-agent 100 1 SWE-smith, SWE-Gym, swe-factory
swe-bench-pro 本地 seed-23 随机 SWE-bench Pro 子集 mini-swe-agent 100 1 SWE-smith, SWE-Gym, swe-factory
terminal-bench-2 terminal-bench/terminal-bench-2 terminus-2 89 1 endless-terminals, tmax
gpqa-diamond 本地 seed-23 随机 GPQA Diamond 子集 terminus-2 100 1 synthetic-data-kit
aime 完整 30 任务 MathArena AIME 2026 数据集 terminus-2 30 4 synthetic-data-kit

评估数据边界

基准测试中的评估数据(如 benchmarks/swe_bench_verified/runs/qwen35base_seed23_random100/)是只读的诊断上下文,仅供数据生成代理查看分析。代理不得从基准测试任务或工件中复制、转换、筛选、蒸馏或以其他方式衍生训练记录。训练数据必须从非基准测试的公开来源重新合成。

配置与运行要求

运行环境

  • Python 3.12
  • Tinker API 密钥(需能访问 Qwen/Qwen3.5-35B-A3B-Base
  • E2B API 密钥(推荐 Pro 计划)
  • Claude Code CLI(使用 Claude Code 编排器时)
  • Codex CLI(使用 Codex 编排器时)

种子工厂

种子工厂是只读引用,数据生成代理可通过 git 子模块初始化使用: bash git submodule update --init --recursive seed_factories

会话契约

代理会话通过 runner/run_session.sh 启动,工作区提供四个命令:

  • timer.sh:报告剩余时钟时间预算
  • budget_status.sh:报告已提交的尝试成本及当前活跃尝试的估算成本
  • run_attempt.sh <attempt_id>:验证、训练并评估一个候选数据集
  • final_submit.sh <attempt_id>:选择最终官方评估将重用的检查点

每次尝试必须包含:

  • attempts/<attempt_id>/train_messages.jsonl(JSONL 格式,每行包含 messages 列表)
  • attempts/<attempt_id>/run_config.json(可选,可设置训练超参数与评估参数)

评估方式

  • 每次尝试在 E2B 沙箱中创建和销毁自己的评估环境
  • 代理检查点可使用 Tinker 聊天补全端点或 Tinker SDK 的 SamplingClient
  • 支持直接评估检查点或基础模型,通过 backend.e2b_eval 模块执行
搜集汇总
数据集介绍
RSIBench-Data 数据集图片
构建方式
RSIBench-Data的构建围绕递归自我改进中数据中心的封闭循环展开,旨在评估大语言模型作为研究型智能体的能力。研究者固定了底层模型、有界训练接口与评估基础设施,通过共享的Tinker服务进行LoRA SFT训练,并由Harbor编排的E2B沙箱执行官方评估。智能体需在每个回合中自主诊断目标模型的性能缺口,设计并验证训练数据策略,提交符合数据契约的合成数据与白名单配置,随后接收来自固定评估服务的反馈信号,据此迭代修正下一轮的策略,直至预算耗尽。最终,智能体从自身产出的候选检查点中选取一个提交官方评估,整个过程强调训练、服务与评估的隔离,确保绩效差异归因于智能体的研究决策而非基础设施变动。
特点
该数据集的核心特点在于其精细可控的实验设计与过程可审计性。它通过固定除数据策略外的所有训练与评估组件,将智能体的研究能力从优化、服务与系统实现的混杂变量中剥离出来,实现了对数据中心研究行为的纯净测量。每个回合都会留下结构化的记录,将训练数据策略、检查点表现与评估行为关联起来,支持归因分析与诊断。评估跨软件工程、终端使用、科学问答和数学推理六个基准,覆盖多种训练经验模态。实验揭示了一个显著的发现在场与可靠性鸿沟:智能体在58.33%的设置中能通过迭代改进首轮结果,但78.26%的后峰值搜索以更低分收尾,反馈驱动的修正常无法持续提升前沿。
使用方法
使用RSIBench-Data时,研究者需部署一个前端大语言模型作为研究型智能体,该智能体通过固定的API接口与数据集交互。智能体接收目标基准描述、成功标准、公共种子任务与环境模式,以及资源预算作为输入,随后自主执行数据合成、过滤、课程设计等研究活动,提交训练工件至共享的Tinker SFT后端。每次训练后,智能体通过固定的Harbor-E2B评估服务获取包括分数、轨迹与验证器结果的反馈,并据此决定是否继续搜索或修订策略。数据集还提供了跨智能体与基准的标准化评估协议,以及用于分析搜索轨迹与成本效率的指标,便于研究者对比不同智能体的研究策略与迭代模式,进而开发更可靠的数据中心研究能力。
背景与挑战
背景概述
RSIBench-Data 数据集由 Evolvent AI 与新加坡国立大学的研究团队于 2026 年创建,旨在评估大语言模型代理作为数据驱动研究者的能力,以推动递归自我改进的研究范式。该数据集的核心研究问题聚焦于:LLM 代理能否通过假设形成、训练数据策略设计与验证、以及检查点反馈学习,自主完成数据驱动的后训练研究。在固定基础模型与训练接口的条件下,RSIBench-Data 将数据合成、训练、服务与评估环节解耦,为代理提供了受控的实验环境。该数据集涵盖软件工程、终端使用、科学问答与数学推理六大基准任务,揭示了当前前沿代理在数据驱动研究中的发现能力与可靠性鸿沟,为递归自我改进领域提供了可测量、可审计的评估平台。
当前挑战
RSIBench-Data 面临的核心挑战在于解决 LLM 代理在数据驱动后训练研究中的发现-可靠性鸿沟。在领域问题层面,代理需要从模型失败证据中准确诊断能力缺口,并设计可执行的训练数据策略,然而实验表明它们无法一致地将反馈转化为持续改进——78.26% 的搜索在达到最佳观测分数后继续探索,却以更低分数收场。在构建过程中,研究人员需解决基础设施隔离问题,将数据研究决策与优化、服务、评估和系统实现解耦,同时确保训练与服务路径、评估沙盒及资源预算对所有代理保持固定。此外,如何设计可复用的数据合成策略、实现能力缺口诊断与反馈驱动的修订闭环,以及建立强检查点保存机制,均为构建过程中需要攻克的技术难点。
常用场景
经典使用场景
RSIBench-Data最经典的使用场景是作为评估大语言模型智能体在递归自改进过程中数据中心研究能力的标准化基准。研究者利用该数据集在固定后训练堆栈的约束下,考察智能体是否能够自主完成从能力差距诊断、训练数据策略设计与验证、到基于检查点反馈进行迭代优化的闭环流程。通过在六个覆盖软件工程、终端操作、科学问答与数学推理等领域的基准上运行实验,用户可系统地衡量不同前沿智能体作为数据中心研究者的表现,揭示其在假设形成、数据合成与策略修订等环节的效度与局限。
衍生相关工作
RSIBench-Data衍生了一系列围绕数据中心自治研究的经典工作。在数据生成层面,SWE-Gym、R2E-Gym等工作提供了可执行环境与训练资源,聚焦于软件工程智能体的经验合成。在闭环进化层面,DataEnvGym与Curation-Bench引入学生模型反馈,使智能体能够跨轮次调整课程与策展策略。在自动化后训练层面,PostTrainBench与Agent2 RL-Bench评估了端到端系统的改进能力。RSIBench-Data则独辟蹊径,在其中间地带评估智能化体作为数据中心研究者的核心能力,其发现催生了对反馈驱动策略非单调性、搜索效率与检查点选择的后续研究,并启发了更高推理努力与深度数据构建等机制分析工作。
数据集最近研究
最新研究方向
当前大语言模型智能体在递归自改进领域的研究中,数据驱动的后训练研究能力成为前沿焦点。RSIBench-Data基准的提出,精准聚焦于评估大语言模型智能体作为数据研究者的核心能力,即能否自主诊断模型能力缺陷、设计并迭代数据策略、从反馈中持续优化。实验揭示了一个关键发现:尽管智能体在58.33%的实验设定中能通过迭代改进首个有效尝试,但在达到最佳性能后,78.26%的搜索最终以更低分数收尾,暴露了其在反馈驱动下的非单调改进困境。这一发现催生了新的研究热点——构建更可靠的闭环数据研究框架,使智能体能够真正理解验证信号、对齐监督行为与目标能力,并有效保存强检查点。该数据集为此类研究提供了可控、可审计的测试平台,对推动自动后训练技术的发展具有深远意义。
相关研究论文
  • 1
    RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-ImprovementEvolvent AI; 新加坡国立大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务