RSIBench-Data
收藏资源简介:
RSIBench-Data是由Evolvent AI与新加坡国立大学联合创建的基准数据集,旨在评估大型语言模型作为数据驱动研究者的能力,聚焦于递归自我改进中的后训练数据合成研究。该数据集包含软件工程、终端使用、科学问答和数学等六个基准任务,通过固定训练接口和共享服务实现可控实验环境,确保研究过程的可审计性。数据集构建过程采用封闭循环研究范式,研究者智能体需基于反馈迭代优化训练数据策略,并利用沙盒化评估机制生成监督信号。其核心应用在于系统评估智能体能否将模型失败证据转化为有效的训练数据,从而推动自动化后训练研究的发展,为递归自我改进提供可衡量的测试平台。
RSIBench-Data is a benchmark dataset jointly created by Evolvent AI and the National University of Singapore. It is designed to evaluate the capabilities of large language models as data-driven researchers, with a focus on post-training data synthesis research in the context of recursive self-improvement. This dataset includes six benchmark tasks, such as software engineering, terminal usage, scientific question answering, mathematics and other related domains, and builds a controllable experimental environment through fixed training interfaces and shared services, ensuring the auditability of the research workflow. The dataset construction follows a closed-loop research paradigm, where researcher AI agents need to iteratively optimize training data strategies based on feedback, and generate supervision signals via sandboxed evaluation mechanisms. Its core application is to systematically assess whether AI agents can convert model failure evidence into effective training data, thereby promoting the advancement of automated post-training research and providing a measurable test platform for recursive self-improvement.
RSIBench-Data 数据集概述
核心目标
RSIBench-Data 用于评估数据生成代理在固定预算(时间与成本)下,能否通过合成目标基准测试专属的后训练数据来改进目标模型。代理根据实际时钟时间和 Tinker 成本预算,迭代创建训练数据、启动 LoRA SFT、评估生成的检查点,并选择最终提交结果。
系统特性
- 闭环数据优化:在明确的时间和成本预算内,循环执行数据生成、训练、评估、检查与迭代。
- 真实后训练:每次尝试均使用 Tinker LoRA SFT,并生成用于评估代理的采样器检查点。
- 隔离云评估:Harbor 代理与任务环境在每次尝试的独立 E2B 沙箱中运行。
- 多编排器支持:同一工作区契约支持 Claude Code 和 Codex 两种编排器。
- 基准测试专属配置:每个配置固定了提示词、数据集、Harbor 代理、评估形态和允许的种子工厂。
- 可审计工件:保留训练输入、估算数据、模型使用情况、Harbor 轨迹、验证器输出及最终选择记录。
基准测试配置
| 目标基准测试 | 官方数据集 | Harbor 代理 | 任务数 | 尝试次数 | 种子工厂 |
|---|---|---|---|---|---|
swe-bench-verified |
本地 seed-23 随机 SWE-bench Verified 子集 | mini-swe-agent |
100 | 1 | SWE-smith, SWE-Gym, swe-factory |
swe-bench-multilingual |
本地 seed-23 随机 SWE-bench Multilingual 子集 | mini-swe-agent |
100 | 1 | SWE-smith, SWE-Gym, swe-factory |
swe-bench-pro |
本地 seed-23 随机 SWE-bench Pro 子集 | mini-swe-agent |
100 | 1 | SWE-smith, SWE-Gym, swe-factory |
terminal-bench-2 |
terminal-bench/terminal-bench-2 |
terminus-2 |
89 | 1 | endless-terminals, tmax |
gpqa-diamond |
本地 seed-23 随机 GPQA Diamond 子集 | terminus-2 |
100 | 1 | synthetic-data-kit |
aime |
完整 30 任务 MathArena AIME 2026 数据集 | terminus-2 |
30 | 4 | synthetic-data-kit |
评估数据边界
基准测试中的评估数据(如 benchmarks/swe_bench_verified/runs/qwen35base_seed23_random100/)是只读的诊断上下文,仅供数据生成代理查看分析。代理不得从基准测试任务或工件中复制、转换、筛选、蒸馏或以其他方式衍生训练记录。训练数据必须从非基准测试的公开来源重新合成。
配置与运行要求
运行环境
- Python 3.12
- Tinker API 密钥(需能访问
Qwen/Qwen3.5-35B-A3B-Base) - E2B API 密钥(推荐 Pro 计划)
- Claude Code CLI(使用 Claude Code 编排器时)
- Codex CLI(使用 Codex 编排器时)
种子工厂
种子工厂是只读引用,数据生成代理可通过 git 子模块初始化使用: bash git submodule update --init --recursive seed_factories
会话契约
代理会话通过 runner/run_session.sh 启动,工作区提供四个命令:
timer.sh:报告剩余时钟时间预算budget_status.sh:报告已提交的尝试成本及当前活跃尝试的估算成本run_attempt.sh <attempt_id>:验证、训练并评估一个候选数据集final_submit.sh <attempt_id>:选择最终官方评估将重用的检查点
每次尝试必须包含:
attempts/<attempt_id>/train_messages.jsonl(JSONL 格式,每行包含messages列表)attempts/<attempt_id>/run_config.json(可选,可设置训练超参数与评估参数)
评估方式
- 每次尝试在 E2B 沙箱中创建和销毁自己的评估环境
- 代理检查点可使用 Tinker 聊天补全端点或 Tinker SDK 的
SamplingClient - 支持直接评估检查点或基础模型,通过
backend.e2b_eval模块执行

- 1RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-ImprovementEvolvent AI; 新加坡国立大学 · 2026年




