RuBench
收藏资源简介:
RuBench是一个仓库级代理编码基准,其任务规范以俄语原生编写(从真实客户请求的风格从头撰写,而非从英语问题翻译而来),并通过上游维护者的回归测试进行评分,这些测试在发布时被保留。该基准包含25个从五个活跃开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify;使用Python、PHP、TypeScript、JavaScript)的最近修复提交中挖掘的任务,所有修复提交日期均晚于每个评估模型的训练数据截止日期。评估以部署的产品配置(CLI代理+模型+推理努力)进行,每个配置独立运行三次。
RuBench is a repository-grade agent coding benchmark. Its task specifications are natively written in Russian, crafted from scratch in the style of real customer requests rather than translated from English-language queries. It is scored via regression tests developed by upstream maintainers, which are preserved upon release. This benchmark contains 25 tasks mined from recent fix commits across five active open-source repositories: aiohttp, aiogram, Laravel, NestJS, and Fastify, which utilize Python, PHP, TypeScript, and JavaScript respectively. All fix commit dates postdate the training data cutoff of each evaluated model. Evaluation is conducted using deployed production configurations (CLI agent + model + inference workload), with each configuration executed independently three times.
RuBench 数据集概述
RuBench 是一个仓库级别的智能体编程基准测试,其任务规范原生使用俄语编写(非从英文翻译,而是以真实客户请求的风格从零撰写),并由上游维护者的回归测试(未公开发布)进行评分。
版本信息
| 版本 | 状态 | 范围 |
|---|---|---|
1.0 |
已发布 | 25个任务;arXiv 2607.06411;round-01为论文评估,round-02正在使用相同任务集和新智能体+模型对进行中。 |
1.1 |
生产中 | 新挖掘的任务,包括Telegram生态系统。 |
2.0 |
计划中 | 生成方法论和俄罗斯特定池。 |
术语说明
- methodology(方法论) = 任务构建和评分的规则。
- set(任务集) = 冻结的任务列表。
- round(评估轮次) = 在特定任务集上的评估会话(全局编号,格式
round-NN)。
Round 1 发布物
1.0/tasks.json— 任务元数据,与arXiv提交附带的辅助文件字节一致。1.0/tasks/<ID>/task.md— 25个原生俄语任务陈述(智能体接收的精确文本)。1.0/rounds/round-01/— 完整智能体轨迹、最终工作区差异、所有320个单元格(300个排名+ 20个Fable 5 hors concours)的每个单元元数据、每次重复的results.csv、流程运行日志,以及包含排行榜和标记单元格的RESULTS.md。1.0/harness/— 评估使用的单元格运行脚本(Claude Code和Codex CLI流程)。1.0/ORACLE_MANIFEST.sha256.txt— 保留评分神谕的SHA-256承诺,在论文提交前已提交。
有意保留未发布的内容:评分神谕(上述清单;当任务轮出活跃集时,已退休任务的神谕会发布)、上游黄金修复补丁、任务工作区(可从1.0/tasks.json中的base_commit_hash重建,移除git历史),以及轮次生产工具(任务挖掘过滤器和规范编写工具包)。
路径迁移
| 旧路径 | 当前路径 |
|---|---|
tasks/ |
1.0/tasks/ |
tasks.json |
1.0/tasks.json |
harness/ |
1.0/harness/ |
runs/round-01/ |
1.0/rounds/round-01/ |
ORACLE_MANIFEST.sha256.txt |
1.0/ORACLE_MANIFEST.sha256.txt |
此迁移在论文首次引用之前完成。此后,新路径不可变且仅可追加:round-02和版本1.1/2.0将作为已有发布物的补充添加,1.0/下的路径不会再次移动。
相关论文
- RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications — arXiv:2607.06411, July 2026.
许可协议
由RuBench项目创作的发布物(任务陈述、元数据、轨迹、差异)采用CC BY 4.0许可。代码快照衍生自列出的开源项目,并保留其各自上游许可。
网络中心
- 俄语网页:https://vibecoding.ru/rubench
评估说明
RuBench 1.0中的25个任务均来自五个活跃开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify;涉及Python、PHP、TypeScript、JavaScript)最近的修复提交。所有修复提交的时间均晚于每个被评估模型的训练数据截止日期。评估采用部署的产品配置(CLI智能体+模型+推理努力),每个配置进行3次独立运行,涉及Claude Code(Opus 4.8 / Sonnet 5 / Haiku 4.5)、Codex CLI(GPT-5.5)及Claude Code(Fable 5,不参与排名)。




