遇见数据集

RuBench

收藏
github2026-07-08 更新2026-07-13 收录
官方服务:

资源简介:

RuBench是一个仓库级代理编码基准,其任务规范以俄语原生编写(从真实客户请求的风格从头撰写,而非从英语问题翻译而来),并通过上游维护者的回归测试进行评分,这些测试在发布时被保留。该基准包含25个从五个活跃开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify;使用Python、PHP、TypeScript、JavaScript)的最近修复提交中挖掘的任务,所有修复提交日期均晚于每个评估模型的训练数据截止日期。评估以部署的产品配置(CLI代理+模型+推理努力)进行,每个配置独立运行三次。

RuBench is a repository-grade agent coding benchmark. Its task specifications are natively written in Russian, crafted from scratch in the style of real customer requests rather than translated from English-language queries. It is scored via regression tests developed by upstream maintainers, which are preserved upon release. This benchmark contains 25 tasks mined from recent fix commits across five active open-source repositories: aiohttp, aiogram, Laravel, NestJS, and Fastify, which utilize Python, PHP, TypeScript, and JavaScript respectively. All fix commit dates postdate the training data cutoff of each evaluated model. Evaluation is conducted using deployed production configurations (CLI agent + model + inference workload), with each configuration executed independently three times.

创建时间:
2026-07-07
原始信息汇总

RuBench 数据集概述

RuBench 是一个仓库级别的智能体编程基准测试,其任务规范原生使用俄语编写(非从英文翻译,而是以真实客户请求的风格从零撰写),并由上游维护者的回归测试(未公开发布)进行评分。

版本信息

版本 状态 范围
1.0 已发布 25个任务;arXiv 2607.06411;round-01为论文评估,round-02正在使用相同任务集和新智能体+模型对进行中。
1.1 生产中 新挖掘的任务,包括Telegram生态系统。
2.0 计划中 生成方法论和俄罗斯特定池。

术语说明

  • methodology(方法论) = 任务构建和评分的规则。
  • set(任务集) = 冻结的任务列表。
  • round(评估轮次) = 在特定任务集上的评估会话(全局编号,格式round-NN)。

Round 1 发布物

  • 1.0/tasks.json — 任务元数据,与arXiv提交附带的辅助文件字节一致。
  • 1.0/tasks/<ID>/task.md — 25个原生俄语任务陈述(智能体接收的精确文本)。
  • 1.0/rounds/round-01/ — 完整智能体轨迹、最终工作区差异、所有320个单元格(300个排名+ 20个Fable 5 hors concours)的每个单元元数据、每次重复的results.csv、流程运行日志,以及包含排行榜和标记单元格的RESULTS.md
  • 1.0/harness/ — 评估使用的单元格运行脚本(Claude Code和Codex CLI流程)。
  • 1.0/ORACLE_MANIFEST.sha256.txt — 保留评分神谕的SHA-256承诺,在论文提交前已提交。

有意保留未发布的内容:评分神谕(上述清单;当任务轮出活跃集时,已退休任务的神谕会发布)、上游黄金修复补丁、任务工作区(可从1.0/tasks.json中的base_commit_hash重建,移除git历史),以及轮次生产工具(任务挖掘过滤器和规范编写工具包)。

路径迁移

旧路径 当前路径
tasks/ 1.0/tasks/
tasks.json 1.0/tasks.json
harness/ 1.0/harness/
runs/round-01/ 1.0/rounds/round-01/
ORACLE_MANIFEST.sha256.txt 1.0/ORACLE_MANIFEST.sha256.txt

此迁移在论文首次引用之前完成。此后,新路径不可变且仅可追加:round-02和版本1.1/2.0将作为已有发布物的补充添加,1.0/下的路径不会再次移动。

相关论文

许可协议

由RuBench项目创作的发布物(任务陈述、元数据、轨迹、差异)采用CC BY 4.0许可。代码快照衍生自列出的开源项目,并保留其各自上游许可。

网络中心

  • 俄语网页:https://vibecoding.ru/rubench

评估说明

RuBench 1.0中的25个任务均来自五个活跃开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify;涉及Python、PHP、TypeScript、JavaScript)最近的修复提交。所有修复提交的时间均晚于每个被评估模型的训练数据截止日期。评估采用部署的产品配置(CLI智能体+模型+推理努力),每个配置进行3次独立运行,涉及Claude Code(Opus 4.8 / Sonnet 5 / Haiku 4.5)、Codex CLI(GPT-5.5)及Claude Code(Fable 5,不参与排名)。

搜集汇总
数据集介绍
RuBench 数据集图片
构建方式
RuBench是一个面向仓库级别的智能体编程基准测试,其任务规范以俄语原创撰写,风格贴近真实客户需求,而非从英文问题翻译而来。该基准测试基于五个活跃开源项目(aiohttp、aiogram、Laravel、NestJS、Fastify)中近期修复提交挖掘出25个任务,所有修复提交均晚于各评估模型的训练数据截止时间。任务通过CLI代理与模型组合(如Claude Code搭配Opus 4.8等)在独立配置下运行三次,并由上游维护者的回归测试进行评分,这些回归测试保留在发布版本之外。
特点
RuBench的核心特点在于其任务规范以俄语原生创作,真实模拟客户请求风格,避免了翻译带来的语义偏差。基准测试设计注重客观性,评分依赖上游维护者的回归测试,这些测试在发布时被隐藏,防止数据泄露。此外,数据集包含完整的代理轨迹、工作区差异及元数据,支持细粒度分析;同时采用SHA-256承诺确保评分验证的透明性,并通过版本管理(如1.0、1.1、2.0)支持任务集更新与迭代评估。
使用方法
研究者可通过GitHub仓库获取RuBench 1.0版本,其中包括任务元数据(tasks.json)、以俄语编写的任务说明(task.md)以及评估运行产生的完整轨迹和结果文件(位于rounds/round-01目录)。评估需使用提供的harness脚本启动CLI代理与模型组合,并参考RESULTS.md中的排行榜对比表现。值得注意的是,评分用的回归测试及上游修复补丁被有意保留,以维护基准测试的公正性;用户可通过SHA-256清单验证数据完整性。
背景与挑战
背景概述
RuBench是由Evgeny Shilov于2026年7月创建的一个仓库级智能体编程基准测试,旨在评估AI智能体在复杂软件工程任务中的能力。该数据集的核心研究问题在于,传统的编程基准多基于翻译或人工构造的英文问题描述,难以反映真实用户需求的自然性与多样性,而RuBench独辟蹊径,采用原生俄语书写的任务规范,源自真实开源仓库(如aiohttp、Laravel、NestJS等)的修复提交,确保任务语境的生态真实性。其影响力体现在对多语言、多模态智能体评估范式的拓展,为俄语自然语言驱动的代码生成研究提供了可靠评估平台,已在arXiv发表并引发领域关注。
当前挑战
RuBench所解决的领域挑战在于,现有基准测试大多依赖英文问题描述,忽视了非英语用户需求的真实表达方式,导致智能体在多语言场景下的泛化能力评估失真,而RuBench通过原生俄语任务规范填补了这一空白。构建过程中面临的挑战包括:任务筛选需从近期修复提交中精确挖掘,确保基准数据不被任何已评估模型的训练数据污染;同时,裁判测试需依赖上游维护者的回归测试集,但因版权和保密性原因,这些测试集在发布时被刻意隐藏,仅通过SHA-256承诺清单验证任务质量,增加了数据集的构建复杂度与可信度保障难度。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,RuBench作为首个以俄语原生撰写的仓库级智能体编程基准,其经典使用场景在于评估大型语言模型驱动的代码智能体在真实开源仓库中执行复杂修复任务的能力。基准包含25个源自aiohttp、aiogram、Laravel、NestJS和Fastify等活跃项目近期修复提交的任务,所有修复提交均晚于被评估模型的训练数据截止日期,确保了评估的时效性与公正性。研究者可借助RuBench部署完整的CLI智能体配置(如Claude Code与Codex CLI),通过标准化的回归测试套件衡量模型在跨文件上下文理解、依赖分析和仓库级代码修改方面的表现,从而为代码智能体的鲁棒性与实用性提供量化依据。
解决学术问题
RuBench直面当前代码智能体评估中的两大核心困境:任务规范的真实性缺失与语言多样性的覆盖不足。传统基准多将英文问题描述翻译为其他语言,导致自然语言歧义和表达失真,难以反映非英语开发者与用户的实际需求。RuBench以俄语从零撰写任务规范,模仿真实客户请求的风格,首次在仓库级编码评估中引入原生非英语语境。该基准通过保留上游维护者的回归测试作为评判标准,并刻意隐藏评分或acles与黄金修复补丁,杜绝了数据泄露与过拟合风险。这一设计有效解决了基准污染问题,推动了评估方法论向更具生态效度和跨语言适用性的方向演进。
衍生相关工作
RuBench的发布催生了一系列延伸性研究工作。在基准本身的发展路径上,1.1版本计划挖掘包括Telegram生态系统在内的更多新鲜任务,而2.0版本则引入生成性方法论并构建俄罗斯特有任务池,扩展了基准的覆盖维度。学术层面,伴随RuBench发表于arXiv的论文为后续研究者提供了可复现的评估框架与详细轨迹数据,鼓励了针对非英语仓库级编程基准的设计模式探索。此外,Claude Code与Codex CLI不同的智能体架构在该基准上的表现对比,也激发了关于推理努力、模型规模与任务复杂度之间关系的深入分析,促进了多智能体协作、跨语言代码理解等前沿方向的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务