遇见数据集

RuBench 1.0

收藏
arXiv2026-07-07 更新2026-07-09 收录
官方服务:

资源简介:

RuBench 1.0是一个专注于俄语原生任务规范的代码代理基准数据集,由研究者从五个活跃开源项目中挖掘构建。该数据集包含25个真实修复任务,覆盖Python、PHP、TypeScript和JavaScript四种编程语言,每个任务均包含704-1591字符的俄语行为描述,工作空间平均包含1824个文件,采用维护者回归测试作为私有评估机制。数据集通过严格的新鲜度筛选机制确保所有任务均晚于评估模型的训练数据截止时间,旨在精准评估代码代理在真实仓库环境下处理非英语原生需求的能力,为解决多语言软件开发场景中意图理解与技术实现脱节的问题提供标准化测试平台。

RuBench 1.0 is a code agent benchmark dataset dedicated to native Russian task specifications, constructed by researchers through mining from five active open-source projects. This dataset includes 25 real-world repair tasks spanning four programming languages: Python, PHP, TypeScript, and JavaScript. Each task features a Russian behavioral description ranging from 704 to 1591 characters. The average workspace consists of 1824 files, with maintainer regression tests employed as the private evaluation mechanism. The dataset applies a strict freshness screening mechanism to ensure that all tasks postdate the training data cutoff time of the evaluated models, with the goal of accurately assessing the capability of code agents to handle non-English native requirements in real-world repository environments, thereby providing a standardized test platform for addressing the disconnection between intent understanding and technical implementation in multilingual software development scenarios.

创建时间:
2026-07-07
原始信息汇总

RuBench 数据集概述

RuBench 是一个仓库级别的智能体编码基准测试,其任务规范以俄语原生编写——完全按照真实客户请求的风格从零撰写,而非从英文问题翻译而来——并由上游维护者的回归测试进行评分,这些回归测试未公开发布。

数据集版本与规模

RuBench 1.0(2026年7月): 包含 25 个任务,从五个活跃的开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify;使用 Python、PHP、TypeScript、JavaScript 编写)的最新修复提交中挖掘而来。所有修复提交均晚于每个被评估模型的训练数据截止日期。

评估方式

以部署的产品配置进行评估(CLI 代理 + 模型 + 推理努力),每个配置独立运行 3 次:

  • Claude Code 搭配 Opus 4.8 / Sonnet 5 / Haiku 4.5
  • Codex CLI 搭配 GPT-5.5
  • Claude Code 搭配 Fable 5(不参与排名)

相关论文

论文标题:RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

  • arXiv 地址:https://arxiv.org/abs/2607.06411
  • BibTeX 引用信息已提供

公开资源

  • 任务元数据:tasks.json
  • 任务描述:tasks/<ID>/task.md(25 个俄语编写的任务说明)
  • 完整运行记录:runs/round-01/ 包含所有 320 个细胞的完整代理轨迹、最终工作区差异和逐细胞元数据,以及排行榜和标记细胞信息
  • 评估脚本:harness/
  • 评审预言承诺文件:ORACLE_MANIFEST.sha256.txt

未公开内容

  • 评分预言(manifest 已提交,退役任务的任务预言会随任务轮换发布)
  • 上游黄金修复补丁
  • 任务工作区(可根据 tasks.json 中的 base_commit_hash 重建,且已剥离 git 历史)
  • 轮次生产工具

许可协议

RuBench 项目创作的工件(任务说明、元数据、轨迹、差异)采用 CC BY 4.0 许可。代码快照源自所列的开源项目,并保留其各自上游许可。

在线资源

  • 俄语网站:https://vibecoding.ru/rubench
搜集汇总
数据集介绍
构建方式
RuBench 1.0的构建过程遵循严谨的实证主义原则,旨在填补现有仓库级编程基准在非英语自然语言任务规格上的空白。数据集从五个广泛使用的开源仓库(aiohttp、aiogram、Laravel、NestJS、Fastify)中挖掘修复提交,这些仓库覆盖了Python、PHP、TypeScript和JavaScript四种编程语言。通过自动化筛选获取了120个候选PR,经人工剔除错别字、依赖更新、反向移植及重复变更后,仅保留那些在父提交上失败、在修复提交上通过维护者回归测试的25个任务。每个任务的工作区均为修复提交父版本的快照,剥离了git历史并移除了测试文件,确保智能体无法从日志中恢复修复方案。任务规格说明以俄语从头撰写,风格模拟真实客户请求,而非从英语翻译而来,字数范围为704至1591字符。所有修复提交的日期均晚于被评估模型的训练数据截止日期,从而在任务级别上建立了抗污染论证。
特点
RuBench 1.0的核心特点在于其独特的非英语原生任务规格和严谨的评估协议。与现有仓库级基准不同,该数据集首次实现了任务规格的俄语原生创作,而非翻译,从而模拟了非英语母语用户的真实表达习惯。每项任务均源自真实世界的修复提交,难度来源于现实维护工作的复杂性,而非人为构造。评估采用产品级配置(CLI代理+模型+推理努力),而非孤立的模型,并进行了三次独立运行以暴露方差。数据集提供了完整的代理轨迹和差异补丁,但评分依据的维护者回归测试被保密,仅公开SHA-256哈希清单以确保可验证性。此外,RuBench 1.0通过任务级95%置信区间、成对bootstrap比较和费用/令牌核算,实现了对不确定性透明而诚实的报告。
使用方法
RuBench 1.0的使用方法围绕其五大设计原则展开,适用于评估产品级编码智能体在非英语环境中的真实维护能力。研究人员需从公开仓库获取任务规格和仓库快照,并将其输入被评估的代理配置(CLI代理+模型+推理努力),代理需在完整仓库副本中操作并返回补丁。评分过程完全依赖上游维护者的私有回归测试套件,这些测试未公开,但可通过已发布的SHA-256清单进行验证。每次评估需进行多次独立运行以避免方差,并报告任务级得分、置信区间及费用。所有轨迹和差异补丁均需公开以支持独立审计,且需检查代理是否在运行时获取了上游修复代码或发生了模型替换。建议未来评估时限制网络访问仅限于包镜像,以进一步防止运行时泄漏。
背景与挑战
背景概述
随着软件工程领域编码智能体的迅猛发展,开发者日益将实际的代码维护任务委托给产品级的自动化编程工具,且大量非英语母语的使用者倾向于以自身语言、以客户式请求风格而非精心编排的英文议题来陈述需求。然而,现有的代码仓库级智能体评测基准如SWE-bench系列,其任务描述均以英文设计,无法覆盖这一日益关键的应用场景。为填补这一空白,独立研究者Evgeny Shilov于2026年发布RuBench 1.0基准。该基准从aiohttp、aiogram、Laravel、NestJS和Fastify五个活跃开源仓库中挖掘25项真实修复任务,每项任务均以俄语原生撰写——从零开始模拟真实客户请求风格而非翻译——并以上游维护者的回归测试作为评判依据,测试集不对外公开。RuBench 1.0首次在仓库级智能体评测中引入非英语原生任务规范,揭示了产品级智能体在实际多语言部署环境中的真实能力界面,对评测体系的生态格局产生了深远影响。
当前挑战
RuBench 1.0面临的核心领域挑战在于,现有评测基准长期固化于英文任务文本,忽略了智能体处理非英语、非结构化的客户式自然语言表述这一差异化能力——智能体需从表面形式从未出现在英语中心训练流水线中的文本中恢复意图、技术词汇和验收标准,而翻译式非英语表述已被证明无法解锁记忆化解决方案。构建过程中,基准设计遭遇了结构性的困难:早期采用的人工编写任务因难度饱和而失效——前沿模型几乎全数通过自动化编写的俄罗斯本地化场景——迫使设计转向从实际修复提交中挖掘任务,将难度来源锚定于真实维护者的工作。此外,基准还需应对动态开源的污染威胁:所有任务确保修复提交时间戳晚于每个评估模型的训练数据截止日,并以任务级新鲜度门控、私有评判器以及全轨迹审计构成四层防泄露防线,同时承受小样本统计分辨率有限(N=25时仅能解析约25个百分点的差异)和单作者语言风格偏差等固有局限。
常用场景
经典使用场景
在智能编码代理的评测领域,RuBench 1.0被精心设计用于检验产品级编码代理在真实仓库层面上的修复能力。其核心场景是,代理接收以俄语原生撰写的客户风格任务描述,面对一个包含数百至上千文件、但已剥离Git历史的仓库快照,自主定位并修复上游维护者确认的bug。该数据集所构建的封闭环境,天然拟合了非英语母语开发者使用自然语言向编码代理布置实际维护任务的真实情境,为衡量代理从非英语、非结构化描述中恢复意图、技术词汇及验收标准的能力提供了严苛而公允的试金石。
解决学术问题
RuBench 1.0直面了现有仓库级智能编码基准的显著空白:任务描述均为英语设计,忽略了非英语母语用户的真实交互范式。该数据集通过引入原生俄语任务规格、严格的新鲜度关卡(所有修复提交均晚于评估模型的训练数据截止日期)以及私有的维护者回归测试判据,系统性解决了记忆污染与测试稀疏性带来的评估失真问题。其贡献在于开创性地将非英语自然语言、仓库级代理工作流与可验证的私有预言机三者融合,使得语言能力与模型记忆效应的解耦测量成为可能,为后续的跨语言编码能力研究确立了严谨的方法论基石。
衍生相关工作
RuBench 1.0的发布已催生了一系列值得关注的后续探索。首先,其方法论直接启发了SWE-MERA等动态基准采用新鲜度门控与可审计轨迹的设计思路。其次,针对该基准中观察到的模型安全回退现象,研究者开始在AgentMeter框架中引入执行模型一致性校验,形成了一套更严格的代理评测协议。再者,基于RuBench中对部分缺陷修复策略差异性的分析,有工作借鉴其多轮独立运行的统计学方法,提出了针对小样本、深层次任务集合的效应量报告规范。最后,该数据集所建立的私密预言机托管模式,也被后续的CODE-BENCH仿效,以对抗训练数据泄露导致的基准退化问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务