遇见数据集

TuChong SWE-bench-Multilingual

收藏
github2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

图虫 SWE-bench-Multilingual 是面向下一代 AI Coding Agent 的多语言软件工程评测基准,考察模型在真实工程场景中的问题理解、缺陷定位与代码修复能力。每个实例均附带版本钉定的 linux/amd64 Docker 环境、gold / test / model 三类补丁以及完整的智能体轨迹,并与 SWE-bench 评测 harness 兼容。

Tuchong SWE-bench-Multilingual is a multilingual software engineering benchmark designed for next-generation AI Coding Agents. It evaluates models' capabilities in real-world software engineering scenarios, including problem understanding, defect localization, and code repair. Each instance comes with a version-pinned linux/amd64 Docker environment, three types of patches (gold, test, and model), complete agent trajectories, and is compatible with the SWE-bench evaluation harness.

创建时间:
2026-08-03
原始信息汇总

数据集概览

TuChong SWE-bench-Multilingual 是一个面向多语言真实软件工程场景的智能体评测基准,聚焦于评估编码智能体在问题理解、缺陷定位与代码修复方面的能力。该基准提供了版本钉定的 Docker 环境、三类补丁(gold / test / model)以及完整的智能体轨迹,并与 SWE-bench 评测 harness 兼容。

数据集内容

  • 当前版本:首个公开样例(demo-2026-08-10),包含 9 个全部解决的实例。
  • 语言覆盖:C(2)、C++(2)、Go(2)、Java(2)、TypeScript(1)。
  • 任务类型:bug-fix(6 个)与 feature(3 个),为编者标注的编辑性分类。
  • 解决状态:全部 9 个实例均为 FULL(完全解决)。
  • 污染等级:8 个实例为低风险(low),1 个(jarro2783__cxxopts-314)为中等风险(medium),中等评级仅基于 issue 年龄的统计因素,并非记忆证据。

数据格式与结构

每个实例包含 15 个文件,涵盖 Dockerfile、环境构建脚本、补丁文件(gold / test / model)、任务定义(task.jsonl)、环境配置(environment.json)、模型输入(model_input.json)以及两种轨迹格式(trajectory.canonical.jsonl 用于训练或人工研读,trajectory.full.jsonl 用于审计与协议研究)。所有轨迹均经过完整脱敏处理。

数据获取与镜像

  • GitHub 仓库:包含全部数据载荷,Docker 镜像包(1.4 GB)通过 Release 资产分发。
  • Hugging Face 与 ModelScope:提供一站式下载(含 Docker 镜像包),文件与正式数据包逐字节一致,可通过 CHECKSUMS.sha256 校验(141/141)。
  • Gitee 镜像:国内直连克隆,内容与 GitHub 一致但不含 Release 资产。
  • 访问权限:样例数据免费供学术研究使用;完整基准需付费授权,学术与商业用途均可申请。

质量与评估

所有实例在发布前均通过完整发布门禁,包括:

  • Gold 补丁干净应用并通过全部声明的 F2P / P2P 测试。
  • 智能体补丁解决全部 F2P 且无 P2P 回归。
  • 严格的一级干净 git apply(不允许模糊匹配或回退)。
  • 训练价值分 ≥ 6.0。
  • 打包时绑定校验版本与校验器指纹。

评分遵循 SWE-bench 官方协议(钉定上游 commit f7bbbb2),仅 FULL 状态记为解决。

使用许可与引用

  • 样例数据仅授权学术研究与评估使用,免费使用但不得再分发或再发布,且须规范引用;商业用途需联系团队。
  • 全部任务源自 MIT 许可的公开 GitHub 仓库,上游许可文本按实例保留。
  • 完整方法论、披露事项与已知局限详见 DATA_CARD.md(英文权威原版)及其中文译本。
搜集汇总
数据集介绍
TuChong SWE-bench-Multilingual 数据集图片
构建方式
TuChong SWE-bench-Multilingual 数据集构建于真实世界多语言软件工程场景,覆盖 C、C++、Go、Java 与 TypeScript 五种异构语言生态。每个任务实例源自公开的 MIT 许可 GitHub 仓库,经问题理解、缺陷定位与代码修复全流程构建。实例配备版本钉定的 linux/amd64 Docker 环境,包含 gold、test 与 model 三类补丁,并附完整智能体轨迹。首个公开样例包含 9 个完全解决的实例,由 mini-swe-agent 与 Kimi K3 协同生成,经真实 Docker 评分验证,确保环境可复现与轨迹可追溯。
使用方法
使用该数据集需先克隆仓库并下载钉定的 Docker 镜像包,通过 CHECKSUMS.sha256 校验完整性。随后加载镜像,针对目标实例构建环境,如用 docker build 与 docker run 进入容器。在容器内应用 agent 补丁,运行 run_tests.sh 执行回归测试。任务定义遵循 SWE-bench 标准字段,可与官方评测 harness 对接。注意 task.jsonl 中的评测标签字段不应用于模型输入,而 trajectory.canonical.jsonl 适合训练,model_input.json 专供模型使用,完整数据集可通过申请获取商业或学术授权。
背景与挑战
背景概述
TuChong SWE-bench-Multilingual 是由图虫 AI 团队于 2026 年 8 月推出的多语言软件工程智能体评测基准,旨在评估 AI 编程代理在真实、多语言软件工程任务中的综合能力,涵盖问题理解、缺陷定位与代码修复等关键环节。该基准首次公开了涵盖 C、C++、Go、Java 与 TypeScript 五种语言的 9 个实例,每个实例均附带版本钉定的 Docker 环境、三类补丁及完整智能体轨迹,并兼容 SWE-bench 评测协议。其核心研究问题在于如何构建一个环境可验证、轨迹可复现的多语言评测平台,以促进跨语言环境下智能体泛化能力的研究。作为首个公开演示版本,该数据集填补了多语言 SWE 评测领域的空白,为学术界的代码智能研究提供了新的基准与参照。
当前挑战
该数据集面临的核心挑战在于多语言软件工程评测的复杂性与真实性的平衡。首先,不同语言生态系统(如 C/C++ 的编译依赖、Java 的构建工具、Go 的模块管理)导致环境构建与测试执行的标准难以统一,需依赖钉定的 Docker 镜像与网络资源,增加了环境复现的难度。其次,数据集的构建过程中需确保任务实例的干净解算,避免模型记忆污染,因此对补丁应用要求严格的一级干净 git apply,并需进行污染等级审计,但如中等污染实例的统计性风险仍难以完全规避。此外,评测的完整性要求每个实例的轨迹脱敏、审计证据持久化,以及多镜像多平台分发的一致性校验,这些都构成了规模化扩展时的显著技术与协作障碍。
常用场景
经典使用场景
TuChong SWE-bench-Multilingual作为多语言软件工程智能体评测基准,其经典使用场景聚焦于评估编码智能体在真实跨语言软件工程任务中的综合能力。研究者通过向智能体提供包含问题描述、代码仓库状态及测试用例的任务实例,考察其在异构语言生态(C、C++、Go、Java、TypeScript)下的问题理解、缺陷定位与代码修复能力。每个实例配备版本钉定的Docker环境与标准SWE-bench评测协议,支持对智能体性能进行严谨、可复现的横向比较,是衡量下一代AI编码代理在复杂工程场景中泛化能力的重要工具。
解决学术问题
该数据集解决了现有软件工程基准普遍存在的语言单一性与环境不可复现问题,为跨语言代码修复研究提供了统一且可验证的评测平台。通过严格的质量门禁(gold补丁验证、无回归标准、轨迹价值评分)与污染等级披露,它保障了评测结果的可靠性与公平性,从而支持对模型鲁棒性、泛化能力及训练数据泄漏风险的深入探讨。其发布推动了多语言环境下智能化软件维护、自动化缺陷修复及代码智能体可复现性研究的科学化发展,为学术社群提供了宝贵的实证资源与审计范本。
实际应用
在实际应用中,TuChong SWE-bench-Multilingual为企业与开发团队提供了评估和遴选代码智能体的实用基准。开发人员可借助此基准,客观地比较不同AI编程助手在多样化项目(如c-ares、gin-gonic、jsoup)上的修复质量与效率,进而优化工具选型。该数据集亦可用于智能体训练数据的构建与增强,提升模型在真实代码库上的问题解决能力。其镜像发布与国内直连支持,降低了实际应用的门槛,促进了先进软件工程智能体技术的落地与部署。
数据集最近研究
最新研究方向
随着大型语言模型驱动的自主软件工程智能体(AI Coding Agent)的迅猛发展,多语言环境下的真实问题解决能力已成为评估其实际效用的关键维度。TuChong SWE-bench-Multilingual 基准的发布,顺应了从单一语言(如Python)向C、C++、Go、Java、TypeScript等异构生态扩展的全球趋势,弥补了现有基准在语言覆盖面和环境可复现性上的不足。该基准通过版本钉定的Docker环境、完整智能体轨迹及严格的全量解决(FULL)评分协议,为跨语言缺陷定位与代码修复提供了可信的评测平台。其强调的“环境可验证、轨迹可复现”特性,直击当前智能体评估中幻觉与不可复现性的痛点,对于推动可信赖的自动化软件维护、加速多语言项目中的智能辅助开发具有重要的方法论意义和实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务