TuChong SWE-bench-Multilingual
收藏资源简介:
图虫 SWE-bench-Multilingual 是面向下一代 AI Coding Agent 的多语言软件工程评测基准,考察模型在真实工程场景中的问题理解、缺陷定位与代码修复能力。每个实例均附带版本钉定的 linux/amd64 Docker 环境、gold / test / model 三类补丁以及完整的智能体轨迹,并与 SWE-bench 评测 harness 兼容。
Tuchong SWE-bench-Multilingual is a multilingual software engineering benchmark designed for next-generation AI Coding Agents. It evaluates models' capabilities in real-world software engineering scenarios, including problem understanding, defect localization, and code repair. Each instance comes with a version-pinned linux/amd64 Docker environment, three types of patches (gold, test, and model), complete agent trajectories, and is compatible with the SWE-bench evaluation harness.
数据集概览
TuChong SWE-bench-Multilingual 是一个面向多语言真实软件工程场景的智能体评测基准,聚焦于评估编码智能体在问题理解、缺陷定位与代码修复方面的能力。该基准提供了版本钉定的 Docker 环境、三类补丁(gold / test / model)以及完整的智能体轨迹,并与 SWE-bench 评测 harness 兼容。
数据集内容
- 当前版本:首个公开样例(
demo-2026-08-10),包含 9 个全部解决的实例。 - 语言覆盖:C(2)、C++(2)、Go(2)、Java(2)、TypeScript(1)。
- 任务类型:bug-fix(6 个)与 feature(3 个),为编者标注的编辑性分类。
- 解决状态:全部 9 个实例均为
FULL(完全解决)。 - 污染等级:8 个实例为低风险(low),1 个(
jarro2783__cxxopts-314)为中等风险(medium),中等评级仅基于 issue 年龄的统计因素,并非记忆证据。
数据格式与结构
每个实例包含 15 个文件,涵盖 Dockerfile、环境构建脚本、补丁文件(gold / test / model)、任务定义(task.jsonl)、环境配置(environment.json)、模型输入(model_input.json)以及两种轨迹格式(trajectory.canonical.jsonl 用于训练或人工研读,trajectory.full.jsonl 用于审计与协议研究)。所有轨迹均经过完整脱敏处理。
数据获取与镜像
- GitHub 仓库:包含全部数据载荷,Docker 镜像包(1.4 GB)通过 Release 资产分发。
- Hugging Face 与 ModelScope:提供一站式下载(含 Docker 镜像包),文件与正式数据包逐字节一致,可通过
CHECKSUMS.sha256校验(141/141)。 - Gitee 镜像:国内直连克隆,内容与 GitHub 一致但不含 Release 资产。
- 访问权限:样例数据免费供学术研究使用;完整基准需付费授权,学术与商业用途均可申请。
质量与评估
所有实例在发布前均通过完整发布门禁,包括:
- Gold 补丁干净应用并通过全部声明的 F2P / P2P 测试。
- 智能体补丁解决全部 F2P 且无 P2P 回归。
- 严格的一级干净
git apply(不允许模糊匹配或回退)。 - 训练价值分 ≥ 6.0。
- 打包时绑定校验版本与校验器指纹。
评分遵循 SWE-bench 官方协议(钉定上游 commit f7bbbb2),仅 FULL 状态记为解决。
使用许可与引用
- 样例数据仅授权学术研究与评估使用,免费使用但不得再分发或再发布,且须规范引用;商业用途需联系团队。
- 全部任务源自 MIT 许可的公开 GitHub 仓库,上游许可文本按实例保留。
- 完整方法论、披露事项与已知局限详见
DATA_CARD.md(英文权威原版)及其中文译本。




