遇见数据集

ethara/milo-bench-samples

收藏
Hugging Face2026-07-14 更新2026-07-22 收录
官方服务:

资源简介:

Milo-Bench是一个用于评估长视野软件工程能力的基准测试数据集,专注于里程碑规模的工程任务,而非孤立的编码能力。它测量代理是否能够完成跨越多个文件、语言和架构组件的里程碑规模工程任务,同时保持现有生产代码库的正确性。数据集包含30个任务,分为五个难度等级(Trivial、Easy、Medium、Hard、Expert),基于观察到的难度进行校准。任务覆盖8种编程语言(Go、Python、TypeScript、Rust、C、Java、JavaScript、C++)和19个代码库。每个任务都包含三个前沿模型(Claude Opus 4.8、Gemini 3.1 Pro、GPT-5.5)的完整代理轨迹,每个模型运行3次,总共270次评分运行。评分采用连续部分信用机制,范围从0到1,通过网络密封的验证器进行评分,确保公平性。数据集是完整Milo-Bench语料库的代表性样本,用于评估,其格式、轨迹和评分与生产基准相同。

Milo-Bench is a benchmark dataset designed to evaluate long-horizon software engineering capabilities, focusing on milestone-scale engineering tasks rather than isolated coding abilities. It measures whether AI Agents can complete milestone-scale engineering tasks spanning multiple files, programming languages and architectural components, while preserving the correctness of existing production codebases. The dataset contains 30 tasks divided into five difficulty levels (Trivial, Easy, Medium, Hard, Expert), calibrated based on observed task difficulty. The tasks cover 8 programming languages (Go, Python, TypeScript, Rust, C, Java, JavaScript, C++) and involve 19 codebases. Each task includes complete agent execution trajectories from three state-of-the-art models: Claude Opus 4.8, Gemini 3.1 Pro, and GPT-5.5, with 3 runs per model, totaling 270 scored evaluation runs. Scoring adopts a continuous partial credit mechanism ranging from 0 to 1, and is conducted via web-sealed validators to ensure evaluation fairness. This dataset is a representative sample of the full Milo-Bench corpus for evaluation purposes, with its format, trajectory data and scoring protocol identical to those of the official production benchmark.

提供机构:
ethara
搜集汇总
数据集介绍
ethara/milo-bench-samples 数据集图片
构建方式
Milo-Bench-Samples 数据集是一个专为评估长周期软件工程能力而构建的基准测试集,包含30个精心设计的任务。每个任务均以容器化问题解决的形式呈现,围绕一个完整的代码库里程碑式变更构建,涵盖从Trivial到Expert五个难度等级。数据集的构建过程严谨:首先从19个代码库、8种编程语言中提取任务,每个任务附带人工撰写的参考补丁(reference patch)和完整的测试套件;随后,调用Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5三个前沿模型,每个任务各执行3次运行,共产生270条带评分轨迹;最后,通过网络封闭的验证器(verifier)对每条轨迹进行连续评分,确保评分过程与参考解完全隔离,杜绝作弊可能。
使用方法
使用Milo-Bench-Samples数据集进行模型评估时,用户可直接利用已提供的评分数据进行复现分析,无需重新执行代理轨迹。每个任务目录下的`result.json`文件包含了完整的验证器评分与诊断信息,其中`verifier_result.scores.score`字段提供了连续评分结果。通过读取所有轨迹目录中的评分数据,用户可以轻松计算各模型的通过率(pass@3),即得分恰好为1.0的运行次数占总运行次数的比例。对于希望进行更深入研究的用户,数据集还提供了完整的结构化轨迹(`agent/trajectory.json`)和终端录制文件(`agent/recording.cast`),便于分析模型的行为模式与决策过程。
背景与挑战
背景概述
在软件工程自动化领域,现有基准测试如SWE-bench和Multi-SWE-bench聚焦于单次代码缺陷修复,而SWE-EVO虽将任务扩展至发布级别的演化,却局限于Python语言范畴。由Ethara.AI团队于近年创建的Milo-Bench,旨在弥合这一鸿沟,通过评估智能体在跨多文件、多语言及多架构组件的代码库中完成里程碑式工程任务的能力,填补了现有评测体系对长周期、复合型软件工程能力评估的空白。该数据集精选30个任务样本,覆盖8种编程语言与19个代码库,依据实际观测难度划分为五个层级,为衡量前沿模型的长期规划与工程化能力提供了标准化评测框架,对推动自动化软件工程研究具有重要参考价值。
当前挑战
Milo-Bench所解决的核心领域挑战在于,现有基准无法有效评测智能体在真实生产环境中的长周期工程能力,而传统单点修复任务不足以反映复杂软件维护的全局性需求。在构建过程中,研究团队面临多项挑战:首先,需确保任务定义的真实性与规模性,每个任务均源于真实代码库中的里程碑级变更集,涉及大量关联问题与拉取请求;其次,评分机制需兼顾严格性与包容性,采用连续评分与部分学分机制以捕捉模型在漫长任务中的渐进式进展,避免简单二元判定;最后,防作弊架构设计至关重要,通过网络隔离验证器与禁止访问参考解决方案,确保评测过程的公平性与结果的可信度。
常用场景
经典使用场景
Milo-Bench样本集专注于评估人工智能代理在长期、多步骤软件工程任务中的综合能力,超越了传统基准测试对单次代码修复或函数级别问题的关注。该数据集精选了30个涵盖8种编程语言、横跨19个不同代码库的里程碑式工程任务,每个任务均要求代理在完整的代码仓库环境中进行跨文件、跨语言及跨架构组件的协同修改。经典的评估流程是将任务描述呈现给代理,代理需在容器化的隔离环境中自主探索、生成并应用补丁,最终由网络密封的验证器根据新通过测试的比例及回归抑制程度,输出一个介于0到1之间的连续评分。这种设计使得研究者能够精确衡量模型在处理复杂、长期工程挑战时的真实表现。
解决学术问题
该数据集的核心学术贡献在于填补了现有基准测试在评估长期、多步骤软件工程能力方面的空白。传统基准如SWE-bench聚焦于单一问题的修复,而Multi-SWE-bench虽扩展了语言范围却未提升任务粒度,SWE-EVO则局限于Python生态。Milo-Bench通过提出里程碑级别的任务场景,有效解决了学术界难以量化评估AI代理在复杂、跨模块工程任务中逐步推理与持续修复能力的难题。它引入的连续评分机制,允许对部分成功的尝试进行有效区分,避免了二元通过/失败指标在中等难度任务上的信息损失,从而为模型能力排名提供了更细腻、更可靠的比较基础,推动了软件工程智能体评估方法论的演进。
实际应用
在实际应用中,Milo-Bench样本集为评估和选择适合复杂软件开发的AI编程助手提供了高价值的测试基准。例如,企业或开发团队在引入自动化代码修复或功能开发工具时,可参考该数据集的评分体系来衡量工具在处理涉及多文件修改、跨语言协调以及保持现有代码库稳定的长周期任务时的实际效能。该数据集中包含的困难等级分层(从Trivial到Expert)与成本分析数据,使组织能够根据任务的实际复杂度与预算约束,做出更明智的模型部署决策。此外,网络密封的评分机制确保了评估结果的公正性,为AI辅助软件工程工具的商业化落地提供了可信赖的度量依据。
数据集最近研究
最新研究方向
Milo-Bench样本集聚焦于长周期软件工程能力的评估,突破了传统基准仅关注单点代码修复的局限,将评价尺度延伸至跨文件、多语言、多架构组件的里程碑式任务完成度。该数据集通过引入连续评分机制与网络密封验证器,精细刻画了模型在复杂工程场景中的渐进式进展,避免了二元通过率导致的信息坍缩。其对五种难度层级、八种编程语言及十九个代码库的系统涵盖,为前沿智能体在真实生产级代码库中的整体解决能力提供了更具分辨力的度量标尺,推动了软件工程自动化评估从孤立功能修补向全流程架构演进的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务