MLE-Dojo
收藏资源简介:
MLE-Dojo是一个基于Kaggle竞赛构建的互动式环境,旨在为机器学习工程中的大型语言模型(LLM)代理提供系统化的强化学习、评估和改进工具。该数据集包含200多个真实世界的Kaggle挑战,涵盖了数据处理、架构搜索、超参数调整和代码调试等多种开放式的MLE任务。MLE-Dojo提供了一个完全可执行的互动环境,支持监督微调和强化学习,以便进行迭代实验、实际数据采样和实时结果验证。通过大规模评估八个前沿LLM,MLE-Dojo揭示了当前模型在生成长期解决方案和高效解决复杂错误方面的局限性。MLE-Dojo的灵活和可扩展架构无缝地整合了多种数据源、工具和评估协议,促进了基于模型的代理调整,并推动了互操作性、可扩展性和可重复性。数据集旨在解决机器学习工程中的挑战,并通过开源框架和基准来推动社区驱动的创新,以开发下一代MLE代理。
MLE-Dojo is an interactive environment built on Kaggle competitions, designed to provide systematic reinforcement learning, evaluation, and improvement tools for Large Language Model (LLM) agents in machine learning engineering (MLE). This dataset contains over 200 real-world Kaggle challenges, covering a variety of open-ended MLE tasks such as data processing, architecture search, hyperparameter tuning, and code debugging. MLE-Dojo offers a fully executable interactive environment that supports supervised fine-tuning and reinforcement learning, enabling iterative experimentation, real-world data sampling, and real-time result validation. Through large-scale evaluation of eight state-of-the-art LLMs, MLE-Dojo reveals the limitations of current models in generating long-term solutions and efficiently resolving complex errors. Its flexible and scalable architecture seamlessly integrates diverse data sources, tools, and evaluation protocols, facilitating model-based agent tuning and advancing interoperability, scalability, and reproducibility. This dataset aims to address challenges in machine learning engineering and drive community-driven innovation via open-source frameworks and benchmarks for developing next-generation MLE agents.
MLE-Dojo数据集概述
数据集简介
- 名称:MLE-Dojo
- 类型:Gym风格框架,用于强化学习、评估和改进自主大型语言模型(LLM)代理在迭代机器学习工程(MLE)工作流程中的表现
- 基础数据:基于200+个真实世界的Kaggle挑战
- 特点:
- 涵盖多样化的开放式MLE任务
- 反映真实的机器学习工程场景(如数据处理、架构搜索、超参数调整、代码调试等)
- 提供完全可执行的环境和灵活接口
数据集内容
- 任务来源:
- 68个来自MLE-Bench的竞赛(排除7个不可用、过大或与特定包紧密耦合的任务)
- 74个来自DSBench的竞赛
- 75个从Kaggle官网额外爬取和准备的竞赛
- 任务总数:200+个独特的任务
数据准备
- 步骤:
- 安装Kaggle包并设置API令牌
- 手动接受每个竞赛的条款和条件
- 使用提供的脚本准备数据(
prepare/mle.py或prepare/dsbench.py)
- 注意事项:
- 数据准备过程耗时且占用空间
- 需要为每个竞赛单独接受条款和条件
使用方式
- 环境设置:
- 支持Docker和Conda两种方式
- 需要配置LLM API密钥(如OpenAI、Gemini等)
- 快速开始:
- 提供Python示例代码展示如何与MLE-Dojo交互
- 支持注册竞赛、初始化环境和执行代码等操作
- 实验运行:
- 支持使用Docker和不使用Docker两种方式
- 提供多种配置选项(如GPU设置、任务运行时间等)
支持的功能
- 代理脚手架:
- 原始支持动作空间的MLE代理
- AIDE(AI-Driven Exploration)代理
- 基于OpenAI Agents包的MLE代理实现
- 模型支持:
- 支持主流LLM(如GPT、Deepseek、Gemini、Grok、Claude等)
- 支持本地模型(如LLaMA、Qwen等)
许可与引用
- 许可证:
- 项目代码采用MIT许可证
- 不同竞赛可能受不同许可证管辖
- 引用方式:
- 提供BibTeX格式的引用条目
使用条款
- 用途限制:仅限教育和学术研究
- 数据完整性:不保证准确性、完整性或及时性
- 知识产权:必须遵守原始创作者的权利
- 免责声明:数据集按"原样"提供,不承担任何责任

- 1MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering乔治亚理工学院、斯坦福大学 · 2025年



