遇见数据集

BAGEN

收藏
github2026-06-05 更新2026-06-06 收录
数据链接:
官方服务:

资源简介:

公共BAGEN数据集包含用于构建和评估预算估计基准的工件。它旨在重现报告的离线评估结果、检查智能体部署轨迹,并为预算感知智能体准备SFT/GRPO训练数据。数据集主要分为两个目录:origin/包含原始部署工件,如轨迹、对话和日志;estimation/包含派生的离线预算估计文件,如提示/目标对、评估器输出、模型预测和用于基准评分或下游预算强化学习数据准备的聚合记录。数据集托管在Hugging Face上。

The public BAGEN dataset contains artifacts for constructing and evaluating budget estimation benchmarks. It aims to reproduce reported offline evaluation results, inspect agent deployment trajectories, and prepare SFT/GRPO training data for budget-aware AI agents. The dataset is mainly divided into two directories: the origin/ directory contains raw deployment artifacts such as trajectories, dialogues, and logs; the estimation/ directory contains derived offline budget estimation files, including prompt-target pairs, evaluator outputs, model predictions, and aggregated records used for benchmark scoring or downstream budget reinforcement learning data preparation. The dataset is hosted on Hugging Face.

创建时间:
2026-05-27
原始信息汇总

BAGEN 数据集概述

核心目标:研究大语言模型(LLM)智能体是否能在任务执行过程中,估计令牌数、时间、金钱和存储空间等资源预算。

出版物

  • 论文地址:https://arxiv.org/abs/2606.00198
  • 项目主页:https://ragen-ai.github.io/bagen/
  • 数据地址:https://huggingface.co/datasets/MLL-Lab/BAGEN

许可协议:MIT

数据集构成

数据集托管在 Hugging Face(https://huggingface.co/datasets/MLL-Lab/BAGEN),主要包含两个目录:

  • origin/:原始回滚工件,源自四个场景的轨迹、对话和日志。
  • estimation/:衍生的离线预算估计文件,包含提示/目标对、评估器输出、模型预测以及用于基准评分或强化学习数据准备的汇总记录。

此外,Hugging Face 仓库包含 manifest.jsonl 文件索引,记录路径、大小和直接下载链接。

应用场景

BAGEN 当前专注于四个基准场景:

  • Sokoban:在交互式推箱子游戏中,进行令牌预算估计。
  • Search-R1:在搜索智能体轨迹中进行令牌预算估计。
  • SWE-bench-style coding:在编码智能体日志中进行令牌预算估计。
  • Warehouse:多资源预算估计,涵盖时间、存储空间和累积成本。

方法与流程

基准测试采用两阶段流水线:

  1. 原始回滚收集:在环境中运行任务模型,保存回滚工件和对话 JSON 日志。
  2. 离线预算估计:重放回滚前缀,要求评估模型输出剩余预算区间或判定为“不可能”。
  3. 预算强化学习训练:将估计数据转换为 SFT/GRPO 数据集,训练预算估计器。

数据集用途

  • 复现论文中报告的离线评估结果
  • 检查智能体回滚轨迹
  • 准备用于训练预算感知智能体的 SFT/GRPO 数据

引用

bibtex @misc{bagen2026, title={BAGEN: Are LLM Agents Budget-Aware?}, author={Yuxiang Lin and Zihan Wang and Mengyang Liu and Yuxuan Shan and Longju Bai and Junyao Zhang and Xing Jin and Boshan Chen and Jinyan Su and Xingyao Wang and Jiaxin Pei and Manling Li}, year={2026}, eprint={2606.00198}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2606.00198}, }

搜集汇总
数据集介绍
BAGEN 数据集图片
构建方式
在大语言模型智能体逐步完成长周期任务的过程中,预算感知能力对于资源的高效调度至关重要。BAGEN数据集采用两阶段流水线构建:首先在多样化的交互式环境中运行任务模型,系统化地收集原始轨迹产物与对话日志;随后通过离线预算估计管道,在每个交互前缀处回放部分轨迹,并调用评估模型对剩余资源预算进行区间估计或判定任务不可完成。这些估计结果进一步被转化为监督微调与群组相对策略优化的训练数据,用于培育具备预算感知能力的智能体。数据集涵盖了推箱子游戏、搜索式推理、软件工程编码以及多资源仓储管理四类场景,确保了构建过程的全面性与通用性。
使用方法
为便捷地使用BAGEN数据集,开发者可通过Hugging Face平台直接下载托管于MLL-Lab仓库的完整数据产物。使用流程包括环境配置与运行评估两个核心环节:借助提供的setup脚本与conda环境即可快速完成依赖安装;对于推箱子、搜索式推理、代码代理和多资源仓储四类任务,分别通过约定格式的输入JSON路径与模型名称参数运行对应的评估脚本,即可获得预测结果、真实标签及聚合评价指标。数据集还内置了预算强化学习训练管道,支持将估计数据转换成SFT与GRPO格式,并可通过DRY_RUN模式先进行输入验证,再投入实际训练,极大地方便了研究者的复现与二次开发工作。
背景与挑战
背景概述
大语言模型(LLM)智能体在复杂任务执行过程中,往往需要消耗大量计算资源,包括Token、时间、资金与存储空间。然而,现有智能体系统普遍缺乏对自身资源消耗的感知与预估能力,导致任务执行效率低下或预算超支。为弥补这一空白,由多家机构研究人员于2026年共同创建的BAGEN数据集应运而生,其核心研究问题是评估与训练具备预算感知能力的LLM智能体。BAGEN通过构建涵盖推理解谜、检索增强生成、代码编写与仓储管理等场景的基准,系统性地衡量智能体在部分执行轨迹下对剩余预算的估计能力,为智能体经济性与可靠性研究开辟了新方向。
当前挑战
BAGEN所面临的挑战主要体现在两个层面。在领域问题层面,智能体需在任务尚未完成时,仅依据部分交互历史准确预测剩余Token、时间、金钱或存储开销,这对模型的长程依赖建模与不确定量化能力提出了极高要求。在数据集构建层面,挑战包括:获取并标注来自不同领域(如益智游戏、代码调试、仓储物流)的真实多模态轨迹数据;设计标准化的预算估计任务模板与评估指标;以及确保仓储场景下的敏感数据经匿名化处理后仍保持任务原始结构与预算约束的真实性。此外,如何将预算估计任务转化为可训练的监督微调与强化学习样本,也是构建过程中的关键难点。
常用场景
经典使用场景
在长程智能体交互场景中,BAGEN数据集为评估大型语言模型(LLM)在任务执行中途对token、时间、存储及资金等资源成本的感知与估算能力提供了标准化基准。该数据集覆盖四类典型任务:推箱子游戏中的交互式token预算估计、搜索智能体轨迹的token预算预测、类似SWE-bench的编码智能体日志预算估计,以及涉及时间、仓储占用和累积成本的多资源仓库管理场景。通过将原始智能体轨迹拆解为前缀片段,并要求评估模型输出剩余预算区间或判定任务不可完成,BAGEN构建了渐进式预算估计评测体系,成为检验LLM预算感知能力的核心测试平台。
解决学术问题
BAGEN数据集解决了长期以来学术界对LLM智能体是否具备资源动态预估能力的认知空白。传统智能体研究多侧重任务完成率与推理准确性,而忽视了在执行过程中对预算的实时监控与适应性调整能力。BAGEN通过设计前缀级预算估计任务,系统性地量化了模型在信息不完整时对资源消耗的推断精度,填补了智能体资源意识评估的理论与方法论缺口。该数据集的意义在于揭示了当前主流LLM在预算感知上的显著局限,推动研究范式从单一任务导向转向资源约束下的可持续智能体行为建模,为构建经济高效、资源自适应的下一代AI系统奠定了实证基础。
实际应用
在实际应用中,BAGEN数据集直接服务于需要资源感知能力的自动化与决策系统。例如,在云计算场景中,基于BAGEN训练的预算估计模型可实时预测代码生成、数据分析或客户服务等长周期任务的API调用费用与运行时长,帮助企业在预算上限内优化智能体调用策略。在仓储物流领域,多资源预算估计能力支持机器人实时权衡时间、存储空间与运营成本,提升供应链效率。此外,BAGEN的数据构建与评估流程可嵌入边缘设备上的轻量级智能体,使其在有限计算与能源预算下自主调节任务复杂度,适用于物联网、智能家居等资源敏感型部署环境。
数据集最近研究
最新研究方向
随着大语言模型智能体在编码、搜索、仓储等复杂场景中的长时程任务部署日益增多,资源预算感知能力成为其可靠性与经济性的关键瓶颈。BAGEN数据集针对这一前沿挑战,系统构建了面向Sokoban解谜、Search-R1检索、SWE-bench代码修复及仓储管理四类场景的预算估计基准,涵盖令牌、时间、存储与金钱等多维资源预算预测任务。该数据集不仅提供了完整的轨迹日志与评估框架,更开创性地引入渐进式预算估计范式,通过局部交互前缀让模型判断任务完成可能性及所需剩余预算,推动智能体从“完成任务”向“经济高效地完成任务”转变。结合SFT与GRPO强化学习管线,BAGEN为训练具备成本意识的自主智能体提供了标准化实验平台,其研究将深刻影响可商用的低资源AI Agent系统设计,与当前业界对Agent落地中Token成本控制的高度关注紧密呼应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务