遇见数据集

cap-sweep-eval-data

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是 cap-sweep-eval-data,为双盲研讨会投稿的匿名补充发布而创建。它包含用于评估 LoRA 适配器在 Opaque Knapsack 代理任务上性能的评估任务定义和 cap-sweep 结果存档。数据集由多个子目录组成:dense/、full2x2/、seeds/、second_family/ 和 tmax/ 分别存储不同实验家族(如持久/无状态训练与运行时范式的每轮工具调用上限扫描、种子变异、第二任务家族和最大轮次扫描)的结果存档;tasks_knap_med/、tasks_nav_med/ 和 tasks_rule_off/ 则包含 Knapsack、Navigation 和 Rule-diagnosis 三个代理任务家族的任务定义。该数据集作为 NeurIPS 研讨会投稿的匿名部分发布,旨在支持论文中报告数字的可重复性审查。

This dataset is cap-sweep-eval-data, created for the anonymous supplementary release of a double-blind workshop submission. It contains evaluation task definitions and cap-sweep result archives for assessing the performance of LoRA adapters on Opaque Knapsack agent tasks. The dataset consists of multiple subdirectories: dense/, full2x2/, seeds/, second_family/, and tmax/ store result archives from different experimental families (e.g., per-round tool call cap sweeps for persistent/stateless training and runtime paradigms, seed variations, second task family, and maximum round sweeps); tasks_knap_med/, tasks_nav_med/, and tasks_rule_off/ contain task definitions for three agent task families: Knapsack, Navigation, and Rule-diagnosis. This dataset is released as an anonymous part of a NeurIPS workshop submission to support reproducibility review of the numbers reported in the paper.

创建时间:
2026-08-18
原始信息汇总

数据集概述

cap-sweep-eval-data 是一个用于评估智能体任务(agentic tasks)中“cap-sweep”结果的数据集,匿名发布以供双盲研讨会论文的复现性审查使用。该数据集与十种 LoRA 适配器(基于 Qwen3-8B、Mistral-7B-v0.3、Llama-3.1-8B 等模型微调)配套,包含评估任务定义和用于生成论文报告数值的 cap-sweep 结果存档。


数据集内容

按任务族分组,而非按运行名称:

  • knapsack/:背包任务族

    • main:主要的 Qwen3-8B 种子扫描结果。
    • rollout2:第二次 rollout 的复制实验。
    • mistral:基于 Mistral-7B-v0.3 的复制实验。
    • llama31:基于 Llama-3.1-8B 的复制实验。
    • seeds:额外两个训练种子(777 和 1337)的结果。
    • dense:剂量-响应密集 cap 网格。
    • tmax:回合长度(episode horizon)控制实验。
    • checkpoint:cap 边界传递(gate-2)干预单元。
    • task_defs:任务定义文件。
  • rule_diagnosis/:规则诊断任务族

    • main:主要评估结果。
    • task_defs:任务定义文件。
  • navigation/:导航任务族

    • main:主要的导航 cap 扫描结果。
    • batch2:批次大小为 2 的干预实验。
    • unbatched:未分批次干预实验。
    • task_defstask_defs_batch2:任务定义文件。

每个 */task_defs* 目录包含该任务族的任务实例(tasks/<family>/*.json)以及评估框架的 _cfg.jsonmanifest.json 文件。


来源与发布状态

  • 匿名发布,随 NeurIPS workshop 投稿提供,用于复现性审查。
  • 非匿名版本(包含论文引用、完整代码、完整训练轨迹)将在审查结束后发布。
搜集汇总
数据集介绍
cap-sweep-eval-data 数据集图片
构建方式
在智能体能力评估与可复现性研究领域中,基准数据的构建方式直接关乎结论的可信度。该数据集源自一项双盲研讨会投稿的匿名补充材料,其构建紧密围绕十四种LoRA适配器所支持的三类智能体任务——背包问题、规则诊断与导航,通过系统化微调Qwen3-8B、Mistral-7B-v0.3及Llama-3.1-8B等基座模型,生成配套的评估任务定义与容量扫描结果档案。数据按任务族与基座模型分层组织,各单元格自身配置不记录基座模型信息,仅凭目录位置即可唯一确定其归属,从而在保护盲审匿名性的同时保障结构清晰可溯。
特点
该数据集在结构设计与实验控制上呈现出若干显著特征。其一,任务族划分明确,涵盖背包、规则诊断与导航三类典型智能体场景,每族下依据基座模型与实验臂细分目录,形成层次分明的文件布局。其二,实验维度丰富,包含主种子扫描、独立二次解码、跨基座模型复现、额外训练种子、剂量响应密集网格、回合视界控制以及容量边界结转干预等多种设置,为深入分析智能体行为边界提供了充分的数据支撑。其三,导航任务族额外提供批大小为二与无批处理干预臂,并配套逐任务结果与轨迹,增强了机制表行项的可复现性。
使用方法
使用该数据集时,研究者可依据目录层次定位特定任务族、基座模型与实验臂对应的评估结果与轨迹文件。每个任务族下的task_defs目录承载该族任务实例及运行框架的配置文件与清单,这些定义不依赖于具体模型,可直接用于复现实验环境。背包任务族中的主扫描、独立解码、跨模型复现、种子扩展、密集容量网格、回合视界控制及容量边界干预等单元格,分别对应不同研究问题,使用者可按需选取相应子目录进行对比分析。导航任务族的批处理干预臂配有匹配的逐任务结果与轨迹,使得机制表相关行项能够从该镜像完整复现,为可复现性审查提供便利。
背景与挑战
背景概述
近年来,大语言模型在智能体任务中的应用日益广泛,如何评估其代码执行与规划能力成为关键议题。cap-sweep-eval-data数据集作为匿名补充材料,随一篇NeurIPS workshop投稿一同发布,旨在支持可复现性审查。该数据集涵盖背包问题、规则诊断与导航三类智能体任务,包含Qwen3-8B、Mistral-7B-v0.3、Llama-3.1-8B等模型经LoRA微调后的评估任务定义与容量扫描结果。其核心研究问题在于探究模型在不同容量约束下的表现变化,为智能体能力边界评估提供基准。该数据集的影响力在于推动智能体评估的标准化与透明化,促进后续研究对模型容量与任务复杂度的深入理解。
当前挑战
该数据集所解决的领域问题——智能体任务评估——面临多重挑战。就任务本身而言,背包问题涉及组合优化与资源约束,规则诊断要求模型具备逻辑推理与状态追踪能力,导航任务则需处理空间规划与序列决策,这些均对模型的泛化性与鲁棒性提出高要求。在构建过程中,挑战体现在:确保十四种LoRA适配器与多模型配置的精确对应,避免因目录结构复杂导致的混淆;生成并整理容量扫描结果时,需保证不同种子、批次与干预条件下的数据一致性;此外,匿名发布限制了元数据的完整披露,增加了外部复现的难度,而任务定义的多样性与模型特异性进一步加剧了评估的复杂性。
常用场景
经典使用场景
在智能体能力评估与容量控制研究领域,该数据集构成一项面向代码执行智能体的系统性评测资源,其核心用途在于支撑“容量扫描”范式的实验实施。研究者依托背包问题、规则诊断与导航三类代理任务,在Qwen3-8B、Mistral-7B-v0.3及Llama-3.1-8B等基座模型上加载十四种LoRA适配器,对持久化与无状态两种推理模式进行细粒度容量边界扫描,从而精确刻画智能体在代码执行环境中的能力阈值与行为模式。
实际应用
在实际应用层面,该数据集服务于需要精细调控智能体探索范围与计算预算的场景。例如在自动化代码生成、复杂规则推理与序列决策任务中,开发者可以借助数据集中的容量扫描配置与结果,评估不同容量参数对智能体成功率与资源消耗的影响,进而为部署环境选择恰当的容量策略。其任务定义与结果存档亦可直接用于验证智能体框架在边界条件下的鲁棒性与泛化能力。
衍生相关工作
围绕该数据集,相关研究衍生出多条经典工作脉络。一方面,基于背包任务的多基座模型复制实验与多种子训练配置推动了智能体容量控制方法的跨模型验证;另一方面,规则诊断与导航任务上的批量与无批量干预实验,促使研究者深入探讨推理批次与容量边界的交互效应。此外,剂量响应网格与回合视野控制等设计,为后续智能体评估基准的构建提供了可借鉴的实验范式与数据组织形式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务