遇见数据集

neo4j/aip-skillbench-cohort-ab-sonnet-aipv0_3a2

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

AIP-SkillBench — 16任务组合队列(Sonnet, AIP v0.3a2)是一个用于评估两种技能格式在相同任务上性能的数据集。具体来说,它比较了人类编写的原始技能(human-curated)和基于AIP规范v0.3a2编译的AIP技能(aip-from-curated)。数据集包含两个平衡的8任务队列(A和B),每个任务×模式进行了5次独立试验,总计160次运行。评估使用claude-sonnet-4-6模型作为求解器,并在docker沙盒环境中执行。该数据集暴露了AIP规范v0.3a2的两个失败模式(如脚本错误和过度工程化),从而推动了AIP规范升级到v0.3a3。数据集文件包括运行矩阵、状态总结、详细试验结果以及每个试验的工作目录和日志。

AIP-SkillBench — 16-task Combination Queue (Sonnet, AIP v0.3a2) is a dataset developed to evaluate the performance of two skill formats on identical tasks. Specifically, it compares human-curated original skills with AIP skills compiled against the AIP specification v0.3a2 (aip-from-curated). The dataset consists of two balanced 8-task queues (A and B), with 5 independent trials conducted for each task×mode, totaling 160 runs. The evaluation uses the claude-sonnet-4-6 model as the solver, with all executions carried out in a Docker sandbox environment. This dataset uncovered two failure modes of the AIP specification v0.3a2, such as script errors and over-engineering, which prompted the upgrade of the AIP specification to v0.3a3. The dataset files include run matrices, status summaries, detailed trial results, as well as the working directories and logs for each trial.

提供机构:
neo4j
搜集汇总
数据集介绍
neo4j/aip-skillbench-cohort-ab-sonnet-aipv0_3a2 数据集图片
构建方式
该数据集源自对两种技能格式在同一任务集上的头对头评估。任务集由两个各含8个任务的平衡队列(A、B)组成,共计16项任务。每个任务均以人工编撰的技能(即原始散文描述)及其经由AIP规范v0.3a2编译而成的模式化执行图表示两种模式呈现。评估采用Claude Agent ACP作为求解器代理,基于Claude Sonnet 4-6模型,在Docker沙箱环境中运行。每项任务下的每种模式均独立执行5次试验,总计生成160次运行结果。数据以队列为单位组织,包含运行矩阵、状态汇总、逐试验摘要表及详细的代理轨迹与日志文件。
使用方法
用户可通过HuggingFace数据集加载器直接读取摘要CSV文件进行分析,主要数据表位于各队列目录下的summary.csv中,包含任务、模式、试验序号、状态、奖励值、工具调用次数、运行耗时等核心指标。对于深度分析,可访问每个子试验的工作目录cells/获取完整的求解器轨迹与结果JSON。如需复现实验,需克隆配套的GitHub仓库并切换到sonnet-aipv0.3a2标签,其中包含了完整的基准测试框架、运行配置及可直接使用的AIP编译技能文件。
背景与挑战
背景概述
该数据集由Neo4j研究团队与SkillsBench项目合作创建,聚焦于大型语言模型(LLM)的智能体技能评估。发布于2025年,核心研究问题在于比较两种技能格式——人工撰写的自由文本技能与经AIP(Action Interaction Protocol)编译的结构化执行图表示——在相同任务上的表现差异。通过构建包含16个任务、两种模式、各5次独立试次的平衡队列,总计160次运行,该数据集首次系统性地揭示了AIP编译在技能稳定性与效率方面相对于人工技能的潜在劣势,对LLM智能体技能的形式化表征与自动生成领域具有重要影响。其发布标志着对智能体技能标准化评估框架的推进,并为后续AIP规范的迭代优化提供了关键实证基础。
当前挑战
该数据集主要解决了LLM智能体技能形式化表达中面临的两类挑战。在领域问题层面,传统人工撰写的技能依赖语言推理而缺乏结构约束,难以保证执行的一致性与可复现性;AIP格式虽提供严格的模式验证,但编译过程可能导致确定性缺陷,例如模板填充脚本中的条件处理错误,以及过度工程化带来的性能瓶颈。在构建过程中,数据集遭遇了具体挑战:offer-letter-generator任务中编译脚本预先解析错误数据键,导致各次试次均缺失关键章节;bike-rebalance任务中编译生成的庞大优化器超出单次时间预算,使轻量级的人工方案反而更高效。这些失败模式直接驱动了AIP规范从v0.3a2到v0.3a3的升级,引入了脚本与散文的决策规则、精简性指导及功能性正确性检查。
常用场景
经典使用场景
在智能体系统的评估与验证领域,aip-skillbench-cohort-ab-sonnet-aipv0_3a2数据集扮演着关键角色。该数据集将16个任务划分为两个平衡的8任务群组A和B,每个任务都同时提供了人类精心编写的叙事版本技能和经AIP规范编译为模式化执行图的技能,并在5次独立试验中对比其表现。研究者借此可系统评估不同技能表示形式在相同任务上的性能差异,尤其关注编译过程对技能质量和执行效率的影响。该数据集的核心价值在于通过受控实验揭示技能编译的退化模式,为后续规范迭代提供实证基础。
解决学术问题
该数据集直接回应了智能体系统工程中一个核心学术问题:如何确保从人类可读的技能描述到机器可执行的表示形式的转换不会引入性能退化。通过160次结构化运行,数据集暴露了两种典型的编译失败模式——冻结脚本中的错误条件处理导致的确定性功能退化,以及过度工程化导致的执行超时瓶颈。这些发现推动了AIP规范从v0.3a2到v0.3a3的演进,引入了脚本与叙事决策规则、轻量化指导及功能正确性检查等关键改进。该数据集的意义在于为智能体技能的形式化验证与自动化编译这一前沿研究方向提供了可重复的实验证据,推动了评估方法论的系统化发展。
实际应用
在实际应用层面,该数据集直接服务于智能体自动化开发与部署的生命周期管理。企业级智能体开发者可利用其运行框架进行技能质量基准测试,建立从人类知识到可执行工作流的可信转换流水线。数据集中的失败案例——如offer-letter-generator任务中的条件分支解析错误和bike-rebalance任务中的脚本规模失控——为构建健壮的编译器和沙箱测试环境提供了直接的工程参考。此外,基于该数据集衍生的AIP规范迭代版本已被用于后续的24任务评估集,展示了其在持续改进智能体技能自动化生产流程中的实用价值。
数据集最近研究
最新研究方向
该数据集聚焦于Agent技能表征的标准化前沿探索,通过对比人类撰写的自然语言技能(human-curated prose)与经AIP规范v0.3a2编译的图结构执行技能(aip-from-curated),在16个任务、160次独立运行中系统评估两种格式对LLM智能体任务完成质量的影响。研究揭示了AIP编译过程中两种关键失败模式:一是冻结脚本导致的条件解析错误,如offer-letter-generator任务中模板填充逻辑错误致使核心模块缺失;二是过度工程化带来的性能瓶颈,如bike-rebalance任务中逾1100行的优化器超出执行时间预算。这些发现直接推动了AIP规范从v0.3a2到v0.3a3的迭代升级,引入了脚本-文本决策规则、简洁性引导及编译阶段的函数正确性校验机制,为Agent技能的形式化表征与可靠编译提供了实证基础与改进方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务