遇见数据集

neo4j/aip-skillbench-24task-sonnet-aipv0_3a3

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

AIP-SkillBench数据集是一个用于评估两种技能格式在相同任务上性能的原始评估运行数据。具体来说,它进行了头对头比较:一种是human-curated,即任务原始的人类编写技能(散文形式);另一种是aip-from-curated,即将相同的人类技能编译成AIP(一种模式验证的执行图表示)。数据集包含24个任务的分层样本,分为三个平衡的8任务队列(A、B、C)。每个任务×模式运行5次独立试验,总计240次运行。求解器代理为claude-agent-acp,模型为claude-sonnet-4-6,AIP编写使用claude-opus基于AIP规范v0.3a3完成。沙箱环境为docker,基准测试扩展自SkillsBench。数据布局包括每个队列的文件夹,包含campaign.json、status.json、summary.csv、summary.jsonl、cells和logs等文件。源代码和技能可在GitHub仓库中找到,标签为sonnet-aipv0.3a3。数据集可用于分析和比较不同技能格式在LLM代理任务中的效果。

The AIP-SkillBench dataset is a raw evaluation run dataset designed to assess the performance of two skill formats on identical tasks. Specifically, it implements a head-to-head comparison: one format consists of human-curated, original human-written task skills presented in prose form; the other is aip-from-curated, which compiles the same human-written skills into AIP, a pattern-validated execution graph representation. The dataset comprises stratified samples of 24 tasks, split into three balanced 8-task queues labeled A, B, and C. Each task×mode combination undergoes 5 independent trials, resulting in a total of 240 runs. The solver agent used is claude-agent-acp, with the underlying model being claude-sonnet-4-6. AIP authoring was completed using claude-opus based on the AIP Specification v0.3a3. The sandbox environment is Docker, and the benchmark is extended from SkillsBench. The data layout includes folders for each queue, containing files such as campaign.json, status.json, summary.csv, summary.jsonl, cells, and logs. The source code and skills are available in a GitHub repository tagged with sonnet-aipv0.3a3. This dataset can be used to analyze and compare the performance of different skill formats in LLM agent task scenarios.

提供机构:
neo4j
搜集汇总
数据集介绍
neo4j/aip-skillbench-24task-sonnet-aipv0_3a3 数据集图片
构建方式
该数据集源自AIP-SkillBench评估框架,旨在对比两种技能格式在同一任务集上的表现:即人类撰写的原始技能(human-curated)与经由AIP规范编译的可执行图表示(aip-from-curated)。选取的24项任务来自SkillsBench基准测试,被均衡划分为三个各含8项任务的子队列(A、B、C)。每项任务与每种技能模式的组合均独立执行5次试验,总计生成240次运行记录。求解器采用claude-agent-acp智能体,驱动模型为claude-sonnet-4-6,AIP技能由claude-opus参照AIP v0.3a3规范编写,运行环境基于Docker沙箱。
使用方法
用户可通过Python的pandas库直接读取托管于HuggingFace上的summary.csv文件进行数据分析,示例代码为pd.read_csv("hf://datasets/neo4j/aip-skillbench-24task-sonnet-aipv0_3a3/cohort-a/summary.csv")。如需复现完整实验或获取AIP编译技能与人类技能的具体内容,可克隆GitHub仓库(https://github.com/zach-blumenfeld/aip-skillbench)并切换至sonnet-aipv0.3a3标签,相关技能文件存放于generated-skills/与vendor/skillsbench/目录下。运行配置则位于configs/文件夹内的YAML文件中,为研究者提供了从数据查看到实验复现的完整通路。
背景与挑战
背景概述
AIP-SkillBench是2025年由Zach Blumenfeld团队发布的面向LLM Agent技能表征的评估基准,隶属于SkillsBench生态系统。该数据集聚焦于Agent任务执行中技能描述形式对性能的影响,核心研究问题在于比较自然语言撰写的‘人工策展技能’与基于AIP规范的形式化执行图表示在Agent任务完成中的有效性。通过24项跨领域任务的240次独立实验,数据集首次系统揭示了结构化技能表征对Agent行为的一致性和可复现性的促进作用,为Agent技能工程领域提供了关键的经验证据与可重复评估范式。
当前挑战
该数据集面临双重挑战。首先是领域问题层面,现有Agent系统依赖非结构化自然语言技能描述,导致任务执行中存在歧义、碎片化与不可复现性,具体表现为不同Agent对同一技能的理解差异显著,且在复杂多步骤任务中容易陷入局部错误而无法恢复。其次是构建挑战,包括:1)确保24项任务涵盖足够多元的领域以支撑泛化性结论,需要精细的任务筛选与平衡设计;2)AIP技能转换过程中需避免信息损失或语义偏差,这对规范完备性与编译精度提出高要求;3)每次试验需在隔离的Docker沙箱中执行,保障结果的可信度同时增加了运行管理的复杂性。
常用场景
经典使用场景
在智能体(Agent)与大语言模型的研究领域中,AIP-SkillBench 数据集因其结构化对比评估的独特设计,成为评测不同技能表示范式对智能体任务执行效能影响的经典基准。该数据集精心构建了24项任务的三组平衡队列,每项任务均提供人类撰写的自然语言技能描述与经由AIP编译的规范化执行图表示两种形态,通过5次独立重复试验累积240条运行记录,为系统考察技能形式化表示与智能体执行稳定性之间的关系提供了可靠的数据支撑。
解决学术问题
该数据集有效回应了智能体研究中的核心问题:人类编写的自然语言技能描述与结构化、可验证的技能表示(AIP)在智能体任务执行效率、成功率及鲁棒性上是否存在显著差异。通过对比两种模式在相同任务场景下的奖励值、工具调用次数、运行耗时等多维度指标,研究者能够量化不同技能表示形式对智能体行为一致性和任务完成质量的影响,推动了面向执行级的技能表示优化与智能体自主推理能力的学术探索。
实际应用
在实际应用中,AIP-SkillBench 所揭示的规律可直接指导智能体系统的工程设计,尤其是在需要高度可靠执行的自动化运维、机器人流程自动化(RPA)和软件开发辅助等场景中。AIP表示技能的模式有助于降低任务执行过程中因语言歧义导致的错误率,提升工具链调用的精确性,从而为企业级智能体系统的稳定部署与规模化扩展提供了可复用的评估方法与优化方向。
数据集最近研究
最新研究方向
当前智能体技能表征的前沿探索正从自然语言描述的松耦合范式迈向结构化的可执行图表示。该数据集通过精心设计的24任务分层抽样,系统对比了人类撰写的技能文本与经AIP规范v0.3a3编译的架构化技能在Claude Sonnet-4智能体上的执行效能,每项任务进行5次独立重复实验,总计240次运行。这一工作在SkillsBench基准之上构建了严谨的对照实验框架,其核心价值在于量化评估技能形式化表达对自主智能体任务完成质量、工具调用效率与运行稳定性的影响。随着大语言模型智能体在多步骤复杂任务场景中的广泛部署,如何将隐性的领域知识编码为可验证、可复用的技能模块已成为制约系统鲁棒性的关键瓶颈,该数据集为探讨这一热点问题提供了珍贵的细粒度运行轨迹与对比证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务