遇见数据集

neo4j/aip-skillbench-3med-sonnet-aipv0_3a2

收藏
Hugging Face2026-06-01 更新2026-06-14 收录
官方服务:

资源简介:

AIP-SkillBench数据集包含3个中等难度任务的评估运行数据,这些任务是从SkillsBench中随机抽样的。该数据集评估了三种技能格式在同一任务上的表现:human-curated(人类编写的原始技能)、aip-from-curated(将人类技能编译为AIP格式,即经过模式验证的执行图表示)和aip-from-instruction(仅从任务指令编写的AIP技能,无人类技能参与)。每个任务×模式组合进行了5次独立试验,总共有45次运行。使用的求解代理是claude-agent-acp,模型是claude-sonnet-4-6,AIP编写基于AIP规范v0.3a2,使用claude-opus模型完成,沙箱环境为docker。数据集扩展自SkillsBench基准,任务包括晶体学Wyckoff位置分析、无人机规划控制和地震板块计算。数据布局包括campaign.json(运行矩阵)、status.json(运行统计)、summary.csv(每试验一行数据)以及cells/和logs/目录(分别存储每试验的工作目录和求解日志)。summary.csv包含任务、模型、模式、试验、状态、奖励、工具调用次数、运行时间、错误等列。

The AIP-SkillBench dataset contains evaluation run data for three moderate-difficulty tasks randomly sampled from the SkillsBench benchmark. This dataset evaluates the performance of three skill formats on the same tasks: human-curated (original human-written skills), aip-from-curated (human skills compiled into AIP format, i.e., schema-validated execution graph representations), and aip-from-instruction (AIP skills written solely from task instructions without human skill involvement). Each task × mode combination underwent 5 independent trials, resulting in a total of 45 runs. The solving agent used is claude-agent-acp, with the underlying model being claude-sonnet-4-6. AIP scripts are developed based on AIP Specification v0.3a2, and the generation process was completed using the claude-opus model. The sandbox environment utilized is Docker. This dataset is extended from the SkillsBench benchmark, and the included tasks cover crystallographic Wyckoff position analysis, drone planning and control, and seismic plate calculation. The dataset's structure includes campaign.json (run matrix), status.json (run statistics), summary.csv (one row per trial), as well as the cells/ and logs/ directories, which respectively store the working directory and solution logs for each trial. The summary.csv file contains columns including task, model, mode, trial, status, reward, number of tool calls, runtime, and errors.

提供机构:
neo4j
搜集汇总
数据集介绍
neo4j/aip-skillbench-3med-sonnet-aipv0_3a2 数据集图片
构建方式
本数据集源自SkillsBench基准测试,旨在系统评估不同技能表示格式对代理任务执行效能的差异。数据集构建过程选取了3个中等难度的任务(涉及晶体学Wyckoff位置分析、无人机规划控制与地震板块计算),针对每个任务设计了三种技能格式:人类专家撰写的自然语言技能(human-curated)、由该技能编译为AIP执行图表示(aip-from-curated)、以及仅凭任务指令由Claude-Opus模型依据AIP v0.3a2规范自动生成的技能(aip-from-instruction)。每种技能格式在每个任务上独立执行5次试验,共计45次运行,求解代理为claude-agent-acp,底层模型采用claude-sonnet-4-6,所有实验在Docker沙箱环境中完成。
使用方法
用户可通过HuggingFace数据集库直接加载摘要数据,推荐使用Pandas读取summary.csv文件进行分析。如需复现完整实验或获取具体技能文件,可克隆GitHub仓库并切换至对应标签(sonnet-aipv0.3a2),其中详细包含了实验配置、AIP编译技能及人类原始技能文件。对于深度分析,可访问cells目录下的逐次试验工作目录,获取奖励变化、执行轨迹等细粒度信息。数据加载示例代码已集成于官方README中,便于快速上手。
背景与挑战
背景概述
该数据集诞生于2025年上半年,由Zach Blumenfeld及其团队在AIP-SkillBench项目框架下创建,旨在系统评估大型语言模型(LLM)在自动化技能编排与执行中的表现。其核心研究问题聚焦于:当任务从人类编写的自然语言技能描述,转换为结构化、模式验证的执行图表示(AIP格式)后,对智能体(agent)任务完成效率与可靠性的影响。通过在3项中等难度的基准任务(如晶体学Wyckoff位置分析、无人机规划控制、地震板块计算)上进行对比实验,该数据集首次量化了人类策展技能、从人类技能编译的AIP技能、以及仅从任务指令生成的AIP技能三种模式下,LLM求解器的性能差异。这项工作为理解知识表示形式对智能体行为的影响提供了关键实证,推动了技能工程与自动化评估领域的发展。
当前挑战
当前数据集面临的核心挑战包括:其一,所解决的领域问题——LLM智能体在复杂任务执行中,常因技能描述的模糊性或结构化不足导致失败,尤其当任务涉及多步推理和工具调用时,传统自然语言描述难以保证执行的鲁棒性与可复现性。数据集通过引入模式验证的AIP技能格式,旨在应对这一难题,但AIP技能的自动生成质量受限于底层模型(如Claude Opus)的推理能力与AIP规范(v0.3a2)的成熟度。其二,构建过程中的挑战——仅基于任务指令生成AIP技能时,由于缺乏人类专家的领域知识注入,生成的技能图可能遗漏关键分支或错误表征因果依赖,这在3项中等难度任务中已有体现;同时,实验规模(45次运行)虽能揭示初步趋势,但任务种类和重复次数仍有限,难以全面泛化至更广泛的智能体评估场景。此外,不同模式间的公平比较受限于AIP技能与人类技能的语义等价性难以严格保证,为解读实验结果增加了复杂性。
常用场景
经典使用场景
在智能体与大型语言模型的交叉研究领域,AIP-SkillBench数据集为评估结构化技能表示对任务执行效能的影响提供了基准测试平台。该数据集聚焦于中等难度的三类典型任务——晶体学Wyckoff位置分析、无人机规划控制与地震板块计算,通过对比人类编写的自由文本技能、基于人工技能编译的可执行图表示(AIP)以及完全从任务指令自动生成的AIP技能这三种模式在同一任务上的表现,系统性地衡量技能表示形式对智能体任务成功率的贡献。每类任务与每种技能模式的组合均执行5个独立试验,共计45次运行,确保了评估结果的统计学稳健性。
解决学术问题
该数据集直面智能体领域的一个核心学术难题:如何将人类专家的隐性知识转化为机器可精确执行的显式表示。传统自由文本技能虽富含语义信息,却缺乏结构化的执行逻辑,导致智能体在任务理解与步骤执行之间产生语义鸿沟。AIP-SkillBench通过引入AIP(执行图)这一模式化表示,将自然语言技能编译为机器可解析的有向无环图,从根本上解决了技能表示的二义性问题。该数据集为验证结构化表示相较于非结构化表示在任务成功率、工具调用次数及执行时间等指标上的优势提供了实证基础,其意义在于推动了智能体技能表示从“可读”向“可执行”的范式转型。
实际应用
在实际应用层面,该数据集的成果可直接服务于自动化科学计算与智能机器人控制领域。在材料科学中,晶体学Wyckoff位置分析任务的能力迁移可支撑高通量结构鉴定平台,使得非专家用户通过自然语言描述即可驱动智能体完成复杂的对称性解析。无人机规划控制任务则直接对应用于工业巡检、农业植保等场景,其中结构化技能表示能够确保飞行路径在动态环境中的可验证性与安全性。地震板块计算任务的应用则延伸至地质灾害预警系统,通过将专家经验编码为AIP技能,降低灾害分析中的人为失误风险。
数据集最近研究
最新研究方向
该数据集聚焦于评测大型语言模型(LLM)在工程化任务中的技能执行能力,特别关注结构化技能表示(AIP)相较于传统自然语言技能的效能差异。研究前沿正从简单任务问答转向复杂、多步骤的智能体工作流评估,通过引入AIP(Agent Interaction Protocol)这一结构化执行图表示,探索如何提升LLM在真实工业场景(如晶体学分析、无人机路径规划、地震计算)中的稳健性与可复现性。这一方向与当前AI智能体系统追求模块化、可组合与可审计的热点趋势紧密相连,其意义在于为构建自主、可靠且能解释的AI代理提供基准与范式,推动LLM从语言模型向可部署的‘数字工人’进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务