遇见数据集

OpenSkillEval

收藏
github2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

OpenSkillEval是一个用于自动审计LLM代理开放技能生态系统的数据集,包含五个高实用性任务家族:数据可视化、海报生成、PPT生成、报告生成和网页设计,共677个案例,覆盖商业、科学、健康、工程和创意领域。它通过固定任务并变化技能来评估社区贡献的技能包对代理输出质量和成本的影响,并记录提示、完成、缓存令牌和实际时间等成本指标。

OpenSkillEval is a dataset for automatically auditing the open skill ecosystem of LLM Agents. It includes five high-practicality task families: data visualization, poster generation, PPT generation, report generation, and web design, with a total of 677 cases covering business, science, health, engineering, and creative domains. It evaluates the impact of community-contributed skill packs on agent output quality and costs by fixing tasks while varying skills, and records cost-related metrics such as prompts, completions, cached tokens, and actual time.

创建时间:
2026-05-29
原始信息汇总

OpenSkillEval 数据集概述

数据集定位与目标

OpenSkillEval 是一个用于自动审计 LLM 智能体开放技能生态的基准测试。其核心思路是在固定任务的情况下变化技能(skill),从而隔离评估社区贡献的技能包对智能体输出质量和成本的真实影响。

任务族

数据集涵盖 5 个高实用性任务族,共 677 个案例,覆盖商业、科学、健康、工程和创意领域:

任务族 案例数 产出格式 描述
数据可视化 150 png 多轨道时间线、对比图表、结构化数据的分析可视化
海报生成 119 png 基于结构化简报的数据驱动单页海报
PPT 生成 82 pptx 指定页数的幻灯片,附带图片/PDF等素材
报告生成 195 html 基于真实 CSV 数据的分析报告
网页设计 131 html 带导航、交互、响应式/暗色模式的多页面网站

排行榜核心发现

  • Claude Opus 4.6 以总分 4.51 排名第一,表现最均衡,各维度不低于 4.23。
  • GPT-5.5 总分 4.47 排名第二,在 Web、PPT、Report 三个族中单项最高,但成本更高。
  • Claude Sonnet 4.6(4.43 分,11.9× 成本)是中端性价比选择。
  • DeepSeek V4 Pro(1.8× 成本,4.30 分)是开源模型中的性价比冠军。
  • MiniMax M2.7 成本最低(1.0×),总分仍超过 4.0,是预算首选。

技能生态分析

  • PPT 是技能增益最大的族:最佳技能 ppt-master 提升 0.20 分,最差技能仅损失 0.10 分。
  • 海报 技能选择影响最大:最佳与最差技能之间差距达 0.41 分。
  • 数据可视化 是唯一没有任何技能超越基线的族,最佳技能仅与基线持平。
  • 网页设计 基线已高达 4.67,技能提升空间极小。

数据规模与许可

  • 677 个基准案例,托管于 Hugging Face(jhying/OpenSkillEval),按 5 个配置分族提供。
  • 代码采用 Apache-2.0 许可。
  • 基准案例采用 CC-BY-NC-4.0 许可。

引用信息

bibtex @article{ying2026openskilleval, title = {Automatically Auditing the Open Skill Ecosystem for LLM Agents}, author = {Ying, Jiahao and Ai, Boxian and Tang, Wei and Liu, Siyuan and Cao, Yixin}, journal= {arXiv preprint arXiv:2605.23657}, year = {2026}, url = {https://arxiv.org/abs/2605.23657} }

搜集汇总
数据集介绍
OpenSkillEval 数据集图片
构建方式
在大型语言模型(LLM)智能体生态系统中,社区贡献的技能包质量参差不齐,OpenSkillEval应运而生,作为首个系统性审计开源技能包实际效能的标准化基准。该数据集的核心构建策略在于“固定任务、变化技能”——针对数据可视化、海报生成、幻灯片制作、分析报告撰写及网页设计五类高频应用场景,精心设计了677个跨领域测试案例。每个案例均配有结构化说明书、源数据及资产文件,并通过脚本从Hugging Face平台自动下载至本地任务目录。研究团队采用Docker沙箱化技术,将不同模型与技能包组合在隔离环境中运行,严格记录每次执行的令牌消耗与时钟耗时,从而在统一案例集、统一评判模型、统一基线条件下,实现了技能包效能与成本的精细化对比分析。
使用方法
使用OpenSkillEval需基于Python 3.11与uv环境,并确保Docker及目标智能体CLI已安装。研究者首先克隆代码库并通过uv sync同步依赖,随后运行脚本从Hugging Face下载全量案例至本地。启动评估前,需将智能体凭证填入agent_configs下的snippet模板文件,例如在claude-code.snippet中配置ANTHROPIC_API_KEY。单案例测试可通过run_variants.py脚本指定运行器与案例ID快速执行。评判环节需填写judge.snippet中的模型凭证,并调用各家族专属的评估流水线——数据可视化、报告及网页设计族采用“容器内评估代理+多模态语言模型评委”的两阶段架构,海报族仅需评委阶段,幻灯片族则涉及三机协同流程。所有评分结果与令牌使用记录均结构化存储,支持断点续评与评委模型灵活替换。
背景与挑战
背景概述
随着大语言模型(LLM)智能体的广泛应用,社区贡献的开放技能生态蓬勃发展,然而技能包的实际效用与成本效益却缺乏系统性评估。为此,由Ying Jiahao等研究者于2026年提出的OpenSkillEval数据集,旨在自动审计开放技能生态中社区贡献的技能包对智能体输出质量与成本的真实影响。该数据集覆盖数据可视化、海报生成、幻灯片制作、分析报告撰写及网页设计五类高频任务,包含677个跨商业、科学、健康、工程与创意领域的案例。通过将任务固定而改变技能包的实验范式,OpenSkillEval在统一基线下对比不同技能的表现,为技能作者提供了设计模式与价值回报的量化洞察,对LLM智能体技能生态的健康发展具有重要指导意义。
当前挑战
OpenSkillEval所解决的领域挑战在于,开放技能生态中大量社区贡献的技能包缺乏客观基准,用户难以辨别哪些技能包真正提升智能体输出质量、哪些仅徒增成本。该数据集通过固定任务、变化技能的设计,揭示了最差技能甚至拖累无技能基线的现象,强调了精准技能选择的重要性。构建过程中面临的挑战包括:设计跨五类任务领域的一致评估流程,每个技能包需在相同案例、评判模型与基线下运行,确保对比公平;同时需精细记录每次运行的提示词、补全、缓存令牌消耗及壁钟时间,实现质量与成本的联合核算;此外,评测体系需适配各任务的独特输出格式(如PPT需跨平台光栅化、数据可视化需Docker沙箱),增加了工程实现的复杂性。
常用场景
经典使用场景
在大型语言模型(LLM)代理系统的评估领域,OpenSkillEval 被广泛用于衡量社区贡献的开放式技能包对代理端到端任务表现的实际影响。该数据集核心设计理念是固定任务而变换技能,从而隔离不同技能包带来的质量与成本变化。经典使用方法是将模型代理分别与不同技能包和无技能的基线配置配对,在人机交互中高频出现的数据可视化、海报生成、幻灯片制作、分析报告撰写以及网页设计这五类高实用性任务上进行对比评估,最终通过统一的评分模板和成本核算体系,量化各技能包的实际增益幅度。
解决学术问题
OpenSkillEval 解决了学术研究中长期存在的一个难题:社区贡献的开放技能生态究竟能在多大程度上提升LLM代理的实际工作表现,以及不同技能设计模式(如格式、结构、先验知识丰富度)的效用差异。以往的研究多聚焦于模型本身或任务难度的排行榜,却忽略了技能包这一变量。该数据集通过头对头的基线对比实验,揭示了哪些技能对代理产出具有实质提升、哪些仅增加调用成本,为技能工程提供了科学评估的方法论基础,亦推动了代理系统研究中技能可审计性与可复现性的范式转变。
实际应用
在实际应用层面,OpenSkillEval 为技能作者和企业级LLM部署团队提供了关键决策支持。开发者可以利用该数据集的评测框架,在部署数据可视化报告生成、自动化幻灯片制作或设计多页面网站等具体业务场景之前,快速筛选出性价比最高的技能包与模型组合。例如,文档密集型行业可依据评测结果选用成本仅为高端模型1.8倍但整体质量达4.30分的开源权重模型,从而在保证输出质量的前提下显著降低推理成本。此外,该数据集也为技能市场平台提供了质量审计的工具,使消费端可避开那些拖累性能的劣质技能。
数据集最近研究
最新研究方向
在大语言模型智能体能力评估领域,OpenSkillEval开创性地将评估焦点从模型本身转向了社区贡献的开源技能包生态审计。该数据集通过固定任务基线、系统变更技能配置的实验范式,对数据可视化、报告生成、网页设计等五个高频应用场景中的677个案例进行了质量与成本的联合量化分析。前沿研究揭示了一个重要发现:在PPT生成与海报设计两个领域,顶尖技能包能带来0.16至0.20分的显著提升,而数据可视化任务中所有技能均未超越基线水平,甚至存在技能包拖累性能的反直觉现象。这一发现与当前智能体生态中'技能越多越好'的主流认知形成鲜明对比,为开源智能体技能市场的健康发展提供了关键的审计基准和设计启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务