OpenSkillEval
收藏资源简介:
OpenSkillEval是一个用于自动审计LLM代理开放技能生态系统的数据集,包含五个高实用性任务家族:数据可视化、海报生成、PPT生成、报告生成和网页设计,共677个案例,覆盖商业、科学、健康、工程和创意领域。它通过固定任务并变化技能来评估社区贡献的技能包对代理输出质量和成本的影响,并记录提示、完成、缓存令牌和实际时间等成本指标。
OpenSkillEval is a dataset for automatically auditing the open skill ecosystem of LLM Agents. It includes five high-practicality task families: data visualization, poster generation, PPT generation, report generation, and web design, with a total of 677 cases covering business, science, health, engineering, and creative domains. It evaluates the impact of community-contributed skill packs on agent output quality and costs by fixing tasks while varying skills, and records cost-related metrics such as prompts, completions, cached tokens, and actual time.
OpenSkillEval 数据集概述
数据集定位与目标
OpenSkillEval 是一个用于自动审计 LLM 智能体开放技能生态的基准测试。其核心思路是在固定任务的情况下变化技能(skill),从而隔离评估社区贡献的技能包对智能体输出质量和成本的真实影响。
任务族
数据集涵盖 5 个高实用性任务族,共 677 个案例,覆盖商业、科学、健康、工程和创意领域:
| 任务族 | 案例数 | 产出格式 | 描述 |
|---|---|---|---|
| 数据可视化 | 150 | png | 多轨道时间线、对比图表、结构化数据的分析可视化 |
| 海报生成 | 119 | png | 基于结构化简报的数据驱动单页海报 |
| PPT 生成 | 82 | pptx | 指定页数的幻灯片,附带图片/PDF等素材 |
| 报告生成 | 195 | html | 基于真实 CSV 数据的分析报告 |
| 网页设计 | 131 | html | 带导航、交互、响应式/暗色模式的多页面网站 |
排行榜核心发现
- Claude Opus 4.6 以总分 4.51 排名第一,表现最均衡,各维度不低于 4.23。
- GPT-5.5 总分 4.47 排名第二,在 Web、PPT、Report 三个族中单项最高,但成本更高。
- Claude Sonnet 4.6(4.43 分,11.9× 成本)是中端性价比选择。
- DeepSeek V4 Pro(1.8× 成本,4.30 分)是开源模型中的性价比冠军。
- MiniMax M2.7 成本最低(1.0×),总分仍超过 4.0,是预算首选。
技能生态分析
- PPT 是技能增益最大的族:最佳技能
ppt-master提升 0.20 分,最差技能仅损失 0.10 分。 - 海报 技能选择影响最大:最佳与最差技能之间差距达 0.41 分。
- 数据可视化 是唯一没有任何技能超越基线的族,最佳技能仅与基线持平。
- 网页设计 基线已高达 4.67,技能提升空间极小。
数据规模与许可
- 677 个基准案例,托管于 Hugging Face(jhying/OpenSkillEval),按 5 个配置分族提供。
- 代码采用 Apache-2.0 许可。
- 基准案例采用 CC-BY-NC-4.0 许可。
引用信息
bibtex @article{ying2026openskilleval, title = {Automatically Auditing the Open Skill Ecosystem for LLM Agents}, author = {Ying, Jiahao and Ai, Boxian and Tang, Wei and Liu, Siyuan and Cao, Yixin}, journal= {arXiv preprint arXiv:2605.23657}, year = {2026}, url = {https://arxiv.org/abs/2605.23657} }





