遇见数据集

AGC-Bench

收藏
arXiv2026-07-02 更新2026-07-03 收录
数据链接:
官方服务:

资源简介:

AGC-Bench是由宾夕法尼亚州立大学等多家机构联合构建的人工通用创造力元基准数据集,旨在系统评估大语言模型在跨领域创造性任务中的表现。该数据集包含78个精选子集,涵盖头脑风暴、问题解决、STEM、叙事、比喻语言和幽默等六大文本领域,并包含多模态视觉与设计任务,数据源自对3,101篇文献的系统性综述与筛选。其创建过程遵循PRISMA标准,通过自动化预筛选与人工双重审核确保数据质量,并采用HELM兼容的标准化评估框架进行整合。该数据集主要应用于人工智能创造力研究,旨在探究大语言模型的创造性能力是否具有领域普适性,为解决人工通用创造力这一核心问题提供规模化评估基础设施。

AGC-Bench is a meta-benchmark dataset for artificial general creativity, jointly constructed by The Pennsylvania State University and multiple other institutions. It aims to systematically evaluate the performance of large language models (LLMs) on cross-domain creative tasks. This dataset includes 78 curated subsets covering six textual domains: brainstorming, problem-solving, STEM, narrative, figurative language, and humor, as well as multimodal visual and design tasks. The data is derived from a systematic review and screening of 3,101 academic papers. Its development follows the PRISMA guidelines, ensuring data quality through automated pre-screening and dual manual review, and integrates a standardized evaluation framework compatible with HELM. This dataset is primarily utilized in artificial intelligence creativity research, aiming to investigate whether the creative capabilities of LLMs exhibit domain generality, thus providing a scalable evaluation infrastructure for addressing the core issue of artificial general creativity.

创建时间:
2026-07-02
搜集汇总
数据集介绍
AGC-Bench 数据集图片
构建方式
在人工智能创造力评估领域,现有基准测试呈碎片化分布,各自聚焦于某一狭窄维度并采用独立的评分协议。AGC-Bench通过系统性的元基准构建策略突破了这一局限。研究团队遵循PRISMA系统综述框架,对3101篇候选论文进行筛选与去重,最终获得497个独立基准测试。在此基础上,采用基于智能体的自动化接入管线(benchmark-onboarder),将78个数据集(67个文本纯文本、11个多模态)转化为符合HELM框架的可执行场景。每个场景均忠实保留原始论文的提示词模板与评估指标,通过规划缺失的2-3裁判设计与评委反应理论(JRT)对裁判严厉度进行心理测量学校准,从而构建了一个覆盖头脑风暴、问题求解、STEM、叙事创作、比喻语言与幽默六大维度的综合创造力评估平台。
使用方法
AGC-Bench的使用遵循标准化评估流程,为研究人员提供了灵活而严谨的评估入口。使用者可通过HELM兼容的接入管线运行78个已接入的数据集场景,每个场景均配有原始论文中定义的权威评分指标。对于涉及LLM作为裁判的24个基准测试,系统内置了基于评委反应理论的三方校准裁判面板,有效纠正个人裁判的严厉度偏差。研究团队同时发布了48,299条JRT校正评分训练的AGC-Judge模型权重,用户可采用该轻量级模型对新生成的模型输出进行低成本、高精度的创造力评分,从而便捷地参与公开排行榜的竞争与对比。整个评估管线支持逐步扩展,未来可借助PRISMA策展的完整基准目录(共497个)持续丰富评估涵盖范围。
背景与挑战
背景概述
人工智能创造力评测领域长期面临碎片化困境,数百个异构基准各自为政,评分协议互不兼容,致使学界无法系统探究大语言模型的创造力是否具备跨领域泛化能力。为回应这一核心问题,由宾夕法尼亚州立大学、马萨诸塞大学洛厄尔分校、阿姆斯特丹大学、亚马逊AGI及达特茅斯学院等机构的研究人员于2026年联合发布了AGC-Bench——一项基于PRISMA系统文献综述构建的元基准,从3101篇候选论文中筛选出497个独特基准,并最终整合了78个数据集(含67个文本型与11个多模态型),覆盖头脑风暴、问题解决、STEM、叙事创作、比喻语言与幽默六大领域。该基准通过引入法官响应理论(JRT)校准LLM评分偏差,并训练了开源评分模型AGC-Judge,开创性地运用因素分析揭示了类似人类‘g’因子的通用创造力因子‘c’,为大语言模型创造力的心理学测量提供了规模化基础设施。
当前挑战
AGC-Bench所应对的首要挑战在于创造力本质的长期争议——创造力究竟是通用能力还是领域特异能力,以及它与一般智能是否可分。在评测构建过程中,团队遭遇了多重困境:首先,现有数百个创造力基准在提示格式、评分协议与评估模型阵容上高度异构,无法直接联合分析;其次,LLM作为评估者存在固有的偏倚问题,不同模型在严厉程度与辨别力上差异显著,需借由JRT进行心理测量校准;再者,元基准的构建需在规模化筛查(3101篇论文减少至78个数据集)与保持基准原始评分协议完整性之间取得精妙平衡,同时确保不同形态的基准(公式评分、LLM评分与语义距离评分)能统一纳入分析框架;最后,如何通过因素分析与判别效度检验将创造力因子与流体推理、结晶化知识及模型规模有效分离,亦是该领域亟待解决的方法论挑战。
常用场景
经典使用场景
在人工智能创造力评估的前沿领域,AGC-Bench作为一项元基准测试,其最经典的运用在于系统性地衡量大语言模型在多个创意维度的综合表现。该基准将来自系统文献综述的78个数据集(涵盖67个文本与11个多模态数据集)整合至标准化评估框架中,跨越头脑风暴、问题解决、STEM、叙事创作、修辞语言与幽默六大领域。通过JRT校准的多裁判评分机制,研究者能够精准捕获模型在创意写作、科学假设生成、隐喻构建等任务上的细腻表现差异,从而为“人工通用创造力”的存在性提供量化实证基础。
解决学术问题
AGC-Bench的核心学术贡献在于解决了长期困扰创造力评估领域的碎片化问题——过往数百个异构基准因评分协议各异而无法横向对比。通过因子分析,该基准首次在大语言模型中揭示出一个类似人类智能“g因子”的通用创造力因子“C”,该因子可解释六个文本域中81.5%的方差变异,且与通用知识和推理能力存在显著区分。这一发现为理解人工智能系统中的创造力是否具有跨领域迁移性提供了坚实的心理测量学证据,填补了以往单一基准无法回答“模型在某一创意领域的优势是否预示其在其他领域同样出色”这一关键问题的空白。
实际应用
在实际应用层面,AGC-Bench展现出广阔的前景。它能够为创意内容生成系统提供标准化评测工具,例如对自动生成广告文案、故事剧本或产品标签的模型进行客观打分;在教育科技领域,可辅助评估AI辅助创意写作工具的教学效果;在工业界,该基准可用于多模型选型决策,帮助开发者根据具体应用场景(如幽默生成或科学创意孵化)选择最适配的模型。同时,所发布的AGC-Judge评分模型能以极低计算成本复现前沿裁判的评估结果,为实际部署提供了高效可靠的解决方案。
数据集最近研究
最新研究方向
AGC-Bench作为首个系统性元基准测试,聚焦于人工智能通用创造力(Artificial General Creativity)的量化评估,开创性地将心理测量学方法引入大语言模型创造力研究。该基准通过PRISMA系统综述整合497个创造力基准,最终标准化78个数据集,覆盖头脑风暴、问题解决、STEM、叙事创作、比喻语言和幽默六大领域,构成广度空前的评估体系。其核心发现在于,通过因子分析揭示了模仿人类'g因子'的单一创造力因子'C',解释了83个前沿模型中81.5%的创造力变异,且该因子与通用知识及推理能力既有显著关联又保持独立。此外,AGC-Bench采用Judge Response Theory校准LLM评分者的严厉偏差,并训练出开源评分模型AGC-Judge,大幅降低了前沿模型的使用成本。该工作不仅验证了LLM创造力具有跨领域泛化的特征,还通过'创造性提示'与'推理启停'的对比实验,有力证实了该基准对创造力特质的敏感捕捉能力,为AI创造力研究提供了坚实的测量基础设施,回应了学界关于创造力究竟是通用能力还是领域特定能力的长期辩论。
相关研究论文
  • 1
    AGC-Bench: Measuring Artificial General Creativity宾夕法尼亚州立大学; 麻省大学洛厄尔分校; 阿姆斯特丹大学; 亚马逊AGI; 达特茅斯学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务