遇见数据集

ArtWhisperer

收藏
arXiv2023-10-20 更新2024-06-21 收录
官方服务:

资源简介:

ArtWhisperer是一个由斯坦福大学创建的数据集,旨在研究人与AI在艺术创作中的交互。该数据集通过一个在线游戏收集,用户需迭代找到能生成与目标图像相似的AI图像的提示。数据集包含51,026次交互,涉及2,250名用户和191个独特的目标图像。创建过程涉及用户与AI的多次交互,以找到最佳提示。该数据集主要用于研究人与AI的交互行为,评估AI的可操控性,并展示了ArtWhisperer数据集的通用实用性。

ArtWhisperer is a dataset developed by Stanford University to study human-AI interaction in artistic creation. Collected via an online game, it requires users to iteratively find prompts that can generate AI images similar to the target ones. The dataset contains 51,026 interaction records, involving 2,250 users and 191 unique target images. Its creation involves multiple rounds of interactions between users and AI to identify the optimal prompts. This dataset is primarily used to research human-AI interaction behaviors, evaluate the controllability of AI, and demonstrate the general applicability of the ArtWhisperer dataset.

提供机构:
斯坦福大学
创建时间:
2023-06-14
搜集汇总
数据集介绍
ArtWhisperer 数据集图片
构建方式
在生成式人工智能日益普及的背景下,ArtWhisperer数据集应运而生,旨在深入探究人类与文本到图像模型之间的交互模式。该数据集通过一个精心设计的在线游戏收集而成:玩家被赋予一张目标图像,需通过迭代式地撰写并提交文本提示词,引导模型生成与目标高度相似的图像。游戏过程中,系统记录下每一次用户输入的提示词及其对应的生成图像,并辅以基于CLIP嵌入的相似度评分作为反馈。数据收集涵盖了来自维基百科和AI艺术提示库的191张多样化目标图像,最终汇聚了超过51,000次交互,构成了一个独特的、带有明确目标的序列化人机协作数据集。
使用方法
ArtWhisperer数据集为研究人类提示策略、评估模型可引导性以及开发合成提示器提供了坚实的数据基础。研究者可利用该数据集分析用户在不同图像类型下的提示词演变规律,例如通过文本嵌入空间分析提示词的多样性、用户风格的一致性以及迭代更新的模式。基于数据集中的交互轨迹,可以训练大型语言模型来模拟人类提示行为,生成合成提示器,用于自动化评估文本到图像模型的可引导性,或优化模型的对齐性能。数据集还包含了用户对生成图像的主观评分,可用于开发和验证更符合人类偏好的图像相似度度量方法,从而推动生成式AI在人机协同创作中的实际应用。
背景与挑战
背景概述
随着生成式人工智能技术的迅猛发展,文本到图像模型如Stable Diffusion和Midjourney已广泛应用于艺术创作、教育及娱乐等领域。然而,人类用户如何通过迭代提示与这些模型进行有效交互,仍是一个亟待深入探究的问题。为此,斯坦福大学的Kailas Vodrahalli与James Zou于2023年创建了ArtWhisperer数据集,旨在系统性地刻画人机交互过程中的提示策略与模型可操控性。该数据集通过设计在线游戏,记录了超过50,000次用户与AI的交互行为,涵盖191个目标图像,揭示了用户在迭代优化提示时的多样化策略与行为模式。ArtWhisperer的发布为研究人机协作、提示工程及模型评估提供了独特的时序数据资源,在学术界与工业界产生了广泛影响。
当前挑战
ArtWhisperer数据集面临多重挑战。首先,在领域问题层面,现有图像生成模型的可操控性缺乏统一量化标准,用户需通过反复调整提示来逼近目标图像,这一过程对提示的语义精度与模型的理解能力提出了极高要求。其次,在构建过程中,数据集收集需平衡图像多样性(<200个目标图像)与用户交互深度,同时确保评分函数(基于CLIP嵌入)与人类主观评价的一致性(皮尔逊相关系数仅为0.579)。此外,用户提示风格各异且迭代行为呈现马尔可夫性,使得从稀疏交互数据中准确建模模型可操控性成为难点。最后,不同图像类别(如艺术幻想类与自然风景类)在可操控性上存在显著差异,进一步增加了跨类别泛化分析的复杂性。
常用场景
经典使用场景
ArtWhisperer数据集的核心应用在于探究人类与文本到图像生成模型之间的迭代式交互行为。通过设计一个在线游戏,参与者需要针对给定的目标图像不断调整文本提示(prompt),直至生成高度相似的图像。该数据集记录了超过五万次交互,每一轮交互均包含用户提交的提示文本与模型生成的对应图像,尤其适合分析用户在反复尝试中的策略演变与行为模式。
解决学术问题
该数据集解决了当前人机交互研究中缺乏带有明确目标和迭代过程的公开数据集的难题。传统数据集多聚焦于单次交互或缺乏预定义任务,而ArtWhisperer通过控制实验环境,首次提供了大规模、序列化的用户与生成模型协作数据。这使研究者能够量化模型的“可操控性”(steerability),即用户达成目标所需交互次数的期望值,并揭示不同图像类别(如自然风光与奇幻艺术)在操控难度上的显著差异。
实际应用
在实际应用中,ArtWhisperer可助力优化生成式AI的用户体验设计。例如,通过分析用户提示的多样性及迭代模式,开发者可设计更智能的提示建议系统,帮助用户快速找到有效描述。此外,该数据集还可用于训练“合成提示生成器”(synthetic prompter),模拟人类探索策略,从而自动化评估不同文本到图像模型的性能,降低人工标注成本,提升模型对齐效率。
数据集最近研究
最新研究方向
在生成式人工智能蓬勃发展的浪潮中,人机协作的交互机制成为学界关注的焦点。ArtWhisperer数据集通过构建一个迭代式文本到图像生成游戏,首次系统性地记录了超过五万次人类与AI的连续交互过程,为理解用户如何通过提示词(prompt)逐步引导模型生成目标图像提供了独特的时序数据。该研究前沿方向聚焦于量化AI的“可引导性”(steerability),提出基于马尔可夫链的期望交互次数作为评估指标,并发现城市与自然类图像的引导效率显著高于艺术与幻想类图像。这一工作不仅揭示了用户提示词的多样性并不随得分提升而收敛的反直觉现象,还为未来设计更符合人类直觉的交互式生成系统奠定了方法论基础,其影响延伸至自动化提示优化与人机协同创作等热点领域。
相关研究论文
  • 1
    ArtWhisperer: A Dataset for Characterizing Human-AI Interactions in Artistic Creations斯坦福大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务