遇见数据集

Hues and Cues 颜色关联数据集

收藏
arXiv2026-08-07 更新2026-08-11 收录
官方服务:

资源简介:

本数据集基于桌游Hues and Cues构建,由瓦伦西亚大学图像处理实验室创建,旨在评估人类与对比视觉语言模型(CVLM)在颜色感知上的对齐程度。数据集包含来自316名正常色觉观察者的颜色关联响应,覆盖100个单词(分属动物、食物、矿物、植物、环境、主观及流行文化七类),每个单词映射至480种离散棋盘颜色坐标。通过游戏化数字界面收集,经严格筛选排除色觉缺陷者,最终获得稳健的人类一致性基线。该数据集可揭示模型在抽象概念上的颜色坍塌现象,推动视觉语言模型在细粒度感知与语义对齐方面的改进。

This dataset is developed based on the board game *Hues and Cues*, and was constructed by the Image Processing Laboratory of the University of Valencia. Its core objective is to evaluate the degree of alignment between human observers and contrastive vision-language models (CVLMs) in color perception. The dataset includes color association responses collected from 316 normal color vision participants, covering 100 words categorized into seven categories: animals, food, minerals, plants, environments, subjective concepts, and pop culture. Each word is mapped to 480 discrete board game color coordinates. The data was gathered through a gamified digital interface, with strict screening procedures implemented to exclude individuals with color vision deficiencies, ultimately resulting in a robust human consistency baseline. This dataset can uncover the color collapse phenomenon of models towards abstract concepts, and facilitate advancements in fine-grained perception and semantic alignment for vision-language models.

创建时间:
2026-08-07
原始信息汇总

Hues and Cues: 模型与人类颜色-词语关联对比数据集

数据集概述

本数据集旨在分析人工智能视觉-语言模型(如CLIP)在颜色与词语关联方面是否与人类认知一致,以棋盘游戏Hues and Cues为实验框架。

核心数据内容

1. 人类回答数据(HC.csv)

  • 收集了玩家在猜测颜色棋盘时的人类回答坐标数据
  • 涵盖100个西班牙语/英语词语线索(如SALMÓN、LIMÓN、KIWI等)

2. 模型预测数据

  • Results/:包含100个真实Hues & Cues词语的模型预测结果
  • Results_Random/:对162个开放CLIP模型使用16个随机/无意义词语(如GLIMBOR、ZIZAX等)进行测试的预测坐标输出和相似度距离

数据分析方法

随机词语结果可视化

  • 随机词语密度图(random_words_density.png):4x4棋盘网格,叠加162个模型Top-1预测的2D核密度估计(KDE)概率密度等高线图,红色框标记峰值坐标
  • 散点图(random_words_scatter.png):展示所有模型Top-1预测的抖动散点
  • 热力图(random_words_heatmap.png):基于模型预测频率归一化的单元格淡化显示
  • 马赛克图(mosaico_option1.png / mosaico_option2.png):Top-1预测颜色块的可视化图例与网格展示

RGB矩阵提取与K-Means聚类分析(Colapso目录)

  • 提取每个模型的4x4 RGB预测网格矩阵
  • 使用K-Means算法(K=4)对48维颜色特征进行聚类分群
  • 输出聚类结果CSV、平均颜色轮廓对比图和PCA散点图

系统性崩塌分组

  • 根据精确坐标频率将模型预测矩阵分类为四种预定义崩塌类型:
    • A组(中性崩塌):neutral collapse
    • B组(高熵):high entropy
    • C组(特定颜色崩塌):specific color collapse

无监督聚类分析

  • 提取颜色/坐标离散度和熵特征,使用K-Means(K=4和K=3)进行聚类
  • 聚类结果包括:
    • 聚类0:弱崩塌(Weak Collapse)
    • 聚类1:严重崩塌(Severe Collapse)
    • 聚类2:纯高熵(Pure High Entropy)
    • 聚类3:中度崩塌(Moderate Collapse)
  • 高级特征聚类实验进一步纳入饱和度、亮度、凸包体积等颜色特征

核心分析脚本流程

数据预处理与基线计算

  • color_tessellation_survey_processing.ipynb:处理原始棋盘镶嵌调查数据,将每个单元格映射到主要颜色名称
  • human_consistency_baseline.ipynb:执行留一法交叉验证,建立人类共识基线

模型评估与统计

  • calculate_mahalanobis_distances.py:计算模型Top-1预测与人类共识的马氏距离,识别异常值
  • calculate_hotelling_t2.py:执行Hotelling双样本T²检验,比较模型Top-5预测云质心与人类回答质心
  • summarize_mahalanobis_failure_rates.ipynb:对162个模型排序并计算最终异常值比率
  • calculate_hotelling_failure_rates.ipynb:聚合Hotelling T²检验p值以计算模型失败率

可视化与图表生成

  • generate_manuscript_violin_plots.ipynb:生成最终复合小提琴分布图(全局和类别分解)
  • generate_global_mosaic_single_image.py:生成162个模型对16个无意义提示的13x13巨大马赛克网格
  • generate_random_mosaics.py:生成KDE概率密度等高线网格布局
  • generate_all_family_mosaics.py等:按架构家族生成分组马赛克图

论文插图资源(Images目录)

包含LaTeX手稿引用的14个图表:

  • 棋盘架构示意图(Fig2.png)
  • 数据采集网页界面截图(HC_WebDatos.png)
  • 校准sRGB可视化(zafiro2.png)
  • 色盲一致性比较图(cambios_consistencia_daltonicos.png)
  • 词语出现频率分解图(ocurrencias_por_palabra_categorias.png)
  • Voronoi颜色分类网格(Tesselation.png)
  • 全局模型性能复合小提琴图(GlobalPerformance.png)
  • 按架构家族和预训练数据集分类的小提琴图(ViolingCategoriaModelo.png、ViolinCategoriaDataset.png)
  • 崩塌类型解释图(DiagramaColapso2.png)
  • 162个模型完整预测网格(global_mosaic_single_image.png)
搜集汇总
数据集介绍
Hues and Cues 颜色关联数据集 数据集图片
构建方式
该数据集基于棋盘游戏《Hues and Cues》构建,通过将游戏板上的480种离散颜色映射至CIE xy色度图,建立了一个精细的语义颜色关联空间。研究团队开发了跨平台数字界面,招募了325名人类参与者,通过强制选择范式收集颜色关联数据,每位参与者随机分配15个词,最终覆盖了包含动物、食物、矿物、植物、环境、主观和流行文化等七类语义范畴的100个词汇。数据采集过程注重生态效度,并通过自我报告筛选色觉缺陷者,最终保留了316名正常三色觉者的数据,形成了高密度的人类颜色关联基线。
特点
该数据集的核心特点在于其将游戏化离散色域与标准色度学空间相结合,提供了高精度的语义颜色关联基准。其独特之处在于建立了人类一致性基线,通过留一法交叉验证计算人类误差下限,为模型评估提供了参照。数据集还捕捉了文化锚定效应,如西班牙语者对拖拉机的黄色关联,同时揭示了对比视觉语言模型在抽象概念上的系统性蓝色崩溃现象。此外,数据集包含对162个模型的多维度评估,覆盖不同架构和预训练数据来源,并提供了从具体物理指涉到抽象主观概念的语义梯度分析。
使用方法
该数据集可用于评估对比视觉语言模型在语义颜色关联方面与人类感知的对齐程度。使用时,研究者可依据论文中的评估协议,将模型对每个词预测的颜色坐标映射至CIE xy空间,并采用马氏距离和霍特林T²检验分别评估点预测和分布预测的拟合度。数据集提供了人类基线、模型预测结果和评估代码,便于计算人类一致性分数、识别模型的不确定性崩溃行为,并复现论文中的全局性能分析和语义类别分析。研究者还可扩展评估其他新模型或指标,以探索更广泛的感知对齐问题。
背景与挑战
背景概述
Hues and Cues 颜色关联数据集由西班牙瓦伦西亚大学图像处理实验室的研究团队于2026年创建,旨在评估对比视觉-语言模型(CVLMs)与人类在细粒度颜色感知上的对齐程度。该数据集创新性地利用桌游《Hues and Cues》的标准化颜色棋盘,将480个离散色块映射至CIE xy色度图,并采集了325名人类参与者的颜色关联数据,构建了涵盖七个语义类别的100词评估词汇表。其核心研究问题在于揭示CVLMs在抽象、主观及流行文化领域中的颜色关联偏差,特别是系统性“蓝色崩溃”现象。该数据集通过游戏化范式为AI感知评估提供了新途径,对理解模型认知缺陷及推动人机对齐研究具有重要影响力。
当前挑战
该数据集面临的挑战主要涉及两个层面。在领域问题层面,传统视觉-语言模型虽能模仿人类对具体物体(如食物、植物)的典型记忆色,但在处理抽象概念(如“希望”、“愤怒”)时,常出现语义误分类或不确定性崩溃,即系统性地回归至默认蓝色区域,难以捕捉人类文化共识的细微差异。构建过程中,研究团队需克服跨设备颜色显示不一致的难题,尽管通过色适应理论验证了数据稳健性,但远程众包采集仍受限于参与者多样性和色彩视觉缺陷筛查的可靠性,且需设计“无意义基线”以区分模型的语义理解与统计巧合,确保评估的严谨性。
常用场景
经典使用场景
Hues and Cues颜色关联数据集的核心应用场景在于构建一个基于游戏化的细粒度语义颜色对齐评估框架。该数据集将棋盘游戏的480种离散颜色映射至CIE xy色度图,通过收集325名人类观察者的颜色关联数据,为对比视觉语言模型(CVLM)提供了标准化的基准测试平台。研究者可利用此数据集系统评估模型在具体物体(如食物、植物)及抽象概念(如情绪、流行文化)上的颜色认知能力,深入探索模型与人类感知之间的细微差异。
衍生相关工作
该数据集衍生了一系列围绕CVLM感知对齐与评估方法学的经典工作。例如,基于此数据集开发了结合马氏距离与Hotelling T²检验的统计评估框架,用于定量分析模型的离群预测与分布对齐性。同时,'无意义基线'协议被引入以判别模型的内在颜色偏好,揭示了特定架构或训练数据导致的系统性色彩坍缩。这些工作推动了感知评估从单一准确性向多维、人类中心化方向演进。
数据集最近研究
最新研究方向
Hues and Cues 颜色关联数据集的前沿研究聚焦于通过游戏化范式评估对比视觉-语言模型(CVLM)与人类在颜色感知上的对齐程度。该研究不仅揭示了模型在具体物理实体上能够复现人类的记忆色,还发现了其在抽象、主观及流行文化领域中的系统性失效模式,如语义误分类和向默认蓝色坐标的‘不确定性坍缩’。这一发现凸显了训练数据质量相较于规模的重要性,并强调了游戏化任务在暴露模型潜在认知缺陷方面的独特价值,为构建更符合人类感知的下一代人工智能系统提供了新的评估维度与优化方向。
相关研究论文
  • 1
    Human-AI Perceptual Alignment by Playing Hues and Cues瓦伦西亚大学·图像处理实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务