Hues and Cues 颜色关联数据集
收藏资源简介:
本数据集基于桌游Hues and Cues构建,由瓦伦西亚大学图像处理实验室创建,旨在评估人类与对比视觉语言模型(CVLM)在颜色感知上的对齐程度。数据集包含来自316名正常色觉观察者的颜色关联响应,覆盖100个单词(分属动物、食物、矿物、植物、环境、主观及流行文化七类),每个单词映射至480种离散棋盘颜色坐标。通过游戏化数字界面收集,经严格筛选排除色觉缺陷者,最终获得稳健的人类一致性基线。该数据集可揭示模型在抽象概念上的颜色坍塌现象,推动视觉语言模型在细粒度感知与语义对齐方面的改进。
This dataset is developed based on the board game *Hues and Cues*, and was constructed by the Image Processing Laboratory of the University of Valencia. Its core objective is to evaluate the degree of alignment between human observers and contrastive vision-language models (CVLMs) in color perception. The dataset includes color association responses collected from 316 normal color vision participants, covering 100 words categorized into seven categories: animals, food, minerals, plants, environments, subjective concepts, and pop culture. Each word is mapped to 480 discrete board game color coordinates. The data was gathered through a gamified digital interface, with strict screening procedures implemented to exclude individuals with color vision deficiencies, ultimately resulting in a robust human consistency baseline. This dataset can uncover the color collapse phenomenon of models towards abstract concepts, and facilitate advancements in fine-grained perception and semantic alignment for vision-language models.
Hues and Cues: 模型与人类颜色-词语关联对比数据集
数据集概述
本数据集旨在分析人工智能视觉-语言模型(如CLIP)在颜色与词语关联方面是否与人类认知一致,以棋盘游戏Hues and Cues为实验框架。
核心数据内容
1. 人类回答数据(HC.csv)
- 收集了玩家在猜测颜色棋盘时的人类回答坐标数据
- 涵盖100个西班牙语/英语词语线索(如
SALMÓN、LIMÓN、KIWI等)
2. 模型预测数据
- Results/:包含100个真实Hues & Cues词语的模型预测结果
- Results_Random/:对162个开放CLIP模型使用16个随机/无意义词语(如
GLIMBOR、ZIZAX等)进行测试的预测坐标输出和相似度距离
数据分析方法
随机词语结果可视化
- 随机词语密度图(random_words_density.png):4x4棋盘网格,叠加162个模型Top-1预测的2D核密度估计(KDE)概率密度等高线图,红色框标记峰值坐标
- 散点图(random_words_scatter.png):展示所有模型Top-1预测的抖动散点
- 热力图(random_words_heatmap.png):基于模型预测频率归一化的单元格淡化显示
- 马赛克图(mosaico_option1.png / mosaico_option2.png):Top-1预测颜色块的可视化图例与网格展示
RGB矩阵提取与K-Means聚类分析(Colapso目录)
- 提取每个模型的4x4 RGB预测网格矩阵
- 使用K-Means算法(K=4)对48维颜色特征进行聚类分群
- 输出聚类结果CSV、平均颜色轮廓对比图和PCA散点图
系统性崩塌分组
- 根据精确坐标频率将模型预测矩阵分类为四种预定义崩塌类型:
- A组(中性崩塌):neutral collapse
- B组(高熵):high entropy
- C组(特定颜色崩塌):specific color collapse
无监督聚类分析
- 提取颜色/坐标离散度和熵特征,使用K-Means(K=4和K=3)进行聚类
- 聚类结果包括:
- 聚类0:弱崩塌(Weak Collapse)
- 聚类1:严重崩塌(Severe Collapse)
- 聚类2:纯高熵(Pure High Entropy)
- 聚类3:中度崩塌(Moderate Collapse)
- 高级特征聚类实验进一步纳入饱和度、亮度、凸包体积等颜色特征
核心分析脚本流程
数据预处理与基线计算
- color_tessellation_survey_processing.ipynb:处理原始棋盘镶嵌调查数据,将每个单元格映射到主要颜色名称
- human_consistency_baseline.ipynb:执行留一法交叉验证,建立人类共识基线
模型评估与统计
- calculate_mahalanobis_distances.py:计算模型Top-1预测与人类共识的马氏距离,识别异常值
- calculate_hotelling_t2.py:执行Hotelling双样本T²检验,比较模型Top-5预测云质心与人类回答质心
- summarize_mahalanobis_failure_rates.ipynb:对162个模型排序并计算最终异常值比率
- calculate_hotelling_failure_rates.ipynb:聚合Hotelling T²检验p值以计算模型失败率
可视化与图表生成
- generate_manuscript_violin_plots.ipynb:生成最终复合小提琴分布图(全局和类别分解)
- generate_global_mosaic_single_image.py:生成162个模型对16个无意义提示的13x13巨大马赛克网格
- generate_random_mosaics.py:生成KDE概率密度等高线网格布局
- generate_all_family_mosaics.py等:按架构家族生成分组马赛克图
论文插图资源(Images目录)
包含LaTeX手稿引用的14个图表:
- 棋盘架构示意图(Fig2.png)
- 数据采集网页界面截图(HC_WebDatos.png)
- 校准sRGB可视化(zafiro2.png)
- 色盲一致性比较图(cambios_consistencia_daltonicos.png)
- 词语出现频率分解图(ocurrencias_por_palabra_categorias.png)
- Voronoi颜色分类网格(Tesselation.png)
- 全局模型性能复合小提琴图(GlobalPerformance.png)
- 按架构家族和预训练数据集分类的小提琴图(ViolingCategoriaModelo.png、ViolinCategoriaDataset.png)
- 崩塌类型解释图(DiagramaColapso2.png)
- 162个模型完整预测网格(global_mosaic_single_image.png)

- 1Human-AI Perceptual Alignment by Playing Hues and Cues瓦伦西亚大学·图像处理实验室 · 2026年




