遇见数据集

CHARM-Bench

收藏
github2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

CHARM-Bench是一个受中文谐音谜题游戏启发的多模态基准数据集。每个问题包括两张图像、一个提示词、一个答案类别和答案长度。模型可以通过提交猜测与环境进行多次交互,每次错误猜测后,环境会返回字符位置和拼音位置的反馈,帮助模型改进下一次尝试。数据集包含100个样本,数据以JSONL格式和图像包形式提供,适用于非商业用途(CC BY-NC 4.0许可证)。

CHARM-Bench is a multimodal benchmark dataset inspired by Chinese homophonic puzzle games. Each question comprises two images, a prompt, an answer category, and an answer length. Models can interact with the environment multiple times by submitting guesses: after each incorrect guess, the environment will return feedback on character positions and pinyin positions to assist the model in refining its subsequent attempts. The dataset contains 100 samples, provided in both JSONL format and image package, and licensed under CC BY-NC 4.0 for non-commercial use.

创建时间:
2026-05-27
原始信息汇总

CHARM-Bench 数据集详情

数据集简介

CHARM(Chinese Homophonic Associative Reasoning with Multimodality Benchmark)是一个受中文谐音解谜游戏启发的多模态基准测试数据集。每个问题包含两张图片、一个提示词、一个答案类别以及答案长度。模型可以通过多次提交猜测与环境交互,每次错误猜测后,环境会返回字符位置和拼音位置的反馈,帮助模型优化下一次尝试。

数据集规模与文件

  • 基准清单文件:data/charm-bench-100.jsonl,包含100个问题(ID 0-99)
  • 图像压缩包:data/charm-bench-100.zip

每条数据字段

  • id:基准测试ID(0至N-1)
  • answer:答案
  • ref_word:参考词
  • category:类别
  • answer_length:答案长度
  • pinyin_syllables:拼音音节
  • image_1, image_2:图像路径(相对于仓库)

数据来源与许可

  • 灵感来源:Steam游戏《?》(https://store.steampowered.com/app/4164310/_/)
  • 游戏工作室:FindTheLamp(https://www.findthelamp.com/)
  • 代码许可:MIT License
  • 数据许可:CC BY-NC 4.0(仅限非商业用途)

环境反馈机制

每次错误猜测后,环境返回两种反馈:

  • 字符反馈:绿色(正确位置)、黄色(错误位置)、灰色(不存在)
  • 拼音反馈:对无调拼音音节应用相同规则
  • 若提交答案长度不匹配,返回长度错误(length_mismatch),跳过该次猜测的字符和拼音反馈

评估结果(基线)

模型 提供商 最大尝试次数 得分(满分100)
gemini-3.5-flash google 1 72
SenseNova-6.7-Flash-Lite openai 1 33

安装与使用

环境要求

  • 使用 uv 包管理器

数据下载方式

  • 推荐:从 Hugging Face(https://huggingface.co/datasets/YuanNang/CHARM-Bench)下载
  • 备选:通过Git LFS从本仓库下载

运行评估命令

bash uv run charm eval --manifest data/charm-bench-100.jsonl --provider openai --model gpt-4.1 --max-attempts 1

环境变量配置

.env 文件中设置:

  • CHARM_API_KEY:API密钥
  • CHARM_BASE_URL:基础URL
  • CHARM_PROVIDER:提供商
  • CHARM_MANIFEST:清单文件路径
  • CHARM_MAX_ATTEMPTS:最大尝试次数
  • CHARM_CONCURRENCY:并行处理数量
  • CHARM_TIMEOUT:超时时间
  • CHARM_MODEL:模型名称
  • CHARM_MAX_TOKENS:最大令牌数

未来规划

  • 增加难度分级
  • 添加类别细分
  • 建立公开模型排行榜
  • 欢迎贡献高难度问题
搜集汇总
数据集介绍
CHARM-Bench 数据集图片
构建方式
CHARM-Bench数据集的构建灵感源自一款中文谐音解谜游戏,每个问题由两张图像、一个提示词、答案类别及答案长度构成。基准测试文件以JSONL格式组织,包含问题ID、答案、参考词、类别、答案长度、拼音音节以及两张图像的路径信息。图像数据打包为ZIP压缩包,与清单文件共同构成完整的评测集。数据集通过Hugging Face平台或Git LFS分发,用户可下载并解压以获取完整的测试材料。
特点
该数据集的核心特点在于其多模态交互式的评测机制。模型需在给定两张图像和提示词的前提下,通过多轮猜测与环境互动,每次错误猜测后系统返回字符位置和拼音位置的反馈信号,形成类似Wordle的迭代推理过程。反馈采用绿色、黄色、灰色编码指示正确位置、错位及缺失,若猜测长度不匹配则直接报错。这种设计旨在评估模型的中文谐音联想推理能力,融合了视觉语义理解与语言学知识。
使用方法
使用CHARM-Bench时,用户首先需通过uv工具同步Python环境并安装依赖,随后从Hugging Face或Git LFS下载数据并解压至指定目录。评测运行通过命令行执行,例如`uv run charm eval --manifest data/charm-bench-100.jsonl --provider openai --model gpt-4.1 --max-attempts 1`,支持并行执行、限制问题数量及从检查点恢复运行。模型凭证通过.env文件配置,包含API密钥、基础URL及模型名称等参数,确保评测流程的灵活性与可复现性。
背景与挑战
背景概述
CHARM-Bench是一个专为评估多模态大模型在中文谐音联想推理能力而设计的创新基准测试,诞生于2025年,由YuanNang及其团队研发,灵感源自一款中文谐音解谜游戏。该基准测试的核心研究问题在于探索模型能否结合视觉与语言线索,通过多轮交互反馈(如字符与拼音位置提示)进行递推式推理,从而破解包含同音异义、字形关联等复杂语言现象的谜题。CHARM-Bench填补了当前多模态评测中缺乏针对中文语音-语义-视觉协同推理的标准化评估空白,对推动多模态模型在中文高语义密度场景下的认知能力研究具有重要影响力,同时为游戏化AI评测范式提供了新思路。
当前挑战
CHARM-Bench所解决的领域挑战主要在于现有基准测试多聚焦于图像描述或视觉问答等基础任务,难以衡量模型在中文谐音、双关与文化隐喻交织下的高阶推理能力。在构建过程中,数据集面临若干关键难题:首先,需从游戏谜题中筛选出具备广泛认知度且语义结构严谨的样本,确保每道题目的图像与提示词间形成非直白但可溯源的关联;其次,多轮交互反馈机制的设计要求环境在模型猜错后即时返回字符及拼音位置信息,这需精细化定义长度不匹配等异常处理逻辑以保障评估公平性;此外,数据集的规模控制与难度分层(如100道题的基线版本)需平衡评测效率与任务深度,避免模型因随机猜测而获得虚高分数,从而真实反映其多模态推理的鲁棒性。
常用场景
经典使用场景
CHARM-Bench是一个专为评估多模态大语言模型(MLLMs)在中文谐音联想推理能力而设计的基准数据集。其核心使用场景是让模型在图文双模态环境下,通过观察两幅具有双关或谐音关联的图像,借助提示词、答案类别和答案长度等信息,进行多轮交互式推理。模型每次提交错误的猜测后,环境会返回字符级别和拼音级别的反馈,帮助模型逐步逼近正确答案。该基准特别适合测试模型在中文语言特有的谐音、双关和文化隐喻上的理解能力,填补了现有评估中缺乏面向中文多模态推理任务的空白。
解决学术问题
CHARM-Bench主要解决了当前多模态大模型评估中缺乏针对中文谐音与文化关联推理任务的系统性问题。现有基准多聚焦于英文场景或视觉问答、字幕生成等基础任务,难以衡量模型在中文语境下对多模态信息进行抽象关联与迭代推理的能力。通过引入带有位置反馈的多轮交互机制,该基准使研究者能够更精确地分析模型在语义理解、拼音映射与跨模态对齐上的不足。这一工作为中文多模态推理的研究提供了可量化的评价标准,推动了模型在文化适应性、语言游戏理解和交互式推理等方向上的发展。
衍生相关工作
CHARM-Bench的发布催生了若干相关研究工作,集中在多模态推理与文化适应性评估两大方向。一方面,研究者基于该基准开发了专门针对中文谐音推理的增强训练方法,例如通过构造拼音-汉字-图像的多层表征对齐来提升模型性能。另一方面,该基准促进了多轮交互式评估范式的发展,衍生了引入难度分级与跨类别分析等工作,如对模型在不同谐音类型(同音字、近音字、多义词)上的表现进行系统剖析。此外,CHARM-Bench也启发了更多面向非英语语言文化背景的多模态基准的构建,推动了全球视角下的多模态AI评估体系多元化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务