CHARM-Bench
收藏资源简介:
CHARM-Bench是一个受中文谐音谜题游戏启发的多模态基准数据集。每个问题包括两张图像、一个提示词、一个答案类别和答案长度。模型可以通过提交猜测与环境进行多次交互,每次错误猜测后,环境会返回字符位置和拼音位置的反馈,帮助模型改进下一次尝试。数据集包含100个样本,数据以JSONL格式和图像包形式提供,适用于非商业用途(CC BY-NC 4.0许可证)。
CHARM-Bench is a multimodal benchmark dataset inspired by Chinese homophonic puzzle games. Each question comprises two images, a prompt, an answer category, and an answer length. Models can interact with the environment multiple times by submitting guesses: after each incorrect guess, the environment will return feedback on character positions and pinyin positions to assist the model in refining its subsequent attempts. The dataset contains 100 samples, provided in both JSONL format and image package, and licensed under CC BY-NC 4.0 for non-commercial use.
CHARM-Bench 数据集详情
数据集简介
CHARM(Chinese Homophonic Associative Reasoning with Multimodality Benchmark)是一个受中文谐音解谜游戏启发的多模态基准测试数据集。每个问题包含两张图片、一个提示词、一个答案类别以及答案长度。模型可以通过多次提交猜测与环境交互,每次错误猜测后,环境会返回字符位置和拼音位置的反馈,帮助模型优化下一次尝试。
数据集规模与文件
- 基准清单文件:
data/charm-bench-100.jsonl,包含100个问题(ID 0-99) - 图像压缩包:
data/charm-bench-100.zip
每条数据字段
id:基准测试ID(0至N-1)answer:答案ref_word:参考词category:类别answer_length:答案长度pinyin_syllables:拼音音节image_1,image_2:图像路径(相对于仓库)
数据来源与许可
- 灵感来源:Steam游戏《?》(https://store.steampowered.com/app/4164310/_/)
- 游戏工作室:FindTheLamp(https://www.findthelamp.com/)
- 代码许可:MIT License
- 数据许可:CC BY-NC 4.0(仅限非商业用途)
环境反馈机制
每次错误猜测后,环境返回两种反馈:
- 字符反馈:绿色(正确位置)、黄色(错误位置)、灰色(不存在)
- 拼音反馈:对无调拼音音节应用相同规则
- 若提交答案长度不匹配,返回长度错误(
length_mismatch),跳过该次猜测的字符和拼音反馈
评估结果(基线)
| 模型 | 提供商 | 最大尝试次数 | 得分(满分100) |
|---|---|---|---|
| gemini-3.5-flash | 1 | 72 | |
| SenseNova-6.7-Flash-Lite | openai | 1 | 33 |
安装与使用
环境要求
- 使用 uv 包管理器
数据下载方式
- 推荐:从 Hugging Face(https://huggingface.co/datasets/YuanNang/CHARM-Bench)下载
- 备选:通过Git LFS从本仓库下载
运行评估命令
bash uv run charm eval --manifest data/charm-bench-100.jsonl --provider openai --model gpt-4.1 --max-attempts 1
环境变量配置
在 .env 文件中设置:
CHARM_API_KEY:API密钥CHARM_BASE_URL:基础URLCHARM_PROVIDER:提供商CHARM_MANIFEST:清单文件路径CHARM_MAX_ATTEMPTS:最大尝试次数CHARM_CONCURRENCY:并行处理数量CHARM_TIMEOUT:超时时间CHARM_MODEL:模型名称CHARM_MAX_TOKENS:最大令牌数
未来规划
- 增加难度分级
- 添加类别细分
- 建立公开模型排行榜
- 欢迎贡献高难度问题





