TermDraw-Bench
收藏资源简介:
TermDraw-Bench是一个用于评估语言模型能否生成和编辑结构化ASCII图表的基准测试数据集。它包含80个私有任务和12个公共示例任务,涵盖四个类别:基础框布局、网络拓扑图、图表编辑和软件架构图。每个任务包含提示、参考ASCII图、参考PNG图、断言文件和视觉语言模型判断提示。
TermDraw-Bench is a benchmark dataset for assessing the capability of large language models (LLMs) to generate and edit structured ASCII diagrams. It comprises 80 private tasks and 12 public example tasks, spanning four categories: basic box layouts, network topology diagrams, diagram editing, and software architecture diagrams. Each task includes a prompt, a reference ASCII diagram, a reference PNG image, an assertion file, and a visual-language model judgment prompt.
数据集概述
TermDraw-Bench 是一个用于评估语言模型生成和编辑结构化 ASCII 图表能力的基准测试集。该基准测试以 GitHub 仓库形式发布,包含 80 个私有任务和 12 个公共示例任务。
任务构成
- 任务数量与类型: 共 80 个私有任务,划分为 4 个类别;另有 12 个公共示例任务。
- 任务类别:
box-layout-basics: 框图和 ASCII 布局基础network-topology-diagrams: 网络、系统和集群拓扑图diagram-editing: 包含源图和目标图的图表编辑任务software-architecture-diagrams: 典型软件架构图
- 任务难度: 每个类别下按
easy/,medium/,hard/三级组织。私有集中,.1–.10为简单,.11–.15为中等,.16–.20为困难。 - 公共示例集: 包含 12 个人工编写的任务(每类别各一个简单、中等、困难任务),托管在 Hugging Face 上,任务 ID 为
0.1–0.12。
每项任务的文件结构
每个任务目录包含:
prompt.txtreference.asciireference.pngassertions.jsonvlm_judge_prompt.txt
其中,类别 3(diagram-editing)还额外包含 source.ascii 和 source.png。
评估与生成流程
- 模型生成: 使用 Together AI 进行模型响应生成和 PNG 渲染。支持多种模型,如
Qwen/Qwen3.7-Plus、MiniMaxAI/MiniMax-M3、moonshotai/Kimi-K2.6。任务支持文本输入,类别 3 支持多模态图像输入。 - 评分机制: 仅使用 DeepEval 的
BaseMetric评估,基于 OpenAI 或 Anthropic 模型对渲染后的 PNG 输出进行判断。评分指标包括geval_structural_score、geval_semantics_score、geval_score(前两者之和),以及对应标准差和成本等统计信息。 - 评估命令: 运行评估时使用
judge-geval命令,支持设置评估轮次数(--num-judgments,默认 5 轮),通过多次独立 API 调用取均值和标准差以降低模型噪声影响。 - 容错与恢复: 支持
--resume参数,在部分任务已生成结果时跳过重复评估;支持断点续评。
数据集访问
- 80 个私有任务集不公开,访问由维护者控制。
- 公共示例集可从 Hugging Face 直接下载,用于环境验证和 API 密钥配置检查。





