遇见数据集

TermDraw-Bench

收藏
github2026-07-19 更新2026-07-21 收录
官方服务:

资源简介:

TermDraw-Bench是一个用于评估语言模型能否生成和编辑结构化ASCII图表的基准测试数据集。它包含80个私有任务和12个公共示例任务,涵盖四个类别:基础框布局、网络拓扑图、图表编辑和软件架构图。每个任务包含提示、参考ASCII图、参考PNG图、断言文件和视觉语言模型判断提示。

TermDraw-Bench is a benchmark dataset for assessing the capability of large language models (LLMs) to generate and edit structured ASCII diagrams. It comprises 80 private tasks and 12 public example tasks, spanning four categories: basic box layouts, network topology diagrams, diagram editing, and software architecture diagrams. Each task includes a prompt, a reference ASCII diagram, a reference PNG image, an assertion file, and a visual-language model judgment prompt.

创建时间:
2026-07-13
原始信息汇总

数据集概述

TermDraw-Bench 是一个用于评估语言模型生成和编辑结构化 ASCII 图表能力的基准测试集。该基准测试以 GitHub 仓库形式发布,包含 80 个私有任务和 12 个公共示例任务。

任务构成

  • 任务数量与类型: 共 80 个私有任务,划分为 4 个类别;另有 12 个公共示例任务。
  • 任务类别:
    • box-layout-basics: 框图和 ASCII 布局基础
    • network-topology-diagrams: 网络、系统和集群拓扑图
    • diagram-editing: 包含源图和目标图的图表编辑任务
    • software-architecture-diagrams: 典型软件架构图
  • 任务难度: 每个类别下按 easy/, medium/, hard/ 三级组织。私有集中,.1.10 为简单,.11.15 为中等,.16.20 为困难。
  • 公共示例集: 包含 12 个人工编写的任务(每类别各一个简单、中等、困难任务),托管在 Hugging Face 上,任务 ID 为 0.10.12

每项任务的文件结构

每个任务目录包含:

  • prompt.txt
  • reference.ascii
  • reference.png
  • assertions.json
  • vlm_judge_prompt.txt

其中,类别 3(diagram-editing)还额外包含 source.asciisource.png

评估与生成流程

  • 模型生成: 使用 Together AI 进行模型响应生成和 PNG 渲染。支持多种模型,如 Qwen/Qwen3.7-PlusMiniMaxAI/MiniMax-M3moonshotai/Kimi-K2.6。任务支持文本输入,类别 3 支持多模态图像输入。
  • 评分机制: 仅使用 DeepEval 的 BaseMetric 评估,基于 OpenAI 或 Anthropic 模型对渲染后的 PNG 输出进行判断。评分指标包括 geval_structural_scoregeval_semantics_scoregeval_score(前两者之和),以及对应标准差和成本等统计信息。
  • 评估命令: 运行评估时使用 judge-geval 命令,支持设置评估轮次数(--num-judgments,默认 5 轮),通过多次独立 API 调用取均值和标准差以降低模型噪声影响。
  • 容错与恢复: 支持 --resume 参数,在部分任务已生成结果时跳过重复评估;支持断点续评。

数据集访问

  • 80 个私有任务集不公开,访问由维护者控制。
  • 公共示例集可从 Hugging Face 直接下载,用于环境验证和 API 密钥配置检查。
搜集汇总
数据集介绍
TermDraw-Bench 数据集图片
构建方式
TermDraw-Bench是一个用于评估语言模型生成与编辑结构化ASCII图表能力的基准测试集。其核心构建包含80个私有任务,横跨四个类别:盒布局基础、网络拓扑图、图表编辑及软件架构图。任务按难度(简单、中等、困难)细分,每个任务目录包含提示文本、参考ASCII图、参考PNG渲染图、断言文件及视觉语言模型评判提示。除私有集外,还通过Hugging Face公开发布12个示例任务,格式与私有任务一致,便于用户验证工具链。构建过程依托Together AI进行模型响应生成与PNG渲染,评判则独立采用OpenAI或Anthropic的DeepEval BaseMetric评分路径,无确定性文本启发式评分步骤。
使用方法
使用TermDraw-Bench需先配置环境,通过uv sync安装依赖,并在.env文件中设置Together AI、OpenAI及Anthropic的API密钥。用户可通过run-model脚本指定模型与任务路径生成ASCII图表,随后调用judge-geval脚本进行评判。评判时需指定评判模型提供商(OpenAI或Anthropic)及模型名称,并可设置评判轮次数量以控制噪声。对于图表渲染,需额外配置Node与Playwright环境。用户可选择使用公开数据集或申请私有任务集访问权限;运行中断后可通过添加--resume参数实现断点续评。整体流程实现了从生成到评判的端到端自动化,为语言模型的图表生成能力提供了标准化评估方案。
背景与挑战
背景概述
TermDraw-Bench是由研究人员YuvrajSingh9886在2025年创建的一项基准测试,专注于评估语言模型生成与编辑结构化ASCII图表的能力。该基准涵盖了四大核心类别:盒布局基础、网络拓扑图、图表编辑以及软件架构图,共计80个私有任务和12个公开示例任务。其研究核心在于突破语言模型在非文本模态下的表现,尤其是对ASCII艺术这种兼具结构与语义复杂性的符号序列的理解与生成。TermDraw-Bench的出现填补了现有基准测试在结构化图表推理任务上的空白,为评估前沿语言模型(如Qwen、MiniMax等)的视觉化表示与操作能力提供了标准化的测试平台,对人工智能在编程辅助、系统设计和自动化文档领域的技术进步具有重要推动力。
当前挑战
TermDraw-Bench面临的核心挑战在于如何使语言模型精准生成结构严谨的ASCII图表,这要求模型不仅要理解自然语言指令,还需掌握框线绘制、空间布局与拓扑关系等非文本表征规则。现有模型如Qwen/Qwen3.7-Plus等在生成过程中易出现线条错位、布局失真或语义混淆等问题,尤其在中等与高难度任务中表现尤甚。构建过程中,研究人员面临了任务集设计的难题,需设计足以区分模型能力梯度的私有任务,并且确保公开与非公开任务集的同构性与难度曲线平滑。此外,判分机制依赖一个基于DeepEval的BaseMetric裁判模型,通过OpenAI/Anthropic进行多轮独立评判来抑制噪声,而工程层面还需处理Together AI的模型可用性与API稳定性等基础设施挑战,这些均增加了基准的构建与维护成本。
常用场景
经典使用场景
TermDraw-Bench作为一个评估语言模型在结构化ASCII图表生成与编辑能力的基准测试集,其最经典的用途在于系统性地衡量当前大语言模型在文本式视觉内容创作方面的表现。该数据集精心设计了四个核心类别——基础方框布局、网络拓扑图、图表编辑任务以及软件架构图,跨越了从简单到困难的难度等级,共80个私有任务和12个公开示例任务。研究者可以通过统一的任务格式,让语言模型根据文本提示生成对应的ASCII图表,并借助参考图和预定义的断言对输出进行多维度评分,从而全面洞察模型在遵循空间约束、表达拓扑关系以及理解编辑指令等关键维度上的能力边界。
解决学术问题
在学术研究层面,TermDraw-Bench精准填补了现有语言模型评估体系中的一项重要空白——传统基准大多聚焦于文本生成、代码编写或知识问答,却忽视了对模型在结构化、空间化表达能力的系统性评测。该数据集通过引入ASCII图表这种融合文本与空间布局的中间表示形式,为研究社区提供了一把精确丈量模型视觉理解与结构化生成能力的标尺。其采用DeepEval BaseMetric与多轮判分机制,通过结构性分数、语义性分数及其综合评估,有效降低了评判模型本身引入的噪声,使得不同语言模型在图表布局、拓扑复现和编辑一致性方面的表现可以进行公平、可重复的比较,从而推动了该研究方向方法论的正规化。
实际应用
从实际应用的角度审视,TermDraw-Bench所锚定的能力维度与众多现实场景不言而喻地紧密相连。在系统运维领域,能够自动生成网络拓扑、集群架构等ASCII图表的能力,可直接服务于技术文档的自动化编写与基础设施的快速可视化;在软件开发过程中,语言模型准确绘制软件架构图的能力,能够辅助开发者在代码审查、架构讨论和知识传递时高效地进行设计沟通。此外,图表编辑任务的引入更是直击协作场景中的痛点,使得模型能够在已有图表基础上理解修改意图并准确执行,这对于智能代码编辑器、交互式教学助手以及技术文档维续系统等产品而言具有不可忽视的实用价值。
数据集最近研究
最新研究方向
随着大语言模型在代码生成与符号推理任务中的表现日益精进,如何评估其处理结构化、视觉化信息的真实能力成为关键挑战。TermDraw-Bench应运而生,它是一个专为评估语言模型生成与编辑结构化ASCII示意图而设计的基准测试集。该数据集覆盖了方框布局基础、网络拓扑、图表编辑及软件架构四大类共计80个私有任务,通过结合Together AI生成与OpenAI/Anthropic作为评估器,创新性地引入DeepEval的BaseMetric进行多重主观评分,以克服单一评判模型的噪声。值得注意的是,该基准重点关注模型在多模态与纯文本混合场景下的推理能力,尤其是在图表编辑任务中要求模型同时理解源图与目标描述。这一前沿研究方向对于推动语言模型从纯文本理解迈向可视化符号逻辑推理具有重要影响,也为未来AI系统在软件工程、系统设计等领域的实用化评估提供了可信的标准化尺度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务