遇见数据集

asciitermdraw-bench-public

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

ASCIITermDraw-Bench Public Examples 是 ASCIITermDraw-Bench 基准测试的公共示例数据集,旨在评估语言模型生成和编辑结构化 ASCII 图表的能力。该数据集包含 12 个手动编写的示例任务,覆盖四个主要类别:基础方框布局与 ASCII 布局、网络与系统拓扑图、图像条件编辑任务(输入源图,输出编辑后的图)以及软件架构草图。每个类别包含易、中、难三个难度级别。每个任务由多个文件构成:prompt.txt(发送给测试模型的指令)、assertions.json(真实结构要求,如标签、实体数量、边和边标签)、reference.ascii(标准 ASCII 图表)、reference.png(reference.ascii 的渲染图像),对于图表编辑任务还包括 source.ascii 和 source.png(编辑前的图表),以及 vlm_judge_prompt.txt(发送给 LLM 评判的精确提示模板)。数据集以文件形式组织,目录结构为 <类别>/<难度>/<任务ID>/,任务 ID 为 0.1 至 0.12,与基准测试工具脚本兼容,可用于演示和运行评分流程,但不参与官方评分。数据规模为 12 个任务,包含文本(ASCII、指令)、JSON 和图像(PNG)模态。适用任务包括图像到文本和文本生成,特别是 ASCII 图表生成与编辑的基准测试。数据集许可证尚未明确,需视为保留所有权利。

ASCIITermDraw-Bench Public Examples is a public example dataset for the ASCIITermDraw-Bench benchmark, designed to evaluate the ability of language models to generate and edit structured ASCII diagrams. It contains 12 manually crafted example tasks covering four main categories: Basic Box Layout and ASCII Layout, Network and System Topology Diagrams, Image-Conditioned Editing Tasks (input source diagram, output edited diagram), and Software Architecture Sketches. Each category includes three difficulty levels: easy, medium, and hard. Each task consists of multiple files: prompt.txt (instructions sent to the tested model), assertions.json (ground truth structural requirements such as labels, entity counts, edges, and edge labels), reference.ascii (standard ASCII diagram), reference.png (rendered image of reference.ascii), and for diagram editing tasks, source.ascii and source.png (pre-edited diagrams), as well as vlm_judge_prompt.txt (precise prompt template for LLM evaluation). The dataset is organized in a file-based structure with a directory format of <category>/<difficulty>/<taskID>/, where task IDs range from 0.1 to 0.12, compatible with benchmark tool scripts for demonstration and scoring processes, but not used in official scoring. The data scale is 12 tasks, incorporating modalities such as text (ASCII, instructions), JSON, and images (PNG). Applicable tasks include image-to-text and text generation, specifically benchmark testing for ASCII diagram generation and editing. The dataset license is not explicitly defined and should be treated as all rights reserved.

创建时间:
2026-07-18
原始信息汇总

数据集概述

ASCIITermDraw-Bench Public Examples 是一个用于评估语言模型生成和编辑结构化 ASCII 图表能力的基准测试数据集。该数据集包含 12 个公开的示例任务,是完整基准测试(80 个私有任务)的独立子集。这些示例任务与完整基准测试采用完全相同的格式,旨在让用户了解任务样式并运行评分流程,而无需访问私有任务集。

任务类别

数据集包含四个类别,每个类别包含三个难度等级(easy、medium、hard)的任务:

  • box-layout-basics:方框绘制与 ASCII 布局基础。
  • network-topology-diagrams:网络、系统和集群拓扑图。
  • diagram-editing:图像条件下的编辑任务(输入源图,输出编辑后的图)。
  • software-architecture-diagrams:典型的软件架构草图。

数据格式与文件结构

每个任务的文件结构如下:

<category>/<difficulty>/<task_id>/ prompt.txt # 发送给被测试模型的指令 assertions.json # 结构真实性的基本要求(标签、实体数量、边、边标签) reference.ascii # 黄金标准的 ASCII 图表 reference.png # reference.ascii 渲染成的图片 source.ascii/.png # 仅 diagram-editing 任务:编辑前的图表 vlm_judge_prompt.txt # 发送给 LLM 评判器的确切提示模板

任务 ID 为 0.10.12,与基准测试工具的布局一致,可直接作为 --tasks 目标用于该仓库的生成/评判脚本。

任务规模与用途

  • 总任务数:12 个公开示例任务。
  • 任务用途:这些任务不属于基准测试的官方评分,仅作为文档和演示数据。
  • 完整基准测试:包含 80 个私有任务,用于实际评分,未公开发布。

语言与标签

  • 语言:英文(en)。
  • 任务类型:image-to-text、text-generation。
  • 标签:ascii-art、diagram-generation、benchmark、code-generation。

许可证

当前源仓库尚未添加许可证,在仓库所有者添加明确许可证之前,应视为保留所有权利(all-rights-reserved)。

相关资源

搜集汇总
数据集介绍
asciitermdraw-bench-public 数据集图片
构建方式
ASCIITermDraw-Bench Public Examples 数据集源自一项专门用于评估语言模型生成与编辑结构化 ASCII 图表能力的基准测试,其中完整基准包含80个私有保留任务以进行实际评分,而本数据集则以完全相同的格式独立构建了12个人工撰写的公开示例任务。这些任务按照三个难度等级(简单、中等、困难)均匀分布在四个核心类别中,即盒式布局基础、网络拓扑图、图表编辑以及软件架构草图。每个任务文件均存储于按类别/难度/任务ID组织的目录下,涵盖提示文本、断言要求、参考ASCII图及其图像渲染版本,对于编辑型任务还额外包含源图,从而确保与基准工具链的无缝兼容。
特点
该数据集的核心特点在于其精巧的设计与高度的代表性,12个任务虽少却覆盖了从基础盒式绘制到复杂软件架构的完整图谱,每个类别均均衡包含难易程度不同的样本,使得研究人员能够快速理解基准的全貌。任务文件结构严谨,包含断言文件以明确结构约束,同时提供视觉渲染图片以支持多模态评估,这种双重验证机制显著增强了评测的客观性。此外,数据集严格遵循与私有任务集相同的格式规范,因此可以直接作为基准脚本的输入目标,便于在各种语言模型上运行生成与评判流程。
使用方法
使用本数据集时,用户可将其直接作为生成与评判脚本的 --tasks 参数指向的目标,通过运行 run-model 命令在选定模型上执行任务生成,再借助 judge-geval 命令以 GPT 等模型作为评判者进行评估,最终结果保存为 CSV 文件以供分析。具体而言,运行如 'uv run run-model --model Qwen/Qwen3.7-Plus --tasks public_dataset --outputs outputs/public_demo' 的命令即可启动生成流程,随后使用 'uv run judge-geval --provider openai --model gpt-5.4 --tasks public_dataset --outputs outputs/public_demo/qwen3.7-plus --results outputs/public_demo/results.csv' 完成自动评判。需要注意的是,这12个任务仅供演示与验证,不参与官方评分榜单。
背景与挑战
背景概述
ASCIITermDraw-Bench旨在评估语言模型生成与编辑结构化ASCII图表的能力,这一研究领域反映了人工智能在视觉符号理解与结构化输出上的前沿探索。该基准测试由YuvrajSingh-mist及其团队于近期创建并开源于GitHub,其核心研究问题聚焦于模型对ASCII艺术所承载的空间关系、拓扑结构和逻辑布局的感知与再现能力。该数据集包含12个公开示例任务,覆盖盒子布局基础、网络拓扑图、图表编辑以及软件架构图四大类别,每个类别均设置简单、中等、困难三个难度等级。尽管目前仅作为展示与验证用途,但因其任务设计严谨、评估流程可复现,ASCIITermDraw-Bench在推动语言模型向结构化、符号化内容生成方向的发展中具有重要的方法论价值,有望成为评估模型抽象推理与精确生成能力的标杆。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,语言模型长期被用于自然语言生成,但在结构化ASCII图表的生成与编辑任务中,模型需精准理解空间坐标、边框连接与语义标注,这对模型的符号推理、几何感知和指令遵循能力提出了远超传统文本生成的要求。数据集内置的断言验证机制要求输出内容满足实体数量、连线关系等硬性约束,使得任务的完成难度大幅提升。其次,在构建过程中,设计者需要平衡任务的多样性与评估的客观性,从手动设计12个公开示例到80个私有测试任务,每一步都涉及对任务难度、类别覆盖和地面真值标注的精细控制。此外,由于数据集目前未开放许可证且私有测试集未公开发布,如何推广其影响力并吸引社区参与进一步验证,仍是制约其广泛采纳的关键难题。
常用场景
经典使用场景
在自然语言处理与计算机视觉的交汇领域,ASCIITermDraw-Bench Public Examples 数据集主要用于评估和提升语言模型在结构化ASCII图表生成与编辑任务上的能力。该数据集精心设计了12个公开示例任务,涵盖箱线图基础布局、网络拓扑图、软件架构草图以及图表编辑四大类别,每个任务均包含清晰的指令提示、结构化的断言校验规则以及参考答案图。研究者可借助该数据集标准化地测试模型是否具备理解复杂空间布局、遵循精确实体关系约束并输出等效ASCII艺术表征的推理能力,从而在可控的实验环境下系统衡量模型的图表结构化生成水平。
解决学术问题
该数据集精准回应当前大语言模型在符号化空间推理与结构化视觉语言理解方面的评估短板。传统的文本生成评测多聚焦于自然语言流畅性或代码语法正确性,而鲜少触及模型对二维布局关系、实体计数、边标签等结构化语义的遵循程度。ASCIITermDraw-Bench 通过引入断言式验证机制,使得研究者能够客观量化模型在生成ASCII图表时对拓扑关系、层级结构和标签准确性的核验能力,推动学术界从粗粒度的语言建模走向细粒度的结构化表达与空间推理研究,为构建真正具备视觉-符号跨模态理解能力的智能系统提供了重要的评测基石。
衍生相关工作
该数据集的发布催生了多个富有启发性的研究方向与衍生工作。其配套的开源评测工具链使得研究者能够直接复用标准的任务格式与自动化评判流水线,从而涌现出针对不同规模语言模型的结构化图表生成能力对比研究。此外,该数据集所定义的断言式验证范式启发了后续工作在更广泛的非自然语言输出领域(如表格生成、流程图绘制及电路示意图设计)构建类似的标准化评测基准。部分学者进一步借鉴其任务模板,探索将强化学习与结构化约束对齐相结合的训练策略,以期让模型学会在生成过程中主动遵循格式与关系约束,推动结构化输出生成领域的理论深化与方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务