遇见数据集

figmirror-bench

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

FigMirror是一个用于科学图表到代码生成任务的基准数据集,包含465个出版物风格的Matplotlib图表,每个图表都附带精确生成其图像的脚本。数据集分为三个子集:repro(69个样本,用于重现已发表论文中的图表)、aug(348个样本,基于种子图表进行增强)、transfer(48个样本,作为冻结的转移集)。每个样本包含渲染后的图表图像(figure.png)、生成图像的Python脚本(code.py)、原始参考图像(reference.png)、绘图数据(data.csv或data.npz)以及元数据(meta.json)。图表类型涵盖12种常见科学图表类型,如条形图、折线图、散点图、箱线图等。该数据集可用于图像到代码、代码到图像以及图表生成领域的模型评估与训练,特别强调可重复性:repro和aug子集中的脚本在隔离环境中运行两次可产生完全相同的输出。

FigMirror is a benchmark dataset for the task of scientific figure-to-code generation, containing 465 publication-style Matplotlib figures, each accompanied by the exact script that generates its image. The dataset is divided into three subsets: repro (69 samples, for reproducing figures from published papers), aug (348 samples, augmented based on seed figures), and transfer (48 samples, as a frozen transfer set). Each sample includes the rendered figure image (figure.png), the Python script to generate the image (code.py), the original reference image (reference.png), plotting data (data.csv or data.npz), and metadata (meta.json). The figure types cover 12 common scientific chart types, such as bar charts, line charts, scatter plots, box plots, etc. The dataset can be used for model evaluation and training in the fields of image-to-code, code-to-image, and figure generation, with a particular emphasis on reproducibility: scripts in the repro and aug subsets produce identical outputs when run twice in an isolated environment.

创建时间:
2026-08-05
原始信息汇总

FigMirror benchmark 数据集概述

基本信息

  • 许可证: CC-BY-4.0
  • 任务类型: 图像到文本、文本到图像
  • 语言: 英语
  • 规模: n<1K(共465个样本)
  • 内容: 465张出版级matplotlib科学图表,每张均附带可精确生成该图的Python脚本

数据集划分

配置 样本数 任务描述
repro 69 复现已发表的论文图表
aug 348 基于代码种子的图表增强
transfer 48 冻结交付的迁移集

可复现性保证

  • reproaug 配置: 每个figure.pngcode.py生成的图像逐字节一致。所有脚本在隔离环境中运行两次,确保确定性输出。脚本自包含,无外部导入、无绝对路径、随机种子已固定。
  • transfer 配置: 不保证可复现性。48个样本中30个会写入不同文件名,18个无法运行。

文件结构

<config>/<id>/ figure.png code.py reference.png data.csv meta.json caption.txt data_echo.md # repro / aug 中可用

  • 所有reference文件均为上游原始发布文件,逐字节原样保留,未经过任何重渲染、重编码或修复。
  • data_echo.md说明数据是真实数据、从图表追溯还是合成数据。

元数据字段

每个样本配备meta.json,每个配置提供metadata.jsonl(每行一个样本)。关键字段包括:idtrackchart_typepanel_modeprovenancereference_kindsource_urllicenseseed_idupstream_idfigure_sha256code_sha256等。

空字段说明

  • source_url: 仅在3个repro和2个transfer样本中为空(这些图是自行绘制的)。
  • seed_id等种子字段: 仅在reprotransfer中为空(论文复现无种子)。
  • human_verdictfrozen: 仅在transfer配置中有效。

图表类型分布(12类)

代码 类型 样本数
T1 柱状图 139
T2 折线图 85
T3 散点图 39
T4 分布图 29
T5 箱线图/小提琴图 35
T6 热力图 29
T7 二维场图 31
T8 三维图 14
T9 网络/树状图 6
T10 极坐标/径向图 31
T11 标准差带图 20
T12 复合图 7

统计信息

  • 面板模式: 374个多面板,91个单面板
  • 来源归属: 论文109个,数据集18个,FigMirror原创5个,种子333个
  • 来源许可证: CC-BY-4.0 (338个)、arXiv非独占 (66个)、PMC OA (40个)、Apache-2.0 (18个)、CVF开放获取 (3个)
  • 增强种子来源: ChartNet (151)、Chart2Code (150)、Chart2NCode (31)、ChartMimic (15)、ChartGen (1)

运行环境

  • Python 3.13.7
  • Matplotlib 3.10.9
  • NumPy 2.4.4
  • 后端: Agg
  • 渲染命令: cd <样本目录> && python code.py(重写figure.png)

其他matplotlib版本可能产生亚像素级差异,记录的版本下可实现字节级一致性。

搜集汇总
数据集介绍
figmirror-bench 数据集图片
构建方式
FigMirror benchmark数据集精心构筑了一个包含465幅出版级matplotlib科学图表的资源库,每幅图表均附带其精确的渲染脚本。数据集划分为三个配置:repro、aug与transfer。repro配置聚焦于复现已发表论文中的图表,共69个样本;aug配置通过增广源自上游图表到代码数据集的种子图表,生成348个样本;transfer配置则作为冻结的迁移集,包含48个样本,未保证脚本的可复现性。每个样本均配备figure.png、code.py、reference.png、data.csv及meta.json等文件,确保数据完整性与来源可追溯性。构建过程中严格遵循字节级一致性验证,每个脚本在隔离环境中渲染两次,确保确定性输出,并以原始发布文件作为参照,不进行任何重渲染或修改。
特点
该数据集的核心特点在于其严苛的可复现性保证与详尽的元数据体系。每个figure.png均与code.py渲染结果逐字节一致,并在manifest.json记录的环境中获得确定性验证。元数据涵盖广泛的图表类型分类(12种代码),丰富的来源信息(如provenance、reference_kind、license)及数据真实性说明(data_echo.md)。数据集特别注重消除缺失字段的歧义,对无外部来源的样本明确标记provenance为figmirror-original,避免不实信息。此外,图表类型分布多样,涵盖柱状图、线图、散点图、箱线图及3D图等,且包含多面板与单面板结构,来源许可证合规性高,大部分为CC-BY-4.0。
使用方法
使用者可通过HuggingFace datasets库加载该数据集,根据需求选择repro、aug或transfer配置。每个样本的目录包含渲染脚本code.py及数据文件,可通过执行python code.py重新生成figure.png并验证字节一致性。元数据存储于meta.json或metadata.jsonl,提供丰富的字段用于筛选与定位,例如按chart_type、provenance、license等过滤。针对repro与aug配置,脚本具备自包含性与确定性,便于复现实验;而transfer配置作为不可变的迁移测试集,适合评估模型泛化能力。该数据集适用于科学图表代码生成、图表理解及可视化还原等任务,为模型训练与性能评估提供坚实基准。
背景与挑战
背景概述
FigMirror benchmark 是2025年由FigMirror团队构建的,旨在评估和提升从科学图像到可执行代码的生成能力,即图表到代码(chart-to-code)任务。该数据集包含465幅来自出版级论文的matplotlib图形,每幅图均配有精确渲染出该图的脚本,从而为基准测试提供了严格的复现保证。研究团队精心设计了repro、aug和transfer三个子集,分别用于再现论文图表、基于种子图表进行数据增强以及评估跨域迁移性能。该数据集的发布填补了科学可视化领域缺乏高质量、可复现代码基准的空白,为图表理解与代码生成模型提供了权威的评估平台,其严格的可复现性设计(字节级一致性)树立了该领域的新标准,对科学论文自动复现和图表语义理解研究产生了重要影响。
当前挑战
FigMirror benchmark 面临的挑战多维且深刻。领域层面上,图表到代码生成需精确捕获科学图表的视觉元素与数据关系,并转化为结构化的可执行代码,同时要应对布局复杂、多面板组合及精细样式差异的难题。构建过程中,团队须从海量论文中精选原始图形,确保图表可复现且代码自包含,这要求脚本在隔离环境中多次运行均能产生字节级一致的输出,且需处理来源多样带来的许可问题和原始文件缺失的困难。此外,数据集的transfer子集设计为冻结状态,其脚本运行结果高度不稳定(仅30/48可运行且输出文件名称不一),这一特性在提供真实迁移评估的同时,也给模型泛化能力带来了严苛考验。总而言之,FigMirror不仅考验模型在严格验证下的代码撰写能力,也促进了可复现科学研究范式的建设,其数据构建过程中的严谨与尝试对后续基准构建具有重要启示。
常用场景
经典使用场景
FigMirror基准数据集在图表到代码生成领域树立了全新的评估范式,其核心应用场景聚焦于科学出版物的图表重现与代码生成任务。该数据集精心汇集了465幅源自学术论文及权威数据集的Matplotlib图表,并为每一幅图表提供了可精确复现的原始渲染脚本。研究者可依托此基准,对图像到代码生成模型进行严格的量化评测,检验模型能否从静态图像中准确推断出对应的绘图代码,从而在图表类型多样性、代码语义一致性及渲染保真度等多个维度上实现深度验证。此基准的独特之处在于其强制性的可复现性保障,所有图表均通过字节级一致的代码渲染生成,确保了实验结论的坚实可靠,为领域内模型性能的公平比较与持续优化奠定了坚实的基石。
实际应用
在现实世界的科学研究与工程实践中,FigMirror基准催生了众多创新应用形态。对于科研工作者而言,该数据集可作为智能图表辅助工具的研发基石,助力实现从论文插图到可编辑代码的自动逆向工程,大幅简化研究结果的复现与再创作流程。在数据新闻、教学演示及学术出版等场景中,基于此基准训练的模型能够自动生成符合出版规范的图表代码,减少手工编码的繁琐与错误。此外,该数据集还适用于自动化代码审查与图表质量评估系统,通过比对生成代码与标准渲染结果,实现图表合规性的即时校验。其丰富的元数据与严格的可复现框架,亦为开发面向多领域科学的通用图表生成引擎提供了宝贵的数据支撑,展现出从实验室研究到产业落地的广阔前景。
衍生相关工作
FigMirror基准的推出,为图表到代码生成领域注入了新的活力,催生了一系列后续研究工作。其严格的可复现性设计理念,启发了学术界对评估协议科学性的重新审视,促进了更为严谨的基准构建方法论的形成。在模型发展层面,该数据集为训练高性能的图像到代码转换模型提供了高质量的训练与测试语料,推动了诸如多模态大模型在科学图表理解与生成任务上的性能跃升。其精细的图表分类体系与多种来源的图表样本,为研究图表语义解析、版面结构识别及跨域泛化能力提供了丰富的实验场。此外,该基准还衍生出关于代码片段确定性渲染、随机种子控制及跨版本兼容性等工程实践的研究,深化了人们对生成代码可维护性与可复现性的理解,成为连接学术探索与工程应用的重要纽带。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务