nvBench 2.0
收藏资源简介:
nvBench 2.0 是一个用于评估自然语言到可视化(NL2VIS)系统的基准测试,特别是在涉及模糊查询的场景中。该数据集通过系统性地引入受控的模糊性来生成多样化的自然语言查询和对应的可视化,提供了从模糊查询到可视化生成的详细推理路径。
nvBench 2.0 is a benchmark for evaluating natural language to visualization (NL2VIS) systems, particularly in scenarios involving ambiguous queries. This dataset generates diverse natural language queries and corresponding visualizations by systematically introducing controlled ambiguity, and provides detailed reasoning paths from ambiguous queries to visualization generation.
nvBench 2.0 数据集概述
数据集简介
- 数据集名称:nvBench 2.0
- 用途:评估自然语言到可视化(NL2VIS)系统在模糊查询场景下的表现
- 核心挑战:解决自然语言查询中的模糊性问题
数据特点
- 支持一对多映射:从自然语言查询到多个可视化结果
- 显式建模查询模糊性
- 提供解释模糊性解决路径的推理路径
- 使用基于LLM的查询生成方法
模糊性处理流程
- 数据选择推理:识别候选列
- 图表类型推理:评估适合的图表类型
- 通道映射推理:映射数据字段到视觉通道
- 数据转换推理:应用时间分箱和聚合
- 可视化合成推理:生成多个有效输出
模糊性注入过程
- 从种子图表开始
- 转换为带有显式节点的可视化树
- 注入模糊性节点
- 解析为多个有效的可视化规范
- 将树扁平化为具体可视化查询
数据集统计
- 查询风格分布:包含命令、问题和标题等多种风格
- 平均查询长度:约14个单词
- 模糊性类型统计:
- 通道编码(CE)模糊性:88.06%
- 数据转换(DT)模糊性:46.00%
实验评估
- 最佳模型:Step-NL2VIS
- 性能指标:
- F1@3:81.50%
- F1@5:80.88%
- 模糊性级别3的召回率:83.3%
数据使用
- 数据目录:
./data/
引用信息
bibtex @misc{luo2025nvbench20benchmarknatural, title={nvBench 2.0: A Benchmark for Natural Language to Visualization under Ambiguity}, author={Tianqi Luo and Chuhan Huang and Leixian Shen and Boyan Li and Shuyu Shen and Wei Zeng and Nan Tang and Yuyu Luo}, year={2025}, eprint={2503.12880}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2503.12880}, }




