VIS-Shepherd
收藏资源简介:
VIS-Shepherd数据集是由浙江大学计算机辅助设计与图形学国家重点实验室的研究团队构建的,旨在为基于大型语言模型的数据可视化生成提供评估和反馈。数据集包含了2700个高质量的数据可视化评估实例,这些实例是通过从互联网上收集、人工筛选和LLM生成的缺陷实例组成的。该数据集为VIS-Shepherd模型提供了丰富的学习素材,使其能够学习到现实世界的可视化知识和技能,并为LLM生成的可视化提供有针对性的反馈。数据集的构建过程包括多阶段,包括人工创建实例的筛选、指令合成、数据集导出、LLM生成和缺陷识别等。VIS-Shepherd数据集主要用于解决基于LLM的数据可视化生成中的质量问题,旨在提高LLM生成可视化的准确性和可靠性。
The VIS-Shepherd dataset was constructed by the research team from the State Key Laboratory of Computer-Aided Design and Computer Graphics at Zhejiang University, aiming to provide evaluation and feedback for data visualization generation based on large language models (LLMs). The dataset consists of 2700 high-quality data visualization evaluation instances, which are compiled from internet-collected samples, manually screened instances and defect instances generated by LLMs. This dataset provides abundant learning materials for the VIS-Shepherd model, enabling it to acquire real-world visualization knowledge and skills, and deliver targeted feedback for visualizations generated by LLMs. The construction process of the dataset encompasses multiple stages, including screening of manually created instances, instruction synthesis, dataset export, LLM generation, and defect identification. The VIS-Shepherd dataset is primarily used to address quality issues in LLM-based data visualization generation, with the goal of improving the accuracy and reliability of visualizations generated by LLMs.
VIS-Shepherd数据集概述
数据集基本信息
- 数据集名称:VIS-Shepherd
- 用途:用于基于LLM的数据可视化生成的批评模型构建
- 官方实现仓库:https://github.com/bopan3/VIS-Shepherd
数据集内容
- 训练数据路径:
train/data/viscrafter_20250521.json - 数据格式: json [ { "input": "输入指令", "output": "输出响应", "images": ["图像路径"] } ]
训练与评估
-
训练配置:使用8块A800 GPU(80G内存)和DeepSpeed进行训练
-
训练命令: bash llamafactory-cli train train/configs/train-sft-full-viscrafter-20250521.yml
-
评估配置:需在
evaluation/config/config.yaml中填写API基础地址、API密钥和模型列表 -
评估命令: bash python run_parallel_autoCritic.py --input_base_path test_set --output_base_path critic_outputs --model_used "模型名称" ./run_all_autoEvaluate.sh
评估结果
| 模型 | 平均得分 | 得分3-5占比 |
|---|---|---|
| GPT-4o | 3.41 | 72.0% |
| VIS-Shepherd | 2.98 | 67.1% |
| Llama-4-Maverick | 2.94 | 52.8% |
| Qwen-2.5-VL-72B | 2.78 | 49.1% |
| qwen-2.5-VL-7B_1.2k | 2.5 | 52.2% |
| qwen-2.5-VL-7B_0.3k | 2.4 | 44.1% |
| qwen-2.5-VL-7B | 2.2 | 44.1% |
预训练模型
- 预训练模型:即将发布




