Vega-Lite Troubleshooting Dataset
收藏资源简介:
该数据集从Stack Overflow收集了889个与Vega-Lite相关的案例,用于研究可视化故障排除中人类和AI辅助支持的有效性。数据集包括原始案例、故障排除相关案例、带有有效答案代码的案例以及带有文档和示例的案例。
This dataset compiles 889 Vega-Lite-related cases sourced from Stack Overflow, aiming to investigate the effectiveness of human and AI-assisted support in visualization troubleshooting. The dataset includes original cases, troubleshooting-related cases, cases with valid answer code, as well as cases with documentation and examples.
数据集概述
数据集简介
该数据集用于研究可视化调试中人类辅助和AI辅助两种方法的效果。通过分析来自Stack Overflow的889个Vega-Lite相关案例,探讨了两种方法在可视化调试中的有效性。
数据集内容
数据集包含以下几个部分:
-
原始数据
1_All_cases/:包含889个来自Stack Overflow的原始案例。
-
调试相关案例
2_Troubleshooting_cases/:包含758个与调试相关的案例。
-
有效代码案例
3_validCode_cases/:包含288个带有有效答案代码的案例。
-
文档和示例案例
4_DocEx_cases/:包含47个带有文档和示例的案例。
数据集用途
数据集用于回答以下四个研究问题:
- Q1:用户在问答论坛中常见的问题类型是什么?
- Q2:论坛中的回答如何有效解决用户的问题?
- Q3:LLMs(大语言模型)在相同问题上的调试支持能达到何种程度?
- Q4:补充资源(如文档和示例库)如何影响LLMs辅助的有效性?
数据集结构
数据集的目录结构如下:
dataset/:包含所有数据集文件。1_All_cases/:原始889个Stack Overflow案例。2_Troubleshooting_cases/:758个调试相关案例。3_validCode_cases/:288个带有有效答案代码的案例。4_DocEx_cases/:47个带有文档和示例的案例。
实验代码
数据集附带了用于分析和实验的代码,包括:
- Q1:问题分类相关代码。
- Q2:操作分类和代码复杂度相关代码。
- Q3:LLMs实验相关代码。
- Q4:文档和示例实验相关代码。
环境配置
- Python版本:3.9.17
- 依赖安装:
pip install -r requirements.txt - 环境变量配置:在根目录下创建
.env文件,配置OPENAI_API_KEY和OPENAI_BASE_URL。
使用方法
- 运行问题分类分析:
python Q1/Code/Generate_Question.py - 运行操作分类分析:
python Q2/Operation_classfication/Code/Generate_Operation.py - 运行L0实验:
python Q3/experiement/L0_experiement.py - 运行L1和L2实验:
python Q4/experiement/L1_experiement_document.py等。 - 生成可视化结果:
python execute_PNG_Code/direct_execute_Vega_PNG.py
引用
bibtex @misc{2412.07673, Author = {Shuyu Shen and Sirong Lu and Leixian Shen and Zhonghua Sheng and Nan Tang and Yuyu Luo}, Title = {Ask Humans or AI? Exploring Their Roles in Visualization Troubleshooting}, Year = {2024}, Eprint = {arXiv:2412.07673}, }




