birdsql/Effi-SQL
收藏资源简介:
Effi-SQL是一个用于SQL效率优化的数据集套件,包含两部分:Effi-SQL Benchmark(一个用于评估SQL效率优化方法的基准数据集)和Diff-SQL Training Dataset(用于Diff-SQL模型的训练数据,包括补丁生成器和约束对齐器的数据)。基准数据集包括唯一标识符、数据库名、原始慢SQL查询、人工验证的优化SQL查询、执行时间、查询执行计划输出和难度标签;训练数据集包括实例ID、模型输入提示(含慢SQL查询、相关数据库信息和查询执行计划)、目标响应(含优化推理和目标补丁)、数据库名、原始慢SQL查询和优化SQL查询。数据集旨在支持SQL查询的性能优化研究和模型训练。
Effi-SQL is a dataset suite for SQL efficiency optimization, comprising two components: the Effi-SQL Benchmark, a benchmark dataset for evaluating SQL efficiency optimization methods, and the Diff-SQL Training Dataset, the training data for Diff-SQL models covering data for patch generators and constraint aligners. The benchmark dataset includes unique identifiers, database names, original slow SQL queries, manually verified optimized SQL queries, execution time, query execution plan outputs and difficulty labels. The training dataset consists of instance IDs, model input prompts (containing slow SQL queries, relevant database information and query execution plans), target responses (including optimization reasoning and target patches), database names, original slow SQL queries and optimized SQL queries. This dataset aims to support research on SQL query performance optimization and model training.




