遇见数据集

spider2-snow-temperature-sweep

收藏
Hugging Face2026-07-01 更新2026-07-02 收录
官方服务:

资源简介:

该数据集包含在Spider 2.0-Snow文本转SQL基准测试上,使用Qwen3模型(1.7B、4B、8B参数规模)在思维和非思维两种推理模式下,以温度0.6进行无约束采样生成的语言模型输出。数据集旨在分析采样行为(温度、推理模式、模型大小)在困难的企业级文本转SQL任务上的影响。数据集包含两个配置:rollouts配置提供了每个生成的详细信息,包括模型ID、推理模式标志、温度、实例ID、样本索引、原始模型输出(思维模式包含`<think>...</think>`块)、从输出中解析出的SQL、完成原因、令牌数量等,每个(模型、模式、实例)组合有100个样本;schemas配置提供了每个实例的元数据,包括实例ID、数据库ID、自然语言问题、提示中使用的链接模式DDL文本、链接的表列表等。数据集覆盖了基准测试中547个实例中的544个(前3个实例用作少样本示例池)。生成采用vLLM进行纯温度采样(top_p=1.0),提示中包含系统提示、自适应减少的最多3个少样本示例以及通过BM25问题→表链接选择的模式(非完整数据库模式)。执行正确性评估(eval)字段当前为空,将在后续版本中通过执行预测SQL与Snowflake仓库中的黄金结果进行比较来填充。

This dataset contains language model outputs generated using the Qwen3 model (with 1.7B, 4B, and 8B parameter scales) on the Spider 2.0-Snow text-to-SQL benchmark, under both thought and non-thought reasoning modes, with a temperature of 0.6 for unconstrained sampling. The dataset aims to analyze the impact of sampling behaviors (temperature, reasoning mode, model size) on challenging enterprise-level text-to-SQL tasks. It includes two configurations: the rollouts configuration provides detailed information for each generation, including model ID, reasoning mode flag, temperature, instance ID, sample index, raw model output (with `<think>...</think>` blocks for thought mode), parsed SQL from the output, completion reason, token count, etc., with 100 samples per (model, mode, instance) combination; the schemas configuration provides metadata for each instance, including instance ID, database ID, natural language question, linked schema DDL text used in the prompt, linked table list, etc. The dataset covers 544 out of 547 instances in the benchmark (the first 3 instances are used as a few-shot example pool). Generation is performed using vLLM for pure temperature sampling (top_p=1.0), with prompts including a system prompt, adaptively reduced up to 3 few-shot examples, and a schema selected via BM25 question→table linking (not the full database schema). The execution correctness evaluation (eval) field is currently empty and will be populated in future versions by comparing predicted SQL execution with gold results from the Snowflake repository.

创建时间:
2026-06-30
原始信息汇总

数据集概述

Spider 2.0-Snow Temperature-Sweep Rollouts (Qwen3, thinking vs. non-thinking) 是一个用于分析语言模型在文本到SQL(text-to-SQL)任务上采样行为的数据集,基于 Spider 2.0-Snow 基准测试(https://github.com/xlang-ai/Spider2),使用 Qwen3 模型(https://huggingface.co/Qwen)的生成结果。数据集中只包含模型输出,执行正确性(eval)将在后续的独立评分中添加。

配置与数据划分

数据集包含两个配置(config):

1. rollouts — 每次生成一行

  • 数据规模: 训练集共 323,600 个样本,约 2.39 GB。
  • 特征列:
    • model: 模型标识符,包括 Qwen/Qwen3-1.7BQwen/Qwen3-4BQwen/Qwen3-8B
    • thinking: 布尔值,指示是否启用了 Qwen3 的思考模式(enable_thinking)。
    • temp: 采样温度(当前版本为 0.6)。
    • instance_id: Spider 2.0-Snow 实例ID(如 sf_bq001)。
    • sample: 每个 (模型, 思考模式, 温度, 实例) 组合下的采样索引(0 到 N-1)。
    • text: 原始模型输出(思考模式下包含 <think>…</think> 块)。
    • extracted_sql: 从模型输出中解析出的 SQL(去除了推理过程和代码块标记)。
    • finish: vLLM 结束原因(stoplength)。
    • n_tokens: 生成的 token 总数(使用 Qwen3 分词器)。
    • n_reasoning_tokens: <think> 块内的 token 数(非思考模式下为 0)。
    • n_answer_tokens: </think> 之后的 token 数(即答案/SQL部分)。
    • thinking_closed: 是否出现了 </think> 标记(表示推理完成,未截断)。
    • has_sql: 是否提取到了非空 SQL。
    • n_shots: 提示中的 few-shot 示例数量(0-3,自适应减少以适应上下文)。
    • passed: 执行正确(匹配金标准结果),布尔值,评分前为 null
    • score: 执行评分(浮点数),评分前为 null
    • valid: 预测 SQL 执行无错误(布尔值),评分前为 null
  • 采样数量: 对于每个 (模型, 模式, 实例) 组合,温度 0.6 下,非思考模式采样 100 个,思考模式采样 100 个(分两批:20 + 80)。

2. schemas — 每个实例一行

  • 数据规模: 训练集共 547 个样本,约 6.7 MB。
  • 特征列:
    • instance_id: Spider 2.0-Snow 实例ID。
    • db: 数据库ID(如 GA360)。
    • question: 自然语言问题。
    • linked_schema: 提示中使用的 DDL 文本(通过 BM25 算法选择的表)。
    • linked_tables: 所选表名的列表。
    • n_linked_tables: 链接的表数量(top-k)。
    • external_knowledge: 提示中附带的辅助文档(如果有)。

生成方法

  • 模型: Qwen3-1.7B / 4B / 8B,每种模型都有思考和非思考两种模式。
  • 采样: 使用 vLLM,纯温度采样(top_p=1.0,无 top-k),温度 0.6,最大 token 数:非思考模式为 1024,思考模式为 8192。不使用约束解码。
  • 提示: 系统提示 + 最多 3 个 few-shot 示例(自适应减少以适应上下文)+ 问题。提示中的模式通过 BM25 问题→表格链接 选择(top-10 表),而非整个数据库。
  • 上下文: Qwen3 原生上下文长度为 40,960 token,链接后的提示无需使用 rope scaling。

评分(eval

Spider 2.0-Snow 不提供金标准 SQL;正确性通过将预测结果在托管的 Snowflake 数据仓库上执行并与发布的结果表比较来衡量。当前 eval 字段为 null,将在未来版本中填充 pass@1 执行准确率

覆盖范围

每个配置下生成了 544 个实例(共 547 个实例,前 3 个实例用作 few-shot 池)。少数模式很宽的实例(sf_bq407sf_bq154sf_bq157)即使经过链接也超出了上下文预算,因此在某些配置中被省略。

加载方式

python from datasets import load_dataset rollouts = load_dataset("vxef/spider2-snow-temperature-sweep", "rollouts") schemas = load_dataset("vxef/spider2-snow-temperature-sweep", "schemas")

搜集汇总
数据集介绍
spider2-snow-temperature-sweep 数据集图片
构建方式
该数据集基于Spider 2.0-Snow文本到SQL基准构建,旨在系统分析语言模型在复杂企业级文本转SQL任务中的采样行为。使用Qwen3系列模型(1.7B、4B、8B)分别在思考模式与非思考模式下进行生成,采用vLLM推理引擎,设定温度参数为0.6,禁用top-k采样以保持纯温度采样策略。每个模型在每个实例上生成100个样本(非思考模式与思考模式各100个),其中思考模式分两批种子进行。提示构建方面,采用BM25算法对自然语言问题进行数据库表链接,选取前10个相关表,并自适应提供最多3个少样本示例。
使用方法
用户可通过HuggingFace datasets库便捷加载该数据集的两个配置:rollouts和schemas。rollouts配置可按模型、推理模式、温度等维度进行过滤筛选,用于分析不同参数组合下的SQL生成质量与行为模式。schemas配置则提供了每个实例的完整提示上下文,便于研究提示工程对生成结果的影响。需要注意的是,执行正确性评估(eval)字段当前为空,将在后续版本中填充,用户也可通过接入Snowflake数据仓库自行运行执行评估以获取pass@1准确率。
背景与挑战
背景概述
Spider 2.0-Snow温度扫略数据集(spider2-snow-temperature-sweep)由研究人员于2025年构建,基于ICLR 2025收录的Spider 2.0基准测试(Lei等),专注于企业级文本到SQL转换任务。该数据集由Qwen3模型(1.7B/4B/8B)在思考与非思考两种推理模式下生成,旨在系统分析采样温度、推理模式及模型规模对复杂数据库查询生成的影响。作为Spider 2.0-Snow子集的扩展,它提供了超过32万条生成结果,涵盖544个实例的高温采样,为评估大语言模型在真实企业级数据库上的SQL生成能力提供了标准化测试平台,推动了文本到SQL领域从学术基准向工业场景的演进。
当前挑战
该数据集面临的核心挑战之一是企业级文本到SQL任务的固有复杂性:目标数据库包含数百个表,无法整体注入提示,需依赖BM25链接算法选取前10个相关表,这可能导致关键模式遗漏或噪声引入。构建过程中,模型需在有限上下文(40,960 token)内处理自适应少样本示例与外部知识,推理模式(思考型需生成8,192 token)与温度参数(0.6)的耦合效应增加了采样探索的难度。此外,由于Spider 2.0-Snow不公开金标SQL,执行正确性评估需依赖托管Snowflake仓库,这一封闭环境限制了数据集的即用性和跨平台复现能力。
常用场景
经典使用场景
在文本到SQL(Text-to-SQL)这一自然语言处理与数据库交叉领域中,Spider 2.0-Snow Temperature-Sweep数据集为评估和对比不同推理模式下的大型语言模型在复杂企业级查询生成任务上的表现提供了标准化的测试基准。该数据集特别适用于分析温度参数、推理模式(思考型与非思考型)及模型规模对语义解析质量的影响,研究者可通过其结构化的采样数据系统性地探究模型在硬性、大规模SQL生成任务中的行为特征。
解决学术问题
该数据集直面当前文本到SQL研究中的核心挑战——如何在多表关联、复杂业务逻辑和庞大数据库模式的真实企业场景中实现可靠的语义解析。学术界长期受困于现有基准测试(如Spider 1.0)无法充分反映现实世界的复杂性问题,而Spider 2.0-Snow通过高难度实例和隐藏真实查询的设计,促使研究者关注模型在缺乏先验正确答案时的泛化能力与执行正确性,从而推动领域内从简单查询匹配向企业级实用化语义理解的范式转变。
实际应用
在实际产业应用中,该数据集可直接服务于企业智能数据分析系统的开发与优化。通过利用这些采样的模型输出,开发者能够评估不同规模参数(1.7B至8B)和推理配置的Qwen3模型在诸如销售绩效分析、用户行为洞察等真实业务查询中的可靠性,从而为选择模型部署方案提供数据支撑。此外,数据集提供的思维链推理记录(thinking模式)为理解模型如何逐步构建复杂SQL提供了宝贵素材,有助于构建更具可解释性的查询生成系统。
数据集最近研究
最新研究方向
在文本到SQL(Text-to-SQL)这一自然语言处理与数据库交叉的前沿领域中,工业级复杂查询的挑战日益凸显,尤其是涉及大规模企业级数据库时,传统方法在模式链接与推理深度上遭遇瓶颈。该数据集聚焦于探索大型语言模型在不同推理模式下(思考型与非思考型)的采样行为,特别是通过温度参数调控生成多样性,系统性地评估Qwen3系列模型在难度极高的Spider 2.0-Snow基准上的表现。此举不仅回应了当前大模型在结构化数据问答中需要精细控制推理链长度的热点需求,也为研究模型规模与推理能力之间的权衡提供了宝贵的数据支撑。更重要的是,数据集将执行正确性(pass@1)作为最终评价指标,跳出了纯文本匹配局限,推动了该领域从生成到验证的闭环研究范式,对构建可靠、可落地的企业级智能数据工具有着深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务