遇见数据集

temperature-sweep-data

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是“温度扫描”项目的原始模型输出集合,主要用于代码生成和其他领域(如分子合成、目标推断和Spider)的模型行为分析。数据集包含多个配置,覆盖不同领域:DS-1000(1000个代码生成问题,使用官方提示)、分子合成(smiles)、目标推断(goal)、Spider和LiveCodeBench。数据内容包括模型输出(rollouts)、失败案例(failures)和主题分析(themes)。对于DS-1000,数据来自6个Llama模型(如Meta-Llama-3-8B-Instruct等),温度范围从0.0到1.4,每个问题有100个样本(温度0.0时1个样本),其中温度≤1.0的输出经过评分(passed字段表示确定性评分器的裁决),温度1.2和1.4的输出未评分(passed为NULL)。此外,还包括外部模型(如Qwen/Qwen2.5-Coder-7B和deepseek-ai/deepseek-coder-6.7b-base)在DS-1000子集上的运行结果。对于其他领域(如smiles、goal、spider),所有实例均经过完整评分。数据以Hive分区Parquet格式存储,分区路径包括domain、model和temp字段,便于直接查询。每个数据文件包含字段如instance_id、sample、library、text、finish、n_tokens、passed、score、valid等,其中passed表示评分结果(DS-1000为二进制,其他领域有相应评分逻辑)。数据集适用于代码生成模型评估、温度对模型输出影响的研究以及多领域任务分析。用户可通过DuckDB直接查询数据或下载特定部分,无需完全下载。

This dataset is a collection of raw model outputs from the temperature sweep project, primarily used for code generation and model behavior analysis in other domains such as molecular synthesis, goal inference, and Spider. The dataset includes multiple configurations covering different domains: DS-1000 (1000 code generation problems with official prompts), molecular synthesis (smiles), goal inference (goal), Spider, and LiveCodeBench. Data content includes model outputs (rollouts), failure cases (failures), and thematic analysis (themes). For DS-1000, data comes from six Llama models (e.g., Meta-Llama-3-8B-Instruct, etc.), with temperature ranges from 0.0 to 1.4, each problem having 100 samples (1 sample at temperature 0.0). Outputs with temperature ≤1.0 are scored (the passed field indicates the deterministic scorers judgment), while outputs at temperatures 1.2 and 1.4 are not scored (passed is NULL). Additionally, it includes results from external models (e.g., Qwen/Qwen2.5-Coder-7B and deepseek-ai/deepseek-coder-6.7b-base) on subsets of DS-1000. For other domains (e.g., smiles, goal, spider), all instances are fully scored. The data is stored in Hive-partitioned Parquet format, with partition paths including domain, model, and temp fields for easy querying. Each data file contains fields such as instance_id, sample, library, text, finish, n_tokens, passed, score, valid, etc., where passed indicates scoring results (binary for DS-1000, with corresponding logic for other domains). The dataset is suitable for code generation model evaluation, research on the impact of temperature on model outputs, and multi-domain task analysis. Users can query the data directly via DuckDB or download specific parts without needing to download the entire dataset.

创建时间:
2026-06-11
原始信息汇总

数据集概述

名称: Temperature-sweep rollouts
许可证: 其他(other)
标签: code-generation, temperature-sweep, ds1000

该数据集包含多个配置(config),每个配置对应一个或多个域的 Parquet 文件,存储于不同的 hive 分区路径下。


配置列表

配置名 数据文件路径
rollouts-ds1000 rollouts/domain=ds1000/**/*.parquet
rollouts-smiles rollouts/domain=smiles/**/*.parquet
rollouts-goal rollouts/domain=goal/**/*.parquet
rollouts-spider rollouts/domain=spider/**/*.parquet
rollouts-livecodebench rollouts/domain=livecodebench/**/*.parquet
failures-ds1000 failures/domain=ds1000/**/*.parquet
failures-livecodebench failures/domain=livecodebench/**/*.parquet
themes-ds1000 themes/domain=ds1000/**/*.parquet
themes-livecodebench themes/domain=livecodebench/**/*.parquet

每个配置仅包含一个 train 分割。


数据集内容

1. DS-1000 域

  • 问题数量: 1000 个问题,使用官方提示词。
  • 模型: 6 个 Llama 模型(Meta-Llama-3-8B、Meta-Llama-3-8B-Instruct、Llama-3.1-8B、Llama-3.1-8B-Instruct、Llama-3.2-1B、Llama-3.2-1B-Instruct)。
  • 温度范围: 0.0 至 1.4。
  • 采样数量: 每个问题在每个温度下 100 个样本(温度 0.0 时 1 个样本)。
  • 评分说明: 温度 ≤ 1.0 的样本已评分;温度 1.2 和 1.4 的样本未评分(passed 为 NULL)。

2. DS-1000 外部运行

  • 模型: Qwen/Qwen2.5-Coder-7B(qwen25-coder-7b)、deepseek-ai/deepseek-coder-6.7b-base(dscoder-6.7b-base)。
  • 问题子集: 固定 701 个问题。
  • 提示词约定: 使用 # SOLUTION START/END 格式(非官方插入格式)。
  • 温度范围: 0.0 至 1.4(dscoder 缺失温度 0.2)。
  • 评分说明: 温度 ≤ 1.0 已评分,更高温度未评分。

3. 分子合成 / 目标推理 / Spider 域

  • 实例数量: 每个域 100 个实例。
  • 模型: 6 个 Llama 模型。
  • 温度范围: 0.0 至 1.4。
  • 评分说明: 全部已评分,每个域组共 144 个单元。

数据布局(Hive 分区 Parquet)

所有数据以 Hive 分区格式存储,modeltemp 同时存在于分区路径和列中,便于过滤和查询。

主要目录结构

  • rollouts/(主 rollout 数据)

    • 分区: domain=<d>/model=<tag>/temp=<t>/data.parquet
    • 列: instance_id, sample, library, text, finish, n_tokens, passed, score, valid
  • failures/(失败数据,仅 DS-1000 域,温度 0.0 和 0.8)

    • 分区: 同上
    • 列: instance_id, sample, library, category, exc_type, exc_msg, tb, solution
  • themes/(主题数据,仅 DS-1000 域,温度 0.0 和 0.8)

    • 分区: 同上
    • 列: instance_id, sample, library, themes[], primary, rationale
  • prompts/(提示词数据)

    • 分区: domain=<d>/model=<tag>/data.parquet
    • 列: instance_id, prompt
  • metrics/(指标 JSON 文件)

    • metrics/<d>/sweep_<model>_t<temp>_metrics.json: 每个单元的 pass@k 指标。
    • metrics/ds1000/code_contexts.json: 官方测试框架。
    • metrics/domains/failure_classification.json: green/amber/red 分类。

列语义说明

列名 说明
passed 确定性评分器的判定结果(NULL 表示未评分单元)。对于已评分单元,sum(passed) 等于对应指标 JSON 中的正确计数。
library DS-1000 库名称(其他域为 NULL)。
score / valid 对于 DS-1000,为 NULL(二值评分)。对于 smiles,score = RDKit QED,valid = 可解析分子(passed == valid)。对于 goal/spider,score 为评估器得分,passed == (score >= 1)。

DS-1000 评分详情

  • 使用官方 test_execution(部分使用 test_string)在独立子进程中执行。
  • 超时时间:120 秒进程组超时。
  • 每次调用使用独立工作目录。
  • .strip() 后处理。
  • 评分完全确定。

本地查询示例(无需完整下载)

可使用 DuckDB 直接查询 Hugging Face 上的数据,例如:

python import duckdb con = duckdb.connect() con.sql("CREATE SECRET (TYPE HUGGINGFACE, PROVIDER credential_chain)") df = con.sql(""" SELECT model, temp, avg(passed::INT) AS pass_rate FROM read_parquet(hf://datasets/samukie/temperature-sweep-data/rollouts/**/*.parquet, hive_partitioning=1) WHERE domain=ds1000 AND passed IS NOT NULL GROUP BY model, temp ORDER BY model, temp """).df()

注意:

  • 必须设置 hive_partitioning=1
  • themes 表中的 primary 列需加引号。
  • 过滤 passed IS NOT NULL 以排除未评分单元。
  • 温度值(temp)为字符串类型。

也可使用 hf download 下载部分切片:

hf download samukie/temperature-sweep-data --repo-type dataset --include "rollouts/domain=ds1000/model=llama3-8b/*"

搜集汇总
数据集介绍
temperature-sweep-data 数据集图片
构建方式
本数据集是为温度扫描(temperature-sweep)项目所构建的原始模型生成结果集合,系统性地收录了不同温度参数下代码生成任务的逐完成正确性信息。其核心构建策略在于,针对DS-1000基准测试中的1000个编程问题,使用6种Llama系列模型(涵盖Meta-Llama-3-8B及Instruct变体、Llama-3.1-8B系列、Llama-3.2-1B系列),在温度值从0.0至1.4的区间内,每个问题采集100个生成样本(温度0.0时仅采集1个)。此外,数据集还纳入了Qwen2.5-Coder-7B与DeepSeek-Coder-6.7B-base等外部模型的运行结果,以及分子合成、目标推断和Spider等领域的100个实例数据,形成了涵盖多个领域、多种模型、多组温度参数的全面生成结果矩阵。数据以Hive分区的Parquet格式存储,按领域、模型和温度进行组织,便于高效查询与分析。
特点
该数据集最显著的特点是其系统性的温度扫描设计与多维度的逐样本正确性标注。在DS-1000领域,所有温度值不超过1.0的生成结果均经过确定性评分器严格评估,提供了二值化的通过/失败判断,而更高温度的生成虽被保留但未评分,体现了对评分范围的有意识界定。对于分子合成领域,数据集不仅提供了通过与否的标签,还额外包含RDKit QED评分与分子可解析性标记,使得化学有效性能够被量化评估。目标推断与Spider领域则采用评估器分数,并以分数是否达到1.0作为通过标准,实现了跨领域的统一评判框架。数据还包含失败案例的异常类型、消息与回溯信息,以及主题分类与对应代码上下文,为深入分析模型在不同温度下的行为模式提供了丰富的结构化素材。
使用方法
用户可通过多种方式灵活利用本数据集。最直接的方式是使用DuckDB进行原地查询,无需完整下载整个数据集。通过建立Hugging Face凭证并运用Hive分区读取功能,用户可构建SQL查询语句,例如计算特定领域下不同模型与温度组合的平均通过率。值得注意的是,查询时必须设置hive_partitioning参数为1,并在涉及主题表时引用primary等保留字字段名称。为避免包含未评分的高温生成结果,应始终添加passed IS NOT NULL的过滤条件。对于只需部分数据的场景,可使用huggingface_hub库的download功能按需下载特定模型和温度的数据切片。此外,数据集还提供了各温度单元格的pass@k指标JSON文件和官方测试环境代码上下文,支持用户进行精细化的性能基准测试与对比分析。
背景与挑战
背景概述
温度扫描数据集(Temperature-sweep Data)由研究团队samuki创建,旨在系统性探究大语言模型在代码生成任务中温度参数对模型性能的影响。该数据集基于DS-1000、分子合成、目标推理及Spider等多个领域,涵盖了Llama系列及Qwen2.5-Coder等主流模型在不同温度下的采样结果。其核心研究问题聚焦于温度如何影响生成代码的正确性与多样性,为理解解码策略的调控作用提供了大规模实证基础。该数据的发布填补了领域内缺乏多温度、多模型细粒度性能记录的空白,对模型超参数调优和生成策略设计具有重要参考价值。
当前挑战
数据集面临的挑战首先在于所解决的领域问题:代码生成任务中,温度参数的合理设置直接关系到输出质量与探索性的平衡,过高或过低均可能导致性能退化,但现有研究多依赖经验调参,缺乏系统性基准。构建过程中,数据集需要处理大规模模型的多温度并行采样,确保评分一致性;同时,DS-1000领域高温(t≥1.2)样本因评分不可行而标记为空值,增加了数据分析的复杂性。此外,外部模型采用非标准提示格式和缺失特定温度点的数据,对跨模型比较提出了规范统一的要求,而分子和Spider领域的多维评分标准则进一步加大了结果解读的难度。
常用场景
经典使用场景
在代码生成与大型语言模型(LLM)的评估领域,temperature-sweep-data数据集被广泛用于系统性地探究解码温度参数对模型生成代码正确性的影响。该数据集收录了包括Llama-3系列、Qwen2.5-Coder及DeepSeek-Coder在内的多种主流模型,在DS-1000、分子合成、目标推断及Spider等多样化编程任务上的完整轨迹数据。研究者可借助其精细化的分区结构,对不同温度设置下每项生成样本的通过与否进行统计分析,从而揭示温度与代码质量之间的非线性关系,为选择最优解码策略提供实证依据。
衍生相关工作
基于该数据集,衍生出了一系列探索模型生成行为与校准性的经典工作。其中包括对温度与模型置信度之间映射关系的系统研究,揭示了不同家族模型在温度变化下表现出的迥异校准曲线。另有工作利用其详尽的失败分类(主题表)构建了细粒度的错误类型学,推动了针对特定编程错误的纠正式微调方法。此外,数据集中的多域结构(如DS-1000与Spider)激发了跨任务温度泛化能力的分析,催生了关于解码参数是否适配不同编程范式(如库调用、SQL查询)的讨论。
数据集最近研究
最新研究方向
temperature-sweep-data数据集为探索语言模型在代码生成等任务中的温度参数敏感性提供了系统性的实验支撑。当前前沿研究聚焦于通过多域多模型的大规模rollout数据(涵盖DS-1000、分子合成、Spider等复杂任务),揭示温度对生成正确率与多样性的非单调影响。该数据集的发布恰逢开源模型能力急速攀升的热点时期,其通过对Llama系列、Qwen2.5-Coder及DeepSeek-Coder等代表性模型在0.0至1.4温度区间内的精准评分与失败分类,为超参数调优与模型不确定性量化提供了高价值基准。其高炉分区Parquet格式与DuckDB即时查询支持,显著降低了大规模复现与细粒度分析的门槛,对推动可控生成与负样本理解的研究范式具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务