遇见数据集

temperature-sweep-data

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为temperature-sweep rollouts,包含在温度参数扫描下多个模型生成的原始输出结果及其每个生成的正确性评估数据。数据集涵盖多个领域:DS-1000(代码生成问题)、SMILES(分子合成)、Goal(目标推断)、Spider(文本到SQL)以及LiveCodeBench。数据构成包括:1)rollouts:主要输出数据,包含实例ID、样本编号、生成文本、完成状态、令牌数、通过状态、分数和有效性等字段;2)failures:失败案例数据,包含错误类别、异常信息和解决方案;3)themes:主题分类数据,包含主题列表、主要主题和理由。数据规模方面:DS-1000包含1000个问题,使用6个Llama模型在温度0.0至1.4下生成,每个问题100个样本;其他领域各100个实例。数据以Hive分区Parquet格式存储,按domain、model和temp分区。评分方法:DS-1000使用官方测试工具进行确定性评分;其他领域有各自的评分标准。数据集适用于代码生成模型评估、温度参数影响分析、错误模式研究和多领域生成任务比较。

创建时间:
2026-06-11
原始信息汇总

数据集概览:temperature-sweep-data

该数据集存储了 Temperature-sweep 项目 的原始模型生成结果(rollouts),包含每次生成的正确性评估。数据集采用 Hive 分区的 Parquet 格式存储,可通过 DuckDB 进行原位查询,或通过项目网站的数据浏览器交互式浏览。

主要特点

  • 目的:记录不同温度参数(temperature)下,多种代码生成模型在多个领域的生成结果与正确性。
  • 许可证:other
  • 标签:code-generation, temperature-sweep, ds1000

数据组成

数据集包含以下几个核心域(domain),每个域包含不同模型和温度下的生成数据:

  • DS-1000
    • 1000个问题,使用官方提示词。
    • 涵盖 6 个 Llama 模型:Meta-Llama-3-8B[-Instruct]Llama-3.1-8B[-Instruct]Llama-3.2-1B[-Instruct]
    • 温度范围:0.0 到 1.4;每个问题在 t>0 时生成 100 个样本,t=0 时生成 1 个样本。
    • 评分情况:温度 ≤ 1.0 的样本已评分;t=1.2 和 t=1.4 的样本未评分(passed 列为 NULL)。
  • DS-1000 外部模型运行
    • 包含模型:qwen25-coder-7b (Qwen/Qwen2.5-Coder-7B) 和 dscoder-6.7b-base (deepseek-ai/deepseek-coder-6.7b-base)。
    • 使用固定 701 个问题的子集,采用 # SOLUTION START/END 提示词(非官方插入格式)。
    • 温度范围:0.0 到 1.4(dscoder 缺少 t=0.2)。评分规则同 DS-1000。
  • 分子合成(smiles)、目标推演(goal)、Spider
    • 每个域 100 个实例,使用 6 个 Llama 模型,温度 0.0 到 1.4。
    • 所有温度和模型组合均已评分。

数据布局(Hive 分区 Parquet)

数据按照 domainmodeltemp 分区存储,目录结构如下:

  • rollouts:主要的生成结果,包含字段:instance_id, sample, library, text, finish, n_tokens, passed, score, valid
  • failures:失败记录(仅 ds1000,t=0 和 t=0.8),包含字段:instance_id, sample, library, category, exc_type, exc_msg, tb, solution
  • themes:主题分析(仅 ds1000,t=0 和 t=0.8),包含字段:instance_id, sample, library, themes[], primary, rationale
  • prompts:每个实例的提示词,包含字段:instance_id, prompt
  • metrics:每个单元(cell)的 pass@k 指标(JSON 文件),以及官方测试环境、失败分类等信息。

字段说明

  • passed:确定性评分结果(布尔值),NULL 表示未评分。对于已评分的单元,sum(passed) 与对应 metrics JSON 中的正确计数一致。
  • library:DS-1000 的库名,其他域为 NULL。
  • score / valid:对于 DS-1000 为 NULL(二值评分);对于 smiles 域,score 为 RDKit QED 值,valid 表示是否可解析(passed == valid);对于 goal 和 spider 域,score 为评估器得分,passed 表示 score >= 1。
  • DS-1000 评分机制:使用官方 test_execution(以及部分 test_string),在独立子进程中运行,120 秒进程组超时,每次调用使用独立工作目录,不使用 .strip() 后处理,保证确定性。

数据访问

  • 原位查询:使用 DuckDB 和 Hugging Face 凭证,可直接查询远程数据,无需完整下载。示例代码: python import duckdb con = duckdb.connect() con.sql("CREATE SECRET (TYPE HUGGINGFACE, PROVIDER credential_chain)") df = con.sql(""" SELECT model, temp, avg(passed::INT) AS pass_rate FROM read_parquet(hf://datasets/samukie/temperature-sweep-data/rollouts/**/*.parquet, hive_partitioning=1) WHERE domain=ds1000 AND passed IS NOT NULL GROUP BY model, temp ORDER BY model, temp """).df()

    注意事项

    • 必须设置 hive_partitioning=1
    • 在 themes 表中,"primary" 需要引号。
    • 过滤 passed IS NOT NULL 以排除未评分单元。
    • 温度(temp)以字符串形式存储。
  • 下载子集:使用 hf download 命令下载特定分区,例如: hf download samukie/temperature-sweep-data --repo-type dataset --include "rollouts/domain=ds1000/model=llama3-8b/*"

数据配置(Configs)

数据集提供多个配置(config_name),对应不同的数据子集:

  • rollouts-ds1000:DS-1000 域的全部生成结果。
  • rollouts-smiles:分子合成域的生成结果。
  • rollouts-goal:目标推演域的生成结果。
  • rollouts-spider:Spider 域的生成结果。
  • rollouts-livecodebench:LiveCodeBench 域的生成结果。
  • failures-ds1000:DS-1000 域的错误记录。
  • failures-livecodebench:LiveCodeBench 域的错误记录。
  • themes-ds1000:DS-1000 域的主题分析。
  • themes-livecodebench:LiveCodeBench 域的主题分析。

相关资源

  • 项目代码、报告和网站位于 GitHub 仓库:samuki/temperature-sweep
  • 数据可通过项目网站的数据浏览器交互式浏览。
搜集汇总
数据集介绍
temperature-sweep-data 数据集图片
构建方式
该数据集源自温度扫描(temperature-sweep)研究项目,旨在系统评估不同解码温度对代码生成模型性能的影响。数据集通过在大规模多领域问题集上进行模型推理构建,涵盖了DS-1000、分子合成、目标推理、Spider及LiveCodeBench等多个基准测试领域。对于DS-1000,共收集了6种Llama系列模型在0.0至1.4温度范围内的生成结果,每个问题在非零温度下采样100次,零温度下仅1次;得分仅限于温度不超过1.0的样本,更高温度的生成结果虽纳入数据集但未评分。数据以Hive分区Parquet格式存储,按领域、模型和温度组织,便于高效查询与分析。
使用方法
用户可通过Python的DuckDB库直接在HuggingFace上进行远程查询,无需完整下载数据集。只需建立连接并创建HuggingFace密钥,即可使用带Hive分区的`read_parquet`函数对数据进行SQL式分析。查询时需注意将`hive_partitioning`参数设为1以保证分区识别,过滤`passed IS NOT NULL`以排除未评分样本。温度字段为字符串类型,处理时需进行类型转换。用户也可通过`hf download`命令选择性下载特定领域或模型的数据切片,便于本地化研究与可视化探索。
背景与挑战
背景概述
Temperature-Sweep-Data数据集由Samuki团队于近期创建,旨在系统探究解码温度(temperature)对大型语言模型代码生成能力的影响。该数据集基于DS-1000、分子合成、目标推理、Spider及LiveCodeBench等多个领域的基准测试,对Meta Llama系列、Qwen2.5-Coder及DeepSeek-Coder等模型在0.0至1.4的广泛温度范围内进行了大规模采样与正确性评估。通过提供每个生成的完整轨迹及确定性评分结果,该数据集为理解温度参数在代码生成中的调控机制提供了宝贵的实证基础,对提升生成式语言模型的可靠性与可控性具有重要意义。
当前挑战
该数据集所解决的领域挑战在于,现有代码生成研究多聚焦于模型架构与训练策略,而对解码温度这一关键超参数的系统影响缺乏量化评估,尤其在高温度下生成结果的不确定性与正确性退化问题亟待阐明。构建过程中,面临的挑战包括:在多个领域(如DS-1000序列化问题与非标准提示格式模型评估)中统一评分标准与执行环境;管理海量采样结果(如每问题100个样本)带来的存储与查询效率;处理高温度下未评分数据的标注缺失;以及确保跨模型、跨温度对比的公平性与可复现性。
常用场景
经典使用场景
在代码生成与大型语言模型(LLM)的实证研究中,温度参数(temperature)对模型输出多样性与正确性的影响始终是核心议题。temperature-sweep-data数据集正是为此而生,它系统性地收集了多种主流Llama模型(如Meta-Llama-3-8B系列、Llama-3.1-8B系列)及外部模型(如Qwen2.5-Coder-7B)在DS-1000基准测试上的完整采样输出。每个问题在不同温度设置下(从0.0到1.4)生成至多100个样本,并附有经过严格确定性评分器评估的正确性标签。研究者可通过该数据集精准刻画温度与模型表现之间的非线性关系,探索低温的稳定性与高温带来的创造性爆发之间的最佳平衡点。此外,Smiles分子合成、目标推理和Spider文本到SQL等多样化域的数据扩展了其应用范围,使得对温度敏感的模型行为分析不仅局限于代码生成,更延伸至化学结构预测与语义解析等专业领域。
解决学术问题
该数据集直面自然语言处理与代码智能领域中一个顽固的方法论挑战:如何系统性地量化并解释采样温度对生成模型输出质量的影响。传统研究往往仅报告某个固定温度下的模型性能,忽视了温度作为连续超参数的调节效应及其与模型架构、领域特征之间的交互作用。temperature-sweep-data通过提供细粒度的逐样本评分数据(pass@k指标、失败类型分类、正确性分析),使得研究者能够深入分析温度变化如何影响模型在不同难度等级和不同编程库(如NumPy、Pandas、PyTorch)上的表现。更重要的是,该数据集涵盖了大量失败样本的异常类型、错误消息和回溯信息,为探究模型在高温下的常见失效模式提供了定量基础。这些数据推动了关于“温度-多样性-正确性”三元权衡的理论理解,促使学术界从单一最优温度搜索转向基于任务特性的自适应温度调节方法。
实际应用
在实际的软件工程与人工智能应用部署中,temperature-sweep-data为代码助手系统的温度校准提供了高价值参考。企业和开源社区可基于该数据集的实验结论,为不同编程任务设计差异化的温度策略:在需要严格语法和逻辑一致性的单元测试生成场景中,采用低温(如0.0或0.2)确保输出可靠;而在追求创新解决方案的算法设计或代码重构任务中,则适当调高温度以激发模型生成多样化的候选方案。此外,数据集中的分子合成(Smiles)和SQL查询生成(Spider)子集,直接服务于药物发现流水线的片段设计与数据库交互自动化。开发者还可以利用此数据集训练温度预测模型或强化学习策略,使代码生成系统能根据输入问题的上下文动态调整采样参数,从而在实时编程辅助、自动化测试生成和代码审查等场景中平衡效率与质量。
数据集最近研究
最新研究方向
该数据集聚焦于语言模型生成多样性中的温度参数扫描研究,通过系统采集不同温度设置下模型在多个编程与推理任务中的输出轨迹与正确性标注,为深入理解解码策略对生成质量与多样性的影响提供了结构化实验基础。近期前沿方向集中于利用大规模 rollout 数据揭示温度与模型规模、指令遵循能力之间的非线性交互作用,并通过细粒度错误分类与主题归因分析,推动代码生成中采样策略的动态优化与稳健性评估,其跨领域覆盖设计(DS-1000、分子合成、目标推理、语义解析等)更使得温度敏感性的泛化规律研究成为热点,对提升大模型在复杂任务中的可控生成与自我纠正能力具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务