temperature-sweep-data
收藏资源简介:
该数据集名为temperature-sweep rollouts,包含在温度参数扫描下多个模型生成的原始输出结果及其每个生成的正确性评估数据。数据集涵盖多个领域:DS-1000(代码生成问题)、SMILES(分子合成)、Goal(目标推断)、Spider(文本到SQL)以及LiveCodeBench。数据构成包括:1)rollouts:主要输出数据,包含实例ID、样本编号、生成文本、完成状态、令牌数、通过状态、分数和有效性等字段;2)failures:失败案例数据,包含错误类别、异常信息和解决方案;3)themes:主题分类数据,包含主题列表、主要主题和理由。数据规模方面:DS-1000包含1000个问题,使用6个Llama模型在温度0.0至1.4下生成,每个问题100个样本;其他领域各100个实例。数据以Hive分区Parquet格式存储,按domain、model和temp分区。评分方法:DS-1000使用官方测试工具进行确定性评分;其他领域有各自的评分标准。数据集适用于代码生成模型评估、温度参数影响分析、错误模式研究和多领域生成任务比较。
数据集概览:temperature-sweep-data
该数据集存储了 Temperature-sweep 项目 的原始模型生成结果(rollouts),包含每次生成的正确性评估。数据集采用 Hive 分区的 Parquet 格式存储,可通过 DuckDB 进行原位查询,或通过项目网站的数据浏览器交互式浏览。
主要特点
- 目的:记录不同温度参数(temperature)下,多种代码生成模型在多个领域的生成结果与正确性。
- 许可证:other
- 标签:code-generation, temperature-sweep, ds1000
数据组成
数据集包含以下几个核心域(domain),每个域包含不同模型和温度下的生成数据:
- DS-1000:
- 1000个问题,使用官方提示词。
- 涵盖 6 个 Llama 模型:
Meta-Llama-3-8B[-Instruct]、Llama-3.1-8B[-Instruct]、Llama-3.2-1B[-Instruct]。 - 温度范围:0.0 到 1.4;每个问题在 t>0 时生成 100 个样本,t=0 时生成 1 个样本。
- 评分情况:温度 ≤ 1.0 的样本已评分;t=1.2 和 t=1.4 的样本未评分(
passed列为 NULL)。
- DS-1000 外部模型运行:
- 包含模型:
qwen25-coder-7b(Qwen/Qwen2.5-Coder-7B) 和dscoder-6.7b-base(deepseek-ai/deepseek-coder-6.7b-base)。 - 使用固定 701 个问题的子集,采用
# SOLUTION START/END提示词(非官方插入格式)。 - 温度范围:0.0 到 1.4(dscoder 缺少 t=0.2)。评分规则同 DS-1000。
- 包含模型:
- 分子合成(smiles)、目标推演(goal)、Spider:
- 每个域 100 个实例,使用 6 个 Llama 模型,温度 0.0 到 1.4。
- 所有温度和模型组合均已评分。
数据布局(Hive 分区 Parquet)
数据按照 domain、model 和 temp 分区存储,目录结构如下:
- rollouts:主要的生成结果,包含字段:
instance_id,sample,library,text,finish,n_tokens,passed,score,valid。 - failures:失败记录(仅 ds1000,t=0 和 t=0.8),包含字段:
instance_id,sample,library,category,exc_type,exc_msg,tb,solution。 - themes:主题分析(仅 ds1000,t=0 和 t=0.8),包含字段:
instance_id,sample,library,themes[],primary,rationale。 - prompts:每个实例的提示词,包含字段:
instance_id,prompt。 - metrics:每个单元(cell)的 pass@k 指标(JSON 文件),以及官方测试环境、失败分类等信息。
字段说明
passed:确定性评分结果(布尔值),NULL 表示未评分。对于已评分的单元,sum(passed)与对应 metrics JSON 中的正确计数一致。library:DS-1000 的库名,其他域为 NULL。score/valid:对于 DS-1000 为 NULL(二值评分);对于 smiles 域,score为 RDKit QED 值,valid表示是否可解析(passed==valid);对于 goal 和 spider 域,score为评估器得分,passed表示score>= 1。- DS-1000 评分机制:使用官方
test_execution(以及部分test_string),在独立子进程中运行,120 秒进程组超时,每次调用使用独立工作目录,不使用.strip()后处理,保证确定性。
数据访问
-
原位查询:使用 DuckDB 和 Hugging Face 凭证,可直接查询远程数据,无需完整下载。示例代码: python import duckdb con = duckdb.connect() con.sql("CREATE SECRET (TYPE HUGGINGFACE, PROVIDER credential_chain)") df = con.sql(""" SELECT model, temp, avg(passed::INT) AS pass_rate FROM read_parquet(hf://datasets/samukie/temperature-sweep-data/rollouts/**/*.parquet, hive_partitioning=1) WHERE domain=ds1000 AND passed IS NOT NULL GROUP BY model, temp ORDER BY model, temp """).df()
注意事项:
- 必须设置
hive_partitioning=1。 - 在 themes 表中,
"primary"需要引号。 - 过滤
passed IS NOT NULL以排除未评分单元。 - 温度(temp)以字符串形式存储。
- 必须设置
-
下载子集:使用
hf download命令下载特定分区,例如:hf download samukie/temperature-sweep-data --repo-type dataset --include "rollouts/domain=ds1000/model=llama3-8b/*"
数据配置(Configs)
数据集提供多个配置(config_name),对应不同的数据子集:
rollouts-ds1000:DS-1000 域的全部生成结果。rollouts-smiles:分子合成域的生成结果。rollouts-goal:目标推演域的生成结果。rollouts-spider:Spider 域的生成结果。rollouts-livecodebench:LiveCodeBench 域的生成结果。failures-ds1000:DS-1000 域的错误记录。failures-livecodebench:LiveCodeBench 域的错误记录。themes-ds1000:DS-1000 域的主题分析。themes-livecodebench:LiveCodeBench 域的主题分析。
相关资源
- 项目代码、报告和网站位于 GitHub 仓库:
samuki/temperature-sweep。 - 数据可通过项目网站的数据浏览器交互式浏览。




