遇见数据集

sra-bench-skill-confidence

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

SRA-Bench是一个用于研究技能条件化与模型置信度之间关系的数据集。其核心目标是探究当提供特定技能时,模型置信度的变化是否与其准确度的变化一致。数据集包含来自五个不同模型(Qwen3.6-35B-A3B、GLM-4.7-Flash、Gemma-4-26B-A4B-it、Qwen3-32B、Gemma-4-31B-it)在四个SRA-Bench子数据集上的采样展开。每个问题条件(question-condition)下包含9次采样展开,总计356,580次展开,覆盖39,620个问题条件,数据总大小为799 MiB。数据布局包括多个文件:sampling9.jsonl.gz(9次展开及一致性置信度)、ab_logprob9.jsonl.gz(A/B判决探针)、tf_logprob9.jsonl.gz(真/假判决探针)、token_entropy9.bin(逐token熵)以及对应的索引文件。条件变量包括direct(无技能)、llm_select(模型从检索池中选取技能)和gold_skill(提供标注技能)。数据集提供了三个层次的置信度信号:agreement@9(每个问题条件一个值)、A/B和T/F判决(每个展开一个)、token熵(每个展开一个)。注意,不同模型在信号覆盖上存在差异(如Gemma模型的A/B信号不可用,gold_skill缺失)。数据集附带详细的验证信息(MANIFEST.csv和BUNDLE_AUDIT.json)以及已知的注意事项,如熵的统计特性、模型间熵不可直接比较、Qwen3.6的presence_penalty异质性等。该数据集适用于置信度校准、不确定性估计、大语言模型评估以及技能增强研究。

SRA-Bench is a dataset for studying the relationship between skill conditioning and model confidence. Its core objective is to explore whether changes in model confidence are consistent with changes in accuracy when specific skills are provided. The dataset contains sampled rollouts from five different models (Qwen3.6-35B-A3B, GLM-4.7-Flash, Gemma-4-26B-A4B-it, Qwen3-32B, Gemma-4-31B-it) on four SRA-Bench sub-datasets. Each question-condition includes 9 sampled rollouts, totaling 356,580 rollouts across 39,620 question-conditions, with a total data size of 799 MiB. The data layout includes multiple files: sampling9.jsonl.gz (9 rollouts and agreement confidence), ab_logprob9.jsonl.gz (A/B judgment probes), tf_logprob9.jsonl.gz (true/false judgment probes), token_entropy9.bin (token-level entropy), and corresponding index files. Condition variables include direct (no skill), llm_select (model selects a skill from a retrieval pool), and gold_skill (provided ground-truth skill). The dataset provides three levels of confidence signals: agreement@9 (one value per question-condition), A/B and T/F judgments (one per rollout), and token entropy (one per rollout). Note that there are differences in signal coverage across models (e.g., A/B signals unavailable for Gemma models, missing gold_skill). The dataset includes detailed validation information (MANIFEST.csv and BUNDLE_AUDIT.json) and known caveats, such as statistical properties of entropy, incomparability of entropy across models, and heterogeneity of presence_penalty for Qwen3.6. This dataset is suitable for confidence calibration, uncertainty estimation, large language model evaluation, and skill augmentation research.

创建时间:
2026-08-07
原始信息汇总

SRA-Bench: 技能条件化与模型置信度数据集

数据集概览

该数据集专注于研究技能条件化(skill conditioning)对模型置信度准确率的影响。包含356,580次生成采样,覆盖39,620个问题-条件组合,数据规模约799 MiB,属于大型数据集(100K < n < 1M)。

  • 许可证:other(自定义)
  • 任务类型:问答(question-answering)
  • 语言:英语
  • 标签:置信度校准、不确定性、LLM评估、技能增强

数据组织与文件结构

数据按 models/<model>/<dataset>/<condition>/ 路径组织,每个条件下包含:

文件 内容
sampling9.jsonl.gz 9次生成采样 + 一致性置信度
ab_logprob9.jsonl.gz A/B判定探针(每次采样)
tf_logprob9.jsonl.gz 真/假判定探针(每次采样)
token_entropy9.bin 逐token熵(float16)+ int32 token ID
token_entropy9.index.jsonl.gz 字节偏移与每次采样摘要
MANIFEST.csv 所有文件大小与SHA-256校验
BUNDLE_AUDIT.json 验证记录

条件类型(condition)

  • direct:无技能提供
  • llm_select:模型从检索池中选择技能
  • gold_skill:提供标注技能(此条件下数据缺失

置信度信号层级

信号 层级 说明
agreement@9 每个问题-条件一个 9次采样中与原生答案一致的比例
A/B、T/F判定 每次采样一个 顺序平衡,两种顺序均存储
token熵 每次采样一个 全词汇表、温度1、自然对数

注意:agreement@9 跨9次采样行广播,产生9倍伪复制,会缩小所有标准误。Gemma模型的A/B信号为n/a(非缺失),因其A/B选项质量仅为0.017,字母token几乎不会被输出,将其视为待填补缺口会产生看似可信的噪声。

模型覆盖范围(非均匀)

模型 A/B T/F
Qwen3.6-35B-A3B ✅ direct/llm_select ✅ direct/llm_select
GLM-4.7-Flash ✅ direct/llm_select ✅ direct/llm_select
Gemma-4-26B-A4B-it n/a ✅ direct/llm_select ✅ direct/llm_select
Qwen3-32B ✅ direct/llm_select ✅ direct/llm_select
Gemma-4-31B-it n/a ✅ direct/llm_select

关键信息

  • 全部5个模型携带direct和llm_select条件的熵数据,各50,940次采样(5,660实例 × 9次采样)。
  • gold_skill条件数据不存在是有意决定,非待补充——该数据集的核心设计是支持direct与llm_select条件间的对比。
  • Gemma-4-31B-it的熵计算采用分块(KV缓存)前向而非一次性计算,因其head_dim=512超过标准SDPA内核支持的256上限。分块计算与一次性前向结果差异极小(最大|dH| 1.2e-1 vs 8.0e-2,相关性0.9994)。

验证信息与已知连接弱点

  • MANIFEST.csv列出349个文件(1.23 GiB),所有文件大小均被核实。
  • 25,470条A/B记录与14,150条T/F记录通过answer_sha256ssampling9完全匹配。
  • 剩余16,980条T/F记录不含answer_sha256s,仅通过instance_id + 采样索引对齐。该连接在当前版本下有效,但无法从文件本身验证,若sampling9重新生成将导致静默错误关联。
  • T/F数据跨越多个生产者模式:部分行使用p_correct,其他使用tf_p_correct,仅部分携带mean_rollout_p_correct——读取时需归一化。

熵分析要点

mean_entropy基于所有生成token计算,这通常不是合适的跨度,且缩小范围并非普遍更优(以Qwen3.6的AUROC为例):

跨度 CHAMP TheoremQA MedCalc
整个生成 0.549 0.659 0.777
答案跨度(从ANSWER:/oxed{起) 0.639 0.559 0.632
仅数值token 0.692 0.535 0.690
  • 在CHAMP上,限制到答案值几乎使分离度翻倍;在MedCalc和TheoremQA上则完全破坏(数值token近乎确定性,H≈0.002,无论答案对错)。
  • 熵呈强烈右偏分布(Qwen3.6中位数1.2e-4,均值0.102,最大值3.28),精确为零从未出现,均值被少数token主导——建议对近零跨度使用秩统计。
  • 不同模型间熵水平不可直接比较(Gemma-4应用final_logit_softcapping=30.0重塑了分布),但模型内部的direct与llm_select差异对比是有效的。

其他注意事项

  • Qwen3.6的采样树在presence_penalty上不均匀:多数采样为0,MedCalc的llm_select条件和所有cap修复采样为1.5——这是单次采样属性而非模型属性,通过meta.cap_repair标识。
  • MedCalc采样中88%重申患者详细信息(模型需基于病例笔记推理)。MedCalc-Bench源自已发表的PMC病例报告,其再分发条款遵循上游数据集而非本数据集。
  • 正确性应使用标准解析器重新计算(MedCalc使用5%相对容差),不应直接采用存储的字符串比较结果。
搜集汇总
数据集介绍
sra-bench-skill-confidence 数据集图片
构建方式
该数据集旨在探讨技能供给对大型语言模型置信度与准确率之间关联的影响,其构建基于SRA-Bench基准,覆盖四个数据集与五种模型。每个问题-条件组合均执行九次采样 rollout,并配套三类独立置信度信号:九次采样的一致性、A/B与真/假判定探针,以及逐token熵。数据以分层目录结构存储,包含压缩的JSONL文件与二进制熵数据,并附有清单及校验记录,确保数据完整性与可追溯性。
特点
该数据集的核心特色在于其多维置信度信号设计,每个信号位于不同层级,从问题级聚合到逐token粒度,且提供原始熵向量以供灵活处理。值得注意的是,覆盖范围存在有意的不均匀性,如部分模型缺失A/B信号,而gold_skill条件被策略性排除,以聚焦于直接与模型自选技能间的对比。此外,数据揭示了熵统计的敏感性,即所选取的token范围会显著影响下游校准结论,并指出跨模型熵值不可直接比较的局限。
使用方法
使用时需留意数据结构与潜在陷阱。建议依据MANIFEST.csv核对文件完整性,并注意T/F行中缺少 SHA-256 校验的部分可能存在的连接脆弱性。对于T/F信号,需规范化不同生产者模式下的字段命名。熵数据强烈建议采用秩统计而非均值,因分布右偏且零值罕见。在跨模型比较时,应避免直接比较熵的绝对值,而应关注模型内部不同条件下的差异。最终,需应用数据集特定的解析器重新计算正确性,以保证评估的准确性。
背景与挑战
背景概述
SRA-Bench-skill-confidence数据集诞生于大型语言模型(LLM)不确定性量化与技能增强交叉研究的浪潮中,由致力于深入剖析模型行为的研究团队于近期构建,旨在系统探究技能提示(skill conditioning)对模型置信度与准确率的差异化影响。该数据集整合了五款前沿模型在四个基准任务上的356,580次采样展开,并配套多维度置信度信号(包括共识一致性、正反判定概率与逐token信息熵),为评估模型在技能辅助下的置信度校准效果提供了前所未有的细粒度资源。其开创性在于首次大规模构建'技能—置信度'对照实验框架,为可解释AI与可靠LLM部署提供了关键的评估基准,显著推动了不确定性量化研究从静态诊断向动态干预分析的范式演进。
当前挑战
该数据集面临的核心挑战在于其异质性与不可简单归一的数据结构。首先,领域问题层面,它需应对模型置信度校准这一根本难题,即模型高置信输出未必对应高准确率,尤其在不同推理任务(如数学推理CHAMP vs. 医学计算MedCalc)中,正确与错误答案的熵分布存在本质差异,统一度量标准将误导结论。其次,数据构建过程遭遇多重技术障碍:Gemma模型因注意力计算限制需采用分块前向传播,引入数值舍入误差;不同模型间的熵值因logit软封顶等策略而失去跨模型可比性;样本生成策略的部分异质性(如presence_penalty差异)与缺失的gold_skill对照条件,进一步限制了因果推断的纯粹性,要求使用者审慎设计聚合与分析方案。
常用场景
经典使用场景
SRA-Bench-Skill-Confidence数据集在大型语言模型(LLM)的置信度校准与技能条件生成研究中扮演着核心角色。其设计精巧,通过九次采样展开与三条独立置信度信号(聚合一致性、成对判断探针、逐词元熵)的融合,为探究技能注入如何影响模型置信度与准确率之间的微妙关系提供了高标准测试平台。该数据集覆盖多模型、多数据集及多种条件(direct, llm_select, gold_skill),使研究者能系统地剖析在检索或注释技能辅助下,模型输出的内在不确定性变化。经典使用场景包括对比不同技能提供策略对模型置信度分布的影响,以及挖掘熵信号在不同数据集上预测正确性的最优跨度,从而推动更可靠的LLM评估方法学发展。
衍生相关工作
基于SRA-Bench-Skill-Confidence数据集,研究者已衍生出多个方向的后续工作。围绕置信度校准的深化探索,有工作开发了基于熵分布形状的自适应阈值选择算法,相较于固定阈值可显著提升低置信度样本的检测率。在技能条件生成领域,该数据集催生了对检索技能池构建策略的对比研究,探讨了技能选择粒度与置信度表达之间的耦合关系。此外,部分工作利用该数据集的多元信号设计新的评估指标,如整合一致性、熵和成对判断的加权分数,以更全面反映模型的自我认知能力。更有团队将该数据集作为基准,系统比较不同解码-熵计算方案的一致性与成本,提出了针对超长上下文(>10k tokens)的线性复杂度熵估计方法,为实际部署中的高效不确定性计算开辟了新路径。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型在技能增强条件下的置信度校准研究,通过多模型、多数据集的356,580次采样滚动,探索技能注入如何影响模型自信度与准确率之间的微妙关联。其前沿方向在于揭示模型在推理过程中对自身答案的确定性感知机制,特别是token熵在不同语料领域(如数学推理、医学计算)中的分布差异对正确性预测的效力。数据集精心设计了直接作答、模型自选技能与黄金技能三种条件,并结合A/B判定、真/假判定和逐token熵三类独立置信度信号,为研究模型技能调用的可靠性和不确定性量化提供了细粒度、多层次的实证基础。这一资源对于提升大型语言模型在关键应用领域(如医疗问答、科学验证)中的可信度与安全性具有重要意义,推动了从静态准确率评估向动态置信度感知的科研范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务