sra-bench-skill-confidence
收藏资源简介:
SRA-Bench是一个用于研究技能条件化与模型置信度之间关系的数据集。其核心目标是探究当提供特定技能时,模型置信度的变化是否与其准确度的变化一致。数据集包含来自五个不同模型(Qwen3.6-35B-A3B、GLM-4.7-Flash、Gemma-4-26B-A4B-it、Qwen3-32B、Gemma-4-31B-it)在四个SRA-Bench子数据集上的采样展开。每个问题条件(question-condition)下包含9次采样展开,总计356,580次展开,覆盖39,620个问题条件,数据总大小为799 MiB。数据布局包括多个文件:sampling9.jsonl.gz(9次展开及一致性置信度)、ab_logprob9.jsonl.gz(A/B判决探针)、tf_logprob9.jsonl.gz(真/假判决探针)、token_entropy9.bin(逐token熵)以及对应的索引文件。条件变量包括direct(无技能)、llm_select(模型从检索池中选取技能)和gold_skill(提供标注技能)。数据集提供了三个层次的置信度信号:agreement@9(每个问题条件一个值)、A/B和T/F判决(每个展开一个)、token熵(每个展开一个)。注意,不同模型在信号覆盖上存在差异(如Gemma模型的A/B信号不可用,gold_skill缺失)。数据集附带详细的验证信息(MANIFEST.csv和BUNDLE_AUDIT.json)以及已知的注意事项,如熵的统计特性、模型间熵不可直接比较、Qwen3.6的presence_penalty异质性等。该数据集适用于置信度校准、不确定性估计、大语言模型评估以及技能增强研究。
SRA-Bench is a dataset for studying the relationship between skill conditioning and model confidence. Its core objective is to explore whether changes in model confidence are consistent with changes in accuracy when specific skills are provided. The dataset contains sampled rollouts from five different models (Qwen3.6-35B-A3B, GLM-4.7-Flash, Gemma-4-26B-A4B-it, Qwen3-32B, Gemma-4-31B-it) on four SRA-Bench sub-datasets. Each question-condition includes 9 sampled rollouts, totaling 356,580 rollouts across 39,620 question-conditions, with a total data size of 799 MiB. The data layout includes multiple files: sampling9.jsonl.gz (9 rollouts and agreement confidence), ab_logprob9.jsonl.gz (A/B judgment probes), tf_logprob9.jsonl.gz (true/false judgment probes), token_entropy9.bin (token-level entropy), and corresponding index files. Condition variables include direct (no skill), llm_select (model selects a skill from a retrieval pool), and gold_skill (provided ground-truth skill). The dataset provides three levels of confidence signals: agreement@9 (one value per question-condition), A/B and T/F judgments (one per rollout), and token entropy (one per rollout). Note that there are differences in signal coverage across models (e.g., A/B signals unavailable for Gemma models, missing gold_skill). The dataset includes detailed validation information (MANIFEST.csv and BUNDLE_AUDIT.json) and known caveats, such as statistical properties of entropy, incomparability of entropy across models, and heterogeneity of presence_penalty for Qwen3.6. This dataset is suitable for confidence calibration, uncertainty estimation, large language model evaluation, and skill augmentation research.
SRA-Bench: 技能条件化与模型置信度数据集
数据集概览
该数据集专注于研究技能条件化(skill conditioning)对模型置信度与准确率的影响。包含356,580次生成采样,覆盖39,620个问题-条件组合,数据规模约799 MiB,属于大型数据集(100K < n < 1M)。
- 许可证:other(自定义)
- 任务类型:问答(question-answering)
- 语言:英语
- 标签:置信度校准、不确定性、LLM评估、技能增强
数据组织与文件结构
数据按 models/<model>/<dataset>/<condition>/ 路径组织,每个条件下包含:
| 文件 | 内容 |
|---|---|
sampling9.jsonl.gz |
9次生成采样 + 一致性置信度 |
ab_logprob9.jsonl.gz |
A/B判定探针(每次采样) |
tf_logprob9.jsonl.gz |
真/假判定探针(每次采样) |
token_entropy9.bin |
逐token熵(float16)+ int32 token ID |
token_entropy9.index.jsonl.gz |
字节偏移与每次采样摘要 |
MANIFEST.csv |
所有文件大小与SHA-256校验 |
BUNDLE_AUDIT.json |
验证记录 |
条件类型(condition):
direct:无技能提供llm_select:模型从检索池中选择技能gold_skill:提供标注技能(此条件下数据缺失)
置信度信号层级
| 信号 | 层级 | 说明 |
|---|---|---|
| agreement@9 | 每个问题-条件一个 | 9次采样中与原生答案一致的比例 |
| A/B、T/F判定 | 每次采样一个 | 顺序平衡,两种顺序均存储 |
| token熵 | 每次采样一个 | 全词汇表、温度1、自然对数 |
注意:agreement@9 跨9次采样行广播,产生9倍伪复制,会缩小所有标准误。Gemma模型的A/B信号为n/a(非缺失),因其A/B选项质量仅为0.017,字母token几乎不会被输出,将其视为待填补缺口会产生看似可信的噪声。
模型覆盖范围(非均匀)
| 模型 | A/B | T/F | 熵 |
|---|---|---|---|
| Qwen3.6-35B-A3B | ✅ | ✅ direct/llm_select | ✅ direct/llm_select |
| GLM-4.7-Flash | ✅ | ✅ direct/llm_select | ✅ direct/llm_select |
| Gemma-4-26B-A4B-it | n/a | ✅ direct/llm_select | ✅ direct/llm_select |
| Qwen3-32B | ✅ | ✅ direct/llm_select | ✅ direct/llm_select |
| Gemma-4-31B-it | n/a | ✅ | ✅ direct/llm_select |
关键信息:
- 全部5个模型携带direct和llm_select条件的熵数据,各50,940次采样(5,660实例 × 9次采样)。
gold_skill条件数据不存在是有意决定,非待补充——该数据集的核心设计是支持direct与llm_select条件间的对比。- Gemma-4-31B-it的熵计算采用分块(KV缓存)前向而非一次性计算,因其
head_dim=512超过标准SDPA内核支持的256上限。分块计算与一次性前向结果差异极小(最大|dH| 1.2e-1 vs 8.0e-2,相关性0.9994)。
验证信息与已知连接弱点
MANIFEST.csv列出349个文件(1.23 GiB),所有文件大小均被核实。- 25,470条A/B记录与14,150条T/F记录通过
answer_sha256s与sampling9完全匹配。 - 剩余16,980条T/F记录不含
answer_sha256s,仅通过instance_id+ 采样索引对齐。该连接在当前版本下有效,但无法从文件本身验证,若sampling9重新生成将导致静默错误关联。 - T/F数据跨越多个生产者模式:部分行使用
p_correct,其他使用tf_p_correct,仅部分携带mean_rollout_p_correct——读取时需归一化。
熵分析要点
mean_entropy基于所有生成token计算,这通常不是合适的跨度,且缩小范围并非普遍更优(以Qwen3.6的AUROC为例):
| 跨度 | CHAMP | TheoremQA | MedCalc |
|---|---|---|---|
| 整个生成 | 0.549 | 0.659 | 0.777 |
答案跨度(从ANSWER:/oxed{起) |
0.639 | 0.559 | 0.632 |
| 仅数值token | 0.692 | 0.535 | 0.690 |
- 在CHAMP上,限制到答案值几乎使分离度翻倍;在MedCalc和TheoremQA上则完全破坏(数值token近乎确定性,H≈0.002,无论答案对错)。
- 熵呈强烈右偏分布(Qwen3.6中位数1.2e-4,均值0.102,最大值3.28),精确为零从未出现,均值被少数token主导——建议对近零跨度使用秩统计。
- 不同模型间熵水平不可直接比较(Gemma-4应用
final_logit_softcapping=30.0重塑了分布),但模型内部的direct与llm_select差异对比是有效的。
其他注意事项
- Qwen3.6的采样树在
presence_penalty上不均匀:多数采样为0,MedCalc的llm_select条件和所有cap修复采样为1.5——这是单次采样属性而非模型属性,通过meta.cap_repair标识。 - MedCalc采样中88%重申患者详细信息(模型需基于病例笔记推理)。MedCalc-Bench源自已发表的PMC病例报告,其再分发条款遵循上游数据集而非本数据集。
- 正确性应使用标准解析器重新计算(MedCalc使用5%相对容差),不应直接采用存储的字符串比较结果。




