遇见数据集

Hidden-uncertainty Assessment via Non-verbalized Signatures for Medical QA - Dataset

收藏
Zenodo2026-01-10 更新2026-05-26 收录
官方服务:

资源简介:

Associated pre-print paper version: https://www.techrxiv.org/doi/full/10.36227/techrxiv.176800997.72656064/v1This dataset contains raw inference outputs from five large language models (LLMs) on ten medical question-answering benchmarks (N=21,324 samples). Each sample includes: - Full chain-of-thought reasoning traces - Model predictions and ground-truth labels - Verbalized confidence scores (0-100) - Token-level log probabilities with top-20 alternatives for each token Models: GPT-oss-120B (medium/high reasoning), DeepSeek-R1-Distill-32B, Qwen3-32B, Olmo-3-32B-Think Datasets: MedQA, MedMCQA, PubMedQA, MMLU, MMLU-Pro, MedBullets, MedExQA, AfriMedQA, MedXpertQA-R, MedXpertQA-U The dataset enables research on uncertainty quantification, error detection, and reasoning analysis in medical AI systems. It accompanies the paper "Hidden-uncertainty Assessment via Non-verbalized Signatures for Medical QA" (D'Urso, 2026). Additionally includes a robustness subset with 5 independent inference runs on 300 samples per dataset for self-consistency analysis.

提供机构:
Zenodo
创建时间:
2026-01-02
二维码
社区交流群
二维码
科研交流群
商业服务