相关数据集
HealthBench-BR, PCDT-QA
HealthBench-BR包含1,780个真/假临床断言(每个指南10个,平衡50/50),每个断言成对出现:一个陈述忠实于指南,第二个修改关键细节(剂量、给药途径、监测间隔等)。正确分类需要精确的事实回忆,而不是表面级别的启发式。PCDT-QA包含890个开放式问题(每个指南5个),参考答案基于指南文本。评估使用LLM-as-a-judge流程(GPT-4.1)产生二元正确/不正确判决,适应临
github2026-05-05 更新280
RealICU-Gench
RealICU是一个基于后见之明标注的基准测试,用于在真实ICU条件下评估大语言模型,其中标签由资深医生在回顾完整患者轨迹后创建。它包含两个数据集:RealICU-Gold(由五位资深ICU医生共识标注)和RealICU-Scale(通过经医生验证的LLM后见之明标注器扩展),涵盖四个医生驱动的任务:患者状态评估、急性问题识别、推荐行动建议和危险行动避免。
github2026-05-18 更新60
Friedman tests.
Background Large Language Models (LLMs) highlight their potential in supporting patient education and self-management. Their performance in responses to orthodontic questions has yet to be explored. O
NIAID Data Ecosystem30
Additional file 1 of Assessing the performance of ChatGPT-4 and ChatGPT-4o in lung cancer diagnoses
Supplementary Material 1
DataCite Commons2025-04-01 更新70
Large Language Models Use in Dry Eye Disease: Perplexity AI versus ChatGPT4
To compare the utility of two large language models (LLM) in dry eye disease (DED) clinics and research. Trained ocular surface experts generated 12 prompts for queries commonly asked by DED patients
Figshare2025-08-19 更新50



