遇见数据集

mtybilly/PubMedVision-Diff

收藏
Hugging Face2026-05-07 更新2026-05-31 收录
官方服务:

资源简介:

PubMedVision-Diff是一个包含216,285个硬医学图像对的数据集,专门用于细粒度诊断训练。这些图像对是从PubMedVision-Alignment-VQA数据集中挖掘出来的,每个图像对包含两个医学图像,这些图像在视觉上相似但不完全相同(基于BiomedCLIP图像余弦相似度在0.85到0.99之间),具有相同意图的问题(基于BiomedCLIP文本编码器余弦相似度≥0.73,允许如“描述/解释/描绘了什么”等释义模板),但诊断内容不同(答案的余弦相似度低于第70百分位数,约0.84)。数据集旨在帮助模型区分视觉相近但诊断意义不同的医学图像,适用于医学视觉问答和多模态任务。数据模式包括图像对ID、两个图像(以JPEG字节嵌入)、对应的问题和答案、共享的成像模态(如计算机断层扫描、磁共振成像)和身体部位,以及元数据(如图像相似度、问题相似度、答案相似度等)。数据集覆盖多种医学成像模态,其中计算机断层扫描占比最高(50.06%),并遵循Apache-2.0许可证。

PubMedVision-Diff is a dataset containing 216,285 hard medical image pairs designed for fine-grained diagnostic training. These pairs are mined from the PubMedVision-Alignment-VQA dataset, with each pair consisting of two medical images that are visually similar but not identical (BiomedCLIP image cosine similarity ∈ [0.85, 0.99]), have same-intent questions (BiomedCLIP text-encoder cosine similarity ≥ 0.73, admitting paraphrased templates like describe / explain / what is depicted), but diagnostically different answers (BiomedCLIP text-encoder cosine similarity on answers below the 70th percentile, ~0.84). The dataset aims to train models to distinguish between visually similar images with meaningful diagnostic differences, suitable for medical visual question answering and multimodal tasks. The schema includes pair ID, two images (embedded JPEG bytes), corresponding questions and answers, shared imaging modality (e.g., Computed Tomography, Magnetic Resonance Imaging) and body part, and metadata (e.g., image similarity, question similarity, answer similarity). It covers various medical imaging modalities, with Computed Tomography being the most frequent (50.06%), and is licensed under Apache-2.0.

提供机构:
mtybilly
二维码
社区交流群
二维码
科研交流群
商业服务