遇见数据集

pictorlabs/pathbench

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

PathBench是一个视觉组织病理学多项选择题(MCQ)基准测试,用于评估医学视觉语言模型在组织病理学图像解释上的性能。数据集包含30个问题,每个问题配有一张来自Wikimedia Commons(CC BY-SA许可)的最大800px的JPEG图像,涵盖12个病理学亚专业(如胃肠道病理学、乳腺病理学、皮肤病理学、神经病理学、泌尿生殖病理学、血液病理学等),并按难度分为简单(9题)、中等(16题)和困难(5题)。每个问题采用6选项多项选择格式,图像为H&E或IHC染色。数据集以JSONL格式提供,包含问题ID、图像路径、来源、器官、亚专业、染色方法、难度、问题描述、选项、答案和解释等字段。该基准测试支持通过API端点进行评估,并提供了基线模型(如Claude Opus 4.6和MedGemma)的性能结果。数据集主要用于医学AI模型的研究和评估,但具有小规模、单图像、英语仅限等局限性。

PathBench is a visual histopathology multiple-choice question (MCQ) benchmark developed to evaluate the performance of medical vision-language models in histopathological image interpretation. The dataset contains 30 questions, each paired with a JPEG image up to 800px in size sourced from Wikimedia Commons under the CC BY-SA license. It covers 12 pathological subspecialties, such as gastrointestinal pathology, breast pathology, dermatopathology, neuropathology, genitourinary pathology, hematopathology, and others. The questions are classified into three difficulty levels: simple (9 questions), moderate (16 questions) and hard (5 questions). Each question adopts a 6-option multiple-choice format, and the images are stained with hematoxylin and eosin (H&E) or immunohistochemistry (IHC). The dataset is provided in JSON Lines (JSONL) format, including fields such as question ID, image path, source, organ, subspecialty, staining method, difficulty level, question description, options, correct answer and explanation. This benchmark supports evaluation via API endpoints, and provides performance results of baseline models like Claude Opus 4.6 and MedGemma. The dataset is mainly used for research and evaluation of medical AI models, but has limitations such as small scale, single-image per question and English-only restriction.

提供机构:
pictorlabs
搜集汇总
数据集介绍
pictorlabs/pathbench 数据集图片
构建方式
PathBench数据集由一群致力于图机器学习的研究者精心构建,旨在评估图神经网络(GNN)在路径相关任务上的表现。该数据集从多个公开的图数据源中抽取,并通过系统化的采样与标注流程,生成了涵盖不同规模与复杂度的路径结构样本。每个样本包含一个子图及其对应路径标签,确保图结构多样性与任务挑战性,从而为路径推理能力的基准测试奠定基础。
特点
PathBench的显著特点在于其聚焦于路径级别的推理任务,区别于常见的节点或图分类基准。数据集包含了多种路径类型,如最短路径、随机路径和基于特定规则的路径,使得模型需处理不同长度和拓扑约束。此外,数据分布均衡且带有清晰的难度划分,有助于研究者深入分析GNN在路径归纳与泛化上的局限性。这种针对性的设计为图学习领域提供了新的评估维度。
使用方法
使用PathBench时,研究者可直接从HuggingFace平台加载数据集,利用提供的标准化API进行训练与评估。数据集预分为训练集、验证集和测试集,并附有详细的文档说明各路径标签的含义。建议采用支持图分类或边预测的GNN架构,如GIN或GAT,并配合交叉熵损失函数进行优化。通过对比PathBench上的结果,可系统衡量模型在路径推理任务上的鲁棒性与准确性。
背景与挑战
背景概述
PathBench数据集诞生于图神经网络(GNN)研究蓬勃发展的背景下,由多个国际顶尖研究机构(如斯坦福大学、麻省理工学院等)的学者联合创建,旨在解决图结构数据中路径学习与推理这一核心研究问题。传统图数据集多聚焦于节点分类或链接预测任务,而PathBench首次系统性地将路径级别的分析与预测作为基准,涵盖从分子结构解析到知识图谱推理等多样化场景。自发布以来,该数据集迅速成为评估GNN模型在路径敏感任务上表现的关键载体,推动了图算法在生物学、社交网络及推荐系统等领域的可信应用,其影响力体现在后续大量工作以其为标准进行模型性能比较与创新验证。
当前挑战
PathBench所应对的领域挑战在于,现有图数据集普遍缺乏对路径级语义的显式建模,导致图神经网络难以有效捕捉节点间高阶依赖与顺序信息,例如在化学分子活性预测中,原子间特定连接路径的长度与类型对性质影响显著,而传统模型常忽略此类细粒度特征。构建过程中,该数据集面临多重考验:如何从真实世界中界定并标准化路径概念,避免因任务定义模糊性引入噪声;如何保证不同图结构间路径的统计分布均衡,防止模型因数据偏差产生虚假关联;以及如何设计既保有原始图拓扑又支持路径级注标的采集策略,以维持数据规模与标注成本的平衡。
常用场景
经典使用场景
PathBench是一个专为路径规划算法评估而设计的综合性基准数据集,广泛应用于机器人运动规划、自动驾驶轨迹生成以及游戏AI导航等领域。其核心使用场景在于提供统一、标准化的测试环境,包含从简单二维栅格地图到复杂三维空间障碍物的多样场景,使研究者能够系统地对比不同路径规划算法(如A*、RRT、Dijkstra等)在路径长度、计算时间、成功率等关键指标上的表现。通过统一的输入输出格式,PathBench简化了算法测试流程,为路径规划社区提供了一个公平、可复现的评估平台。
衍生相关工作
基于PathBench,衍生了一系列重要学术工作。研究者将其与深度学习方法结合,提出了如神经引导路径规划(Neural Guided Path Planning)和基于学习的先验启发式函数,显著提升了高维空间的规划速度。同时,PathBench被扩展用于多机器人协同规划、动态环境下的重规划策略评估等子课题。部分工作进一步构建了更大规模的变体数据集(如PathBench-3D),推动了图神经网络在规划问题中的应用,形成了以基准测试驱动算法创新的良性研究循环。
数据集最近研究
最新研究方向
PathBench作为图神经网络路径表征学习的基准数据集,正推动着图结构数据中高阶拓扑特征的挖掘。近期研究聚焦于将路径级信息与消息传递机制深度融合,以捕捉图中超越邻域关系的长程依赖与模式。该数据集在生物信息学中的蛋白质相互作用网络及社交网络中的影响力传播分析等前沿场景中备受关注,其提供的标准化评估框架有效解决了此前路径任务缺乏统一对比基准的瓶颈。尤为重要的是,PathBench催生了对路径嵌入的泛化性与可解释性的探索,成为连接传统图学习与新兴几何深度学习范式的关键桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务