遇见数据集

CARE-Bench

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

CARE-Bench v1.1 是一个公开的基准数据集,用于评估模型在医疗场景中的分类或决策能力。数据集包含439个案例(cases)和925个标注的前缀(prefixes),每个前缀被标注为四种类型之一:信息需要(Information needed)、自我护理或监测(Self-care or monitor)、非紧急护理(Nonurgent care)或紧急护理(Urgent care)。数据分为开发集(284个案例,609个前缀)、验证集(93个案例,181个前缀)和公开测试集1(62个案例,135个前缀)。数据集提供四个配置:model_inputs(包含标识符、分割信息和面向模型的对话消息)、cases(已发布的基于源案例)、evaluation_prefixes(参考标签和评估元数据)以及submission_template(每个已发布前缀的提交行)。该数据集可用于训练和评估医疗分诊、紧急程度分类或指导性对话系统。

CARE-Bench v1.1 is a publicly available benchmark dataset for evaluating model classification or decision-making capabilities in medical scenarios. The dataset contains 439 cases and 925 annotated prefixes, each labeled as one of four types: Information needed, Self-care or monitor, Nonurgent care, or Urgent care. The data is split into a development set (284 cases, 609 prefixes), a validation set (93 cases, 181 prefixes), and a public test set 1 (62 cases, 135 prefixes). The dataset provides four configurations: model_inputs (containing identifiers, split information, and model-oriented dialogue messages), cases (published source-based cases), evaluation_prefixes (reference labels and evaluation metadata), and submission_template (submission rows for each published prefix). This dataset can be used for training and evaluating medical triage, urgency classification, or guided dialogue systems.

创建时间:
2026-07-25
原始信息汇总

CARE-Bench v1.1 数据集概述

CARE-Bench 是一个公开数据集,共包含 439 个病例925 个带标签的前缀,并进一步划分为开发集、验证集和公开测试集三个子集,具体分布如下:

数据划分 病例数 前缀数
开发集(Development) 284 609
验证集(Validation) 93 181
公开测试集 1(Public Test 1) 62 135

注:公开测试集 1 包含 135 个用于评分的前缀,受控访问的测试集 2 输入和标签未包含在公开仓库中,可通过官方申请表单获取输入数据。


标签分布

前缀的参考标签分为四类,各类别数量如下:

标签类别 前缀数量
需要信息(Information needed) 249
自我护理或监测(Self-care or monitor) 162
非紧急护理(Nonurgent care) 342
紧急护理(Urgent care) 172

数据集配置

数据集查看器支持四种配置,各有不同用途:

  • model_inputs:包含标识符、划分信息及面向模型的消息内容。
  • cases:公开的基于来源的病例数据(排除内部评审注释、构建计划字段和目标轮次规划说明)。
  • evaluation_prefixes:包含参考标签与评估元数据。
  • submission_template:用于每个已发布前缀的提交模板行。

访问说明

搜集汇总
数据集介绍
CARE-Bench 数据集图片
构建方式
CARE-Bench数据集由医学领域专家精心构建,旨在评估对话式AI在分诊决策中的可靠性。其构建过程融合了真实临床场景与结构化标注,数据集包含439个临床案例和925个带标签的前缀,按照开发、验证和公开测试1划分为三个子集。每个案例均经过严格审核,确保了数据的真实性和权威性。前缀标签涵盖信息需求、自我护理或监测、非紧急护理和紧急护理四类,为模型评估提供了明确的参考标准。
特点
该数据集的一大特色是其精细的配置设计,包括模型输入、案例、评估前缀和提交模板四种配置,分别支持不同的使用场景。其中公开测试1包含135个带评分的前缀,便于模型性能的量化比较。此外,数据集设计了受控访问的测试2,以进一步提供无标签的输入数据,挑战模型的泛化能力。这种分层结构不仅增强了数据集的实用性,也为研究者提供了灵活的评估选项。
使用方法
使用CARE-Bench时,研究者可通过HuggingFace数据集查看器加载公开部分的四种配置。模型输入配置提供了标识符和模型面对的对话信息,直接用于推理;评估前缀配置包含参考标签,用于计算模型预测的准确率。提交模板可帮助生成标准化的提交文件,便于参与排行榜比较。对于受控访问的测试2,研究者需通过官方申请表申请输入数据,以适应更多样的评估需求。
背景与挑战
背景概述
CARE-Bench数据集于近期发布,由研究团队构建,旨在评估和提升大型语言模型在医疗分诊场景中的推理与决策能力。该数据集聚焦于患者主诉的严重程度分级,涵盖信息需求、自我照护、非紧急与紧急医疗四类标签,为模型在资源受限的医疗环境中提供可靠决策支持。其构建基于真实来源的临床案例,并设计了开发、验证和公开测试等多个子集,以促进模型的稳健评估。作为医疗AI领域的新兴基准,CARE-Bench为模型在临床分诊任务中的表现提供了标准化衡量标准,有望推动医疗语言模型的安全应用与规范化发展。
当前挑战
该数据集面临的挑战源于医疗分诊任务的复杂性与数据构建的严谨性。领域层面,分诊决策需兼顾医学准确性、伦理安全性及对患者情境的细腻理解,模型需在信息不足时识别缺失信息、在症状非典型时避免误判,并对紧急情况优先响应,这对模型的鲁棒性和可解释性提出严苛要求。构建过程中,团队需确保案例的临床真实性、标签的权威一致性,并克服标注主观性、隐私保护及数据分布不平衡等难题。此外,严格控制测试集访问权限以保障基准的公正性,同时合理划分数据以支持模型有效学习,也是构建过程中的关键考量。
常用场景
经典使用场景
CARE-Bench作为医疗咨询领域的基准数据集,其经典使用场景聚焦于评估和比较不同大语言模型在临床分诊任务中的表现能力。该数据集精心构筑了439个真实世界病例场景及925个标注前缀,覆盖从信息需求、自我照护、非紧急至紧急护理的完整严重程度梯度,为研究者提供了标准化的测试平台。通过此类基准测试,可系统性地量化模型对患者症状的理解深度、信息核实策略的合理性以及紧急转诊建议的准确性,从而推动智能分诊系统向临床实用化方向演进。
衍生相关工作
随着CARE-Bench的发布,已衍生出多项富有影响力的后续研究:一方面,研究者基于其cases配置中的源归因病例,探索可解释分诊推理框架,旨在让模型输出附带证据链引用,增强临床决策透明度;另一方面,利用其evaluation_prefixes中的参考标签,催生了针对医疗对话中不确定性表达消歧的专项技术评估,促进了对模型置信度校准算法的改进。此外,有团队以其为非紧急与紧急护理的边界划分依据,构建了跨语言分诊迁移学习基线,推动了多语种医疗AI的普惠发展。
数据集最近研究
最新研究方向
CARE-Bench作为面向医疗分诊场景的大语言模型评估基准,其最新研究方向聚焦于模型在真实临床语境下的决策能力与安全性验证。该数据集通过精细划分的案例与前缀标签体系,推动了对模型在信息需求判断、自我护理建议、非紧急及紧急医疗分类等维度的系统评测。当前研究热点包括利用此类基准促进医疗AI的可解释性、鲁棒性及公平性研究,同时为构建符合临床指南的智能分诊系统提供标准化评估框架,其发布为医疗人工智能领域的可信赖应用与监管合规设立了重要参照标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务