ACI-Bench-MedARC
收藏资源简介:
该数据集包含不同的子集,捕捉了不同的临床工作流程:1) 环境临床智能(aci):医患对话;2) 虚拟助手(virtassist):医患对话,带有触发Dragon Copilot的队列,例如“嘿,Dragon。给我看看胸部X光片”;3) 虚拟记录员(virtscribe):医患对话,医生在开始时对患者进行简短的口述。有三种不同的转录版本:1) `asr`:机器转录;2) `asrcorr`:对`asr`的人工修正;3) `humantrans`:人工转录。子集的转录版本如下:1) `aci`:`asr`和`asrcorr`;2) `virtassist`:仅`humantrans`;3) `virtscribe`:`asr`和`humantrans`。
This dataset consists of multiple subsets that capture distinct clinical workflows: 1) Ambient Clinical Intelligence (ACI): physician-patient dialogues; 2) Virtual Assistant (VirtAssist): physician-patient dialogues containing utterances that trigger Dragon Copilot, e.g., "Hey, Dragon. Show me the chest X-rays"; 3) Virtual Scribe (VirtScribe): physician-patient dialogues where the physician delivers a brief verbal dictation to the patient at the start. There are three distinct transcription variants: 1) `asr`: machine-generated transcription; 2) `asrcorr`: manually corrected versions of the `asr` transcripts; 3) `humantrans`: manual transcription. The supported transcription variants for each subset are as follows: 1) `aci`: `asr` and `asrcorr`; 2) `virtassist`: only `humantrans`; 3) `virtscribe`: `asr` and `humantrans`.
ACI-Bench 数据集概述
数据集基本信息
- 数据集名称: ACI-Bench
- 托管地址: https://huggingface.co/datasets/mkieffer/ACI-Bench-MedARC
- 许可证: cc-by-4.0
- 任务类别: 文本生成
- 标签: 医疗、临床、对话、摘要
数据集结构与内容
子集配置
数据集包含三个子集配置,每个子集包含多个数据分割。
-
virtassist (默认配置)
- 数据文件:
- train: virtassist/train.parquet
- valid: virtassist/valid.parquet
- test1: virtassist/test1.parquet
- test2: virtassist/test2.parquet
- test3: virtassist/test3.parquet
- 数据文件:
-
aci
- 数据文件:
- train: aci/train.parquet
- valid: aci/valid.parquet
- test1: aci/test1.parquet
- test2: aci/test2.parquet
- test3: aci/test3.parquet
- 数据文件:
-
virtscribe
- 数据文件:
- train: virtscribe/train.parquet
- valid: virtscribe/valid.parquet
- test1: virtscribe/test1.parquet
- test2: virtscribe/test2.parquet
- test3: virtscribe/test3.parquet
- 数据文件:
数据统计
| 子集 | 转录版本 | 训练集 | 验证集 | 测试集1 | 测试集2 | 测试集3 | 总计 |
|---|---|---|---|---|---|---|---|
| aci | asr | 35 | 11 | 22 | 22 | 22 | 112 |
| aci | asrcorr | 35 | 11 | 22 | 22 | 22 | 112 |
| aci | humantrans | 0 | 0 | 0 | 0 | 0 | 0 |
| virtassist | asr | 0 | 0 | 0 | 0 | 0 | 0 |
| virtassist | asrcorr | 0 | 0 | 0 | 0 | 0 | 0 |
| virtassist | humantrans | 20 | 5 | 10 | 10 | 10 | 55 |
| virtscribe | asr | 12 | 4 | 8 | 8 | 8 | 40 |
| virtscribe | asrcorr | 0 | 0 | 0 | 0 | 0 | 0 |
| virtscribe | humantrans | 12 | 4 | 8 | 8 | 8 | 40 |
| 全部 | 全部 | 114 | 35 | 70 | 70 | 70 | 359 |
数据集描述
子集定义
数据集包含三个子集,分别代表不同的临床工作流程:
- ambient clinical intelligence (aci): 医患对话
- virtual assistant (virtassist): 包含触发Dragon Copilot提示的医患对话(例如:"hey, dragon. show me the chest x-ray")
- virtual scribe (virtscribe): 医生在对话开始时对患者进行简短口述的医患对话
转录版本
数据集包含三种不同的转录版本:
- asr: 机器转录
- asrcorr: 对asr版本的人工修正(例如:将"D2N081"中的"nonsmile"修正为"ACI006"中的"non-small")
- humantrans: 人工转录
子集与转录版本对应关系
- aci: 包含asr和asrcorr版本
- virtassist: 仅包含humantrans版本
- virtscribe: 包含asr和humantrans版本
数据集用途
主要用途
评估模型将临床对话转换为结构化临床笔记的能力。
数据来源
- GitHub仓库: https://github.com/wyim/aci-bench
- 论文: https://www.nature.com/articles/s41597-023-02487-3
使用方式
可通过Hugging Face的datasets库加载数据,支持多种加载方式:
- 加载单个子集的所有分割
- 加载单个子集的单个分割
- 同时加载多个子集
- 加载多个分割(可合并或分开)
引用信息
@article{aci-bench, author = {Wen-wai Yim and Yujuan Fu and Asma {Ben Abacha} and Neal Snider and Thomas Lin and Meliha Yetisgen}, title = {ACI-BENCH: a Novel Ambient Clinical Intelligence Dataset for Benchmarking Automatic Visit Note Generation}, journal = {Nature Scientific Data}, year = {2023} }




