RaTE-Eval
收藏资源简介:
RaTE-Eval数据集旨在有效衡量自动评估指标与放射科医生在医学文本生成任务中的评估之间的一致性。该数据集包含三个任务,每个任务都有官方测试集以进行公平比较。任务包括句子级人类评分、段落级人类评分以及对合成报告的评分。数据集涵盖了来自9种成像模式和22种解剖结构的2215份报告,通过引入错误计数标准化和医学文本多样化,增强了基准的鲁棒性和适用性。
The RaTE-Eval dataset is designed to effectively measure the agreement between automatic evaluation metrics and radiologists' assessments in medical text generation tasks. This dataset includes three tasks, each with an official test set to facilitate fair benchmark comparisons. The tasks cover sentence-level human scoring, paragraph-level human scoring, and scoring of synthetic radiology reports. Comprising 2,215 reports spanning 9 imaging modalities and 22 anatomical structures, this dataset enhances the robustness and applicability of the benchmark by incorporating error count standardization and medical text diversification.
RaTE-Eval 数据集概述
数据集摘要
RaTE-Eval 数据集是一个全面的基准测试,旨在有效衡量医学文本生成任务中自动评估指标与放射科医生评估之间的一致性。该数据集包含三个任务,每个任务都有其官方测试集,以便进行公平比较。
任务 1:句子级人工评分
- 数据来源:基于 MIMIC-IV 数据集,包含 2215 份报告,涵盖 9 种成像模式和 22 个解剖结构。
- 改进措施:
- 错误计数归一化:通过标注潜在错误数量来归一化错误计数,确保评估的平衡性。
- 医学文本多样化:不同于仅限于胸部 X 光片的现有基准,本数据集包含多种成像模式和解剖结构。
- 最终评分计算:总错误数除以潜在错误数。
- 数据集划分:训练集和测试集按 8:2 比例划分。
任务 2:段落级人工评分
- 数据来源:同样基于 MIMIC-IV 数据集。
- 评分系统:采用 5 点评分系统,遵循 RadPEER 标准。
- 最终评分计算:包含 1856 份参考报告、候选报告及其评分。
- 数据集划分:训练集和测试集按 8:2 比例划分。
任务 3:合成报告评分
- 数据来源:使用 Mixtral 8x7B 模型重写 847 份 MIMIC-IV 数据集中的报告。
- 重写方式:
- 同义词替换:保持原意不变。
- 反义词替换:表达相反意义。
- 测试集构成:包含原始报告、同义词版本和反义词版本。
文件路径
select_short_sentence/ ├── Task1_sentence_rate/ │ ├── rate_train.csv │ ├── gt_report_train.json │ ├── similar_report_train.json │ ├── rate_test.csv │ ├── similar_report_test.json │ └── gt_report_test.json ├── Task2_paragraph_rate/ │ ├── rate_train.csv │ ├── gt_report_train.json │ ├── similar_report_train.json │ ├── rate_test.csv │ ├── similar_report_test.json │ └── gt_report_test.json └── Task3_synthetic_rate/ ├── rewrite_report.json └── opposite_report.json




