遇见数据集

CLARA-MeD corpus

收藏
data.europa2022-05-18 更新2025-06-01 收录
官方服务:

资源简介:

A collection of 24.298 pairs of professional and simplified texts (>96 million tokens): 1) Drug leaflets and summaries of product characteristics (10 211 pairs of texts, >82M words); 2) Cancer-related information summaries (201 pairs of texts, >3M tokens); and 2) Clinical trials announcements (5748 pairs of texts, 451 690 tokens). The dataset also contains a parallel corpus with a subset of 3800 sentence pairs of professional and laymen variants (149 862 tokens). This is a benchmark for medical text simplification. The latest download of files was in February 2022.

本数据集包含24298对专业文本与简化文本(总计超过9600万Token),具体分为三类文本对:1)药品说明书与产品特性摘要文本对(共10211对,词量超8200万);2)癌症相关信息摘要文本对(共201对,Token量超300万);3)临床试验公告文本对(共5748对,共计451690个Token)。此外,该数据集还包含一个平行语料库,其中涵盖3800组专业文本与通俗文本的句对子集(共计149862个Token)。本数据集是医疗文本简化任务的基准评测数据集,其文件的最新下载时间为2022年2月。

创建时间:
2022-05-18
二维码
社区交流群
二维码
科研交流群
商业服务