epfl-llm/guidelines
收藏资源简介:
Clinical Guidelines数据集是一个包含47K临床实践指南的新数据集,来源于17个高质量的在线医学资源。该数据集是Meditron-70B大型语言模型原始训练语料库的重要组成部分。数据集的语言为英语,涵盖了多个医学领域和地理范围。数据集的结构包括id、source、title、clean_text、raw_text、url和overview等字段。数据集的创建过程包括从PDF文档中提取文本、清理和格式化数据、去重和过滤非英语内容。数据集的用途主要是文本生成任务,特别是在医疗领域的自然语言处理应用中。
The Clinical Guidelines Dataset is a novel corpus containing 47,000 clinical practice guidelines, sourced from 17 high-quality online medical resources. It constitutes a critical component of the original training corpus for the Meditron-70B large language model. The dataset is compiled in English, spanning diverse medical disciplines and global geographic contexts. Its structured format includes fields such as id, source, title, clean_text, raw_text, url, and overview. The dataset creation workflow involves extracting text from PDF documents, cleaning and formatting the data, deduplication, and filtering out non-English content. This dataset is primarily intended for text generation tasks, particularly for natural language processing applications in the healthcare domain.
数据集概述
数据集名称
- Clinical Guidelines
数据集描述
- Clinical Guidelines 是一个包含47K临床实践指南的新数据集,来源于17个高质量的在线医疗资源。该数据集是Meditron大型语言模型原始训练语料库的关键组成部分。公开发布的子集包含37K篇文章,这些文章来自允许内容重新分发的9个资源。
数据集特征
- id: 唯一标识符,字符串类型
- source: 来源标签,字符串类型
- title: 文章标题,字符串类型
- clean_text: 清洗和格式化的文章文本,字符串类型
- raw_text: 未处理的抓取文章文本,字符串类型
- url: 文章URL,字符串类型
- overview: 文章的简短摘要或摘要,字符串类型
数据集用途
- 该数据集主要用于文本生成任务,特别是在临床实践指南的上下文中。它可用于训练语言模型和其他医疗保健领域的自然语言处理应用。
数据集来源
- 数据集来源于17个全球认可的医疗实体,包括CCO, CDC, CMA, ICRC, NICE, PubMed, SPOR, WHO和WikiDoc。
数据集处理
- PDF文档通过GROBID转换为文本。数据清洗过程包括排除无关或重复内容,如URL、参考文献、图表分隔符和格式错误的字符。文本标准化为统一格式,所有样本通过标题匹配去重,过滤掉过短或非英文的文章。
数据集限制
- 数据集主要为英文,且偏向于英语区域。虽然包括了WHO和ICRC的低资源设置指南,但仍需进一步工作以涵盖更多样化的背景。此外,指南内容截至2023年8月,需定期重新抓取以更新内容。
数据集许可证
- Common Crawl Foundation Terms of Use




