afg1/litscan-epmc-subset
收藏资源简介:
该数据集是[afg1/epmc-oa-subset](https://huggingface.co/datasets/afg1/epmc-oa-subset)的一个子集,源自[Europe PMC开放获取子集](https://europepmc.org/downloads/openaccess)中的约590万篇文章。通过结合LitScan识别的PMCIDs,从完整的开放获取子集中提取了约960个parquet文件,最终形成了一个包含约100万篇关于ncRNA的开放获取全文文章的数据集。该数据集主要用于领域特定文本的预微调,类似于NVIDIA的ChipNeMo模型所做的领域适应。计划在该数据集上微调一些模型,如TinyLlama,以生成用于RAG的嵌入或进一步的下游任务微调,如摘要生成。数据集的局限性包括JATS解析可能导致的文本缺失或标签残留,以及LitScan在识别RNA IDs时的高误报率。
该数据集是[afg1/epmc-oa-subset](https://huggingface.co/datasets/afg1/epmc-oa-subset)的一个子集,源自[Europe PMC开放获取子集](https://europepmc.org/downloads/openaccess)中的约590万篇文章。通过结合LitScan识别的PMCIDs,从完整的开放获取子集中提取了约960个parquet文件,最终形成了一个包含约100万篇关于ncRNA的开放获取全文文章的数据集。该数据集主要用于领域特定文本的预微调,类似于NVIDIA的ChipNeMo模型所做的领域适应。计划在该数据集上微调一些模型,如TinyLlama,以生成用于RAG的嵌入或进一步的下游任务微调,如摘要生成。数据集的局限性包括JATS解析可能导致的文本缺失或标签残留,以及LitScan在识别RNA IDs时的高误报率。
LitScan EPMC Subset 数据集概述
数据集来源
- 该数据集是 afg1/epmc-oa-subset 的一个子集,后者源自 Europe PMC open access subset,包含约 590 万篇文章。
数据集构建
- 从完整的 OA 子集中提取约 960 个 parquet 文件,并与通过 LitScan 找到的 PMCIDs 列表进行匹配,这些 PMCIDs 对应于从 RNAcentral 搜索的约 960 万个 ID,主要讨论非编码 RNA(ncRNA)。
- 最终得到约 100 万篇关于 ncRNA 的开放获取全文文章。
主要用途
- 该数据集主要用于领域特定文本的预微调,类似于 NVIDIA 的 ChipNeMo 模型 的领域适应。
计划应用
- 计划在该数据集上微调一些模型,如 TinyLlama,这些模型可用于生成嵌入向量(如 RAG)或进一步在摘要等下游任务上进行微调。
局限性
- 数据集中的 parquet 文件是从 JATS 解析而来,可能存在文本缺失或包含奇怪标签的情况,尽管这些情况较为罕见。
- LitScan 存在较高的假阳性率,尤其是对于一些较为通用的 RNA ID,因此数据集中可能包含一些与 RNA 无关的文章,如混凝土、雌性小鼠、循环神经网络等。




