Datasets for analysis of co-occurrence of cell lines, basal media and supplementation in Open Access biomedical literature
收藏资源简介:
This dataset contains three key pieces of data: 1. journal-list-issn.csv : contains a list of journal names and ISSNs that our corpus was limited to. 2. mediaQueriesMendeley.csv: contains a list of 39 distinct queries we used to search the corpus, all referencing one of 27 unique basal medias. 3. The folder 'Open Access sentences' includes 4 partitioned parquet files that together comprise a dataframe of 15,424 sentences that appeared in one of the journals and had a hit for one of the basal medias. The dataframe is structured as 'sentence', 'pii', 'year'.
本数据集包含三类核心数据: 1. `journal-list-issn.csv`:收录了本语料库限定收录的期刊名称与国际标准期刊号(ISSN)。 2. `mediaQueriesMendeley.csv`:收录了39条用于检索本语料库的独立检索式,所有检索式均指向27种独特的基础媒体。 3. 名为"Open Access sentences"的文件夹包含4个分区Parquet文件,这些文件共同构成了一个包含15424条语句的数据框:这些语句均来自上述限定期刊之一,且命中了某一基础媒体。该数据框的字段结构为:`sentence`(语句)、`pii`(出版者项目标识符,Publisher Item Identifier)、`year`(发表年份)。




