Title/Abstracts from the Semantic Scholar Corpus
收藏资源简介:
该数据集包含来自Semantic Scholar Corpus的标题/摘要对。我尝试过滤掉任何生物医学领域的论文,因为该领域的标题/摘要数据集已经存在。尽管如此,数据集仍包含来自多个领域的论文。数据集包含580万个数据点,提供两种形式:一个包含12个parquet文件的zip文件,约2.5GB压缩,6GB未压缩;一个sqlite数据库版本,1个文件,2.5GB压缩,7.5GB未压缩。
This dataset comprises title/abstract pairs sourced from the Semantic Scholar Corpus. Efforts were made to filter out papers from the biomedical domain, as datasets of titles and abstracts in this field already exist. Nonetheless, the dataset still includes papers from a variety of disciplines. It contains 5.8 million data points and is available in two formats: a zip file containing 12 parquet files, approximately 2.5GB compressed and 6GB uncompressed; and a sqlite database version, consisting of a single file, 2.5GB compressed and 7.5GB uncompressed.
数据集概述
1. Title/Abstracts from the Semantic Scholar Corpus
- 数据内容: 包含来自Semantic Scholar Corpus的标题/摘要对。
- 过滤条件: 尝试过滤掉生物医学领域的论文,但仍包含多个领域的论文。
- 数据量: 约580万数据点。
- 数据格式: 提供两种形式:
- 压缩文件包含12个parquet文件,压缩后约2.5GB,解压后约6GB。
- SQLite数据库版本,单个文件,压缩后2.5GB,解压后7.5GB。
2. Title/Abstracts from ArXiv
- 数据内容: 包含ArXiv上所有论文的标题/摘要对,涵盖1991年至2019年7月5日。
- 数据量: 总计约221万数据点,细分如下:
- 量化金融:约1万数据点
- 量化生物学:约2.6万数据点
- 数学:约41.7万数据点
- 物理学:约157万数据点
- 计算机科学:约22.1万数据点
- 机器学习:约9万数据点
- 数据格式: gzipped parquet格式。
3. Paper Section Summaries Using Structured Abstracts
- 数据内容: 基于结构化摘要的论文各部分摘要。
- 数据来源:
- 一个数据集来自Semantic Scholar Corpus,包含约110万篇论文,约230万数据点。
- 另一个数据集来自ArXiv,包含3944篇论文,6229数据点。
- 数据格式: gzipped parquet格式。
4. 数据访问与处理
- 访问方式: 使用Pandas直接读取parquet文件,无需解压gzipped文件。
- 示例代码: python import pandas as pd df = pd.read_parquet(file.parquet.gz)
数据集特点
- 数据过滤: 所有数据集均已过滤掉数字和特殊字符,专注于概念性而非事实性摘要。
- 领域专注: 主要关注计算机科学概念的摘要,不同于多数生物医学领域的科学摘要数据集。
- 摘要类型: 不同于常见的标题/摘要对,本数据集专注于研究论文各部分的摘要。




