Tiansve/arxiv-cs-subfield
收藏资源简介:
这是一个平衡的单标签分类数据集,包含最近arXiv摘要,涵盖六个重叠的计算机科学子领域。每行数据包含一篇论文的标题和摘要,以及从其arXiv primary_category派生的标签。
--- language: - 英语 license: CC BY 4.0(知识共享署名4.0协议) task_categories: - 文本分类(text-classification) size_categories: - 1000 < 样本数 < 10000 tags: - arXiv(预印本平台) - 计算机科学 - 摘要 - 多分类 --- # arXiv计算机科学子领域分类数据集 本数据集为经过平衡处理的单标签分类数据集,涵盖近期arXiv平台上六个存在重叠的计算机科学子领域的论文摘要。每条数据包含一篇论文的标题与摘要,以及由其arXiv主分类(primary_category)推导而来的标签。 ## 支持任务 - `文本分类(text-classification)` — 根据论文标题+摘要预测其所属的arXiv子领域。 ## 语言 英语(`en`)。 ## 数据字段 | 字段名 | 数据类型 | 描述 | |---|---|---| | `id` | 字符串 | arXiv标识符(例如`2401.12345v1`) | | `title` | 字符串 | 论文标题,已完成空格标准化处理 | | `abstract` | 字符串 | 论文摘要,已完成空格标准化处理,保留LaTeX格式 | | `text` | 字符串 | 由`title + ". " + abstract`拼接而成,作为模型输入的字段 | | `label` | 字符串 | 人类可读的子领域名称 | | `primary_category` | 字符串 | 原始arXiv主分类 | | `published` | 字符串 | 首次提交至arXiv的ISO格式时间戳 | ## 标签空间 六个目标arXiv分类(`cs.CL`、`cs.LG`、`cs.CV`、`cs.IR`、`cs.AI`、`stat.ML`)分别对应如下人类可读标签: | arXiv主分类 | 标签名 | |---|---| | `cs.CL` | `cl_nlp` | | `cs.LG` | `lg_ml` | | `cs.CV` | `cv_vision` | | `cs.IR` | `ir_retrieval` | | `cs.AI` | `ai_general` | | `stat.ML` | `stat_ml` | ## 数据划分 | 划分集 | 样本数量 | |---|---| | 训练集 | 3292 | | 验证集 | 412 | | 测试集 | 412 | | **总计** | **4116** | 划分方式为按标签分层的80/10/10抽样,随机种子设为`random_state=42`。 ## 数据来源 - 借助`arxiv` Python包的`Client(delay_seconds=3.5)`接口查询arXiv API获取数据。 - 时间范围:2023-01-01至2025-12-31。 - 过滤规则:仅保留主分类与查询分类一致的论文以确保标签明确,随后将每个类别的样本下采样至最小类别的规模以实现类别平衡。 ## 标注流程 标签直接取自arXiv的`primary_category`,未进行人工标注。例如`cs.AI`与`cs.LG`之间的边界样本本身存在固有噪声,这也正是该任务的趣味所在。 ## 局限性 - 将本质上属于多标签的问题简化为单标签分类(大多数论文会被标注多个arXiv分类)。 - 分类边界本身就存在固有噪声。 - 不存在时间泛化划分——训练、验证、测试集均来自同一时间窗口。 ## 许可协议 arXiv摘要遵循arXiv的非专有许可协议。本数据集重新分发元数据与摘要仅用于非商业研究用途,每条数据均保留arXiv的`id`以便用户核验原始来源。 ## 引用格式 bibtex @misc{arxiv-cs-subfield, author = { Tiansve }, title = { Tiansve/arxiv-cs-subfield }, year = 2026, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/Tiansve/arxiv-cs-subfield}} }




