CSL
收藏官方服务:
资源简介:
CSL 数据包含 2010-2020 年发表的中文核心期刊论文元信息(标题、摘要、关键词、学科和门类),用于构建多种NLP任务。 本项目设计了16个instructions包含文本生成、关键词提取、文本摘要和文本分类等任务。
The CSL dataset contains metadata (title, abstract, keywords, disciplines and categories) of Chinese core journal papers published between 2010 and 2020, which is used to construct various NLP tasks. This project designs 16 instructions covering tasks including text generation, keyword extraction, text summarization and text classification.
提供机构:
billionaire创建时间:
2024-03-21
搜集汇总
数据集介绍

背景与挑战
背景概述
CSL是一个大规模中文科学文献数据集,包含约39.6万篇2010-2020年核心期刊论文的元信息(标题、摘要、关键词等),并标注了13个门类和67个学科标签。该数据集设计用于支持多种NLP任务,如文本摘要、关键词生成和文本分类,并提供了预训练语料和基准任务,是中文科学文献处理的重要资源。
以上内容由遇见数据集搜集并总结生成



