遇见数据集

CSL

收藏
OpenCSG2024-03-21 更新2026-01-19 收录
官方服务:

资源简介:

CSL 数据包含 2010-2020 年发表的中文核心期刊论文元信息(标题、摘要、关键词、学科和门类),用于构建多种NLP任务。 本项目设计了16个instructions包含文本生成、关键词提取、文本摘要和文本分类等任务。

The CSL dataset contains metadata (title, abstract, keywords, disciplines and categories) of Chinese core journal papers published between 2010 and 2020, which is used to construct various NLP tasks. This project designs 16 instructions covering tasks including text generation, keyword extraction, text summarization and text classification.

提供机构:
billionaire
创建时间:
2024-03-21
搜集汇总
数据集介绍
CSL 数据集图片
背景与挑战
背景概述
CSL是一个大规模中文科学文献数据集,包含约39.6万篇2010-2020年核心期刊论文的元信息(标题、摘要、关键词等),并标注了13个门类和67个学科标签。该数据集设计用于支持多种NLP任务,如文本摘要、关键词生成和文本分类,并提供了预训练语料和基准任务,是中文科学文献处理的重要资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务