登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
taln-ls2n/SSI
taln-ls2n/SSI
收藏
Hugging Face
2023-06-06 更新
2024-03-04 收录
数据链接:
https://hf-mirror.com/datasets/taln-ls2n/SSI
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- task_categories: - text-classification language: - en ---
应用场景:
提供机构:
taln-ls2n
原始信息汇总
数据集概述
任务类别
文本分类
语言
英语
相关数据集
taln-ls2n/inspec
自然语言处理
文献数据挖掘
Inspec是一个用于基准测试关键词提取和生成模型的数据集。该数据集包含2000篇从Inspec数据库中收集的科学论文摘要,关键词由专业索引员在不受控环境中标注。数据集分为训练、验证和测试三个部分,并提供了每个部分的文档数量、单词数量、关键词数量及其分类统计。数据集的文本预处理使用了spacy和nltk工具,关键词分类采用了PRMU方案。
Hugging Face
2022-07-21 更新
97
0
taln-ls2n/termith-eval
关键短语提取
自然语言处理
TermITH-Eval是一个用于关键词提取和生成模型基准测试的数据集。该数据集包含400篇法文科学论文的摘要,这些摘要来自法国科学和技术信息研究所的FRANCIS和PASCAL数据库。关键词由专业索引员在非受控环境下标注,并根据PRMU方案对参考关键词进行了分类。数据集还提供了文本预处理和词干提取的详细信息。
Hugging Face
2022-09-23 更新
24
0
taln-ls2n/semeval-2010-pre
文献数据挖掘
自然语言处理
Preprocessed SemEval-2010 Benchmark数据集是一个用于关键词提取和生成模型基准测试的数据集。该数据集包含244篇来自ACM数字图书馆的全文科学论文,关键词由读者和作者共同标注。数据集提供了四个不同级别的文档预处理,从原始文本到使用无监督摘要技术进一步精简的文本。数据集分为训练集和测试集,并提供了详细的统计信息和数据字段,包括文档的唯一标识符、标题、摘要、不同预处理级
Hugging Face
2022-09-23 更新
21
0
taln-ls2n/kptimes
文献数据挖掘
新闻信息处理
KPTimes是一个用于关键词提取和生成模型基准测试的数据集。该数据集包含290K篇英文新闻文章,来源于《纽约时报》和《日本时报》。关键词由编辑以半自动方式标注,即编辑修订算法提出的关键词集并提供额外的关键词。数据集还使用了PRMU方案对参考关键词进行分类。文本预处理使用spacy进行,词干提取使用nltk的Porters stemmer实现。数据集包含训练、验证和测试集,每个集都有详细的统计信息
Hugging Face
2024-04-08 更新
26
0
taln-ls2n/pubmed
生物医学
文献数据挖掘
--- annotations_creators: - unknown language_creators: - unknown language: - en license: - unknown multilinguality: - monolingual size_categories: - 1k<n<10k task_categories: - text-generation task_id
Hugging Face
2022-10-26 更新
21
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广