遇见数据集

产业异构知识抽取与智能表述范式数据集

收藏
官方服务:

资源简介:

本数据集来源于对 ProgrammableWeb 的真实服务数据进行抓取与结构化整理,由python爬虫从网站中获取,围绕“服务描述文本 + 标签协同关系”两类信息组织数据。遵循“权威性优先、可追溯、多源交叉验证”原则,优先采用平台原始条目,结合标签共现统计构建标签协同图,从源头保证可核查性与一致性。依据研究需求将标签与服务描述进行统一编码,形成可直接用于多标签学习的样本集。此数据用于产业服务数据分类与标引研究,共200.1MB容量。

提供机构:
哈尔滨工业大学
搜集汇总
背景与挑战
背景概述
该数据集通过Python爬虫从ProgrammableWeb平台获取真实服务数据,围绕“服务描述文本与标签协同关系”组织信息,并依循权威性优先、可追溯及多源交叉验证原则构建标签协同图,最终编码形成适用于多标签学习的样本集,容量为200.1MB,旨在服务于产业服务数据的分类与标引研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务