遇见数据集

细胞与基因治疗产业链企业智能画像与多维特征识别模型训练数据

收藏
浙江省数据知识产权登记平台2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

本数据集旨在构建细胞与基因治疗产业链企业智能画像与多维特征识别模型训练语料,依托自然语言处理技术执行命名实体识别与多维特征提取,生成涵盖链路定位、技术特征、壁垒评估及成长潜力等维度的结构化标注语料。 细胞与基因治疗作为“十五五”未来产业,产业链涵盖基因编辑、病毒载体、CAR-T、干细胞、基因药物等数千家企业,技术能力、创新水平与成长潜力高度分散且信息碎片化,传统人工调研难以系统量化企业多维画像,制约精准招商与投资筛选。上下游技术路线与供应链关系等核心信息缺乏结构化标注语料,无法支撑智能化企业匹配与决策分析。 三大应用场景:①产业布局与精准招商评估——依托画像标签与关联指数精准识别匹配区域产业定位的目标企业,辅助差异化招商策略与产业补链强链规划;②投资价值与技术壁垒分析——基于技术特征与壁垒指数、潜力指数系统评估企业成长空间与投资风险等级,提升尽调效率与投资决策准确性;③产业链协同与供需匹配管理——借助画像数据精准匹配技术供需双方,识别互补型合作伙伴,促进上下游协同创新。数据同时可为细胞与基因治疗垂类大语言模型提供产业知识微调语料。所有数据均经过企业名称脱敏处理,移除个人及商业敏感信息。 一、加工前数据说明: 本数据集旨在构建细胞与基因治疗产业链企业智能画像与多维特征识别模型训练语料。原始企业描述文本经脱敏处理,企业名称统一替换为不可逆标识符,移除个人及商业敏感信息。 二、数据处理规则: 数据处理遵循“体系先行、画像标注、特征融合”三步法。①体系先行——预定义细胞与基因治疗产业链多维画像标注体系,覆盖链路定位(基础层/技术层/应用层共14个细分环节)、形态分类、行为特征、指数评估四类标注维度;②画像标注——依托BERT预训练模型进行NER实体识别与语义角色标注,通过预构建产业知识图谱自动推断链路定位与组织形态,综合多维特征交叉计算关联指数、壁垒指数与潜力指数,由行业标注专家审核校验;③特征融合——抽取核心业务实体与技术术语组合成“核心词”特征串,融合多维画像标签生成企业综合画像。 三、加工后数据内容: 结构化“文本-多维画像”标注数据,包含脱敏企业描述文本、实体识别、核心词、链路定位、形态标签、行为特征、关联指数、壁垒指数、潜力指数与画像融合标签。

创建时间:
2026-07-12
搜集汇总
数据集介绍
细胞与基因治疗产业链企业智能画像与多维特征识别模型训练数据 数据集图片
背景与挑战
背景概述
本数据集为细胞与基因治疗产业链企业智能画像与多维特征识别模型提供结构化训练语料,通过自然语言处理和BERT模型进行实体识别与特征提取,生成包含链路定位、技术特征、壁垒评估、成长潜力等标签的脱敏数据。这些数据旨在支持精准招商、投资分析及产业链协同等场景,并可助力垂类大语言模型的产业知识微调,以解决行业信息碎片化问题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务