MMusSetMMusSet是一个由山西大学构建的新型多模态音乐数据集,包含33300条样本,每个样本由一幅场景图像、一个故事文本、一段音乐字幕和一段音乐作品组成。该数据集通过多智能体协作的数据标注工作流程构建,旨在促进多模态音乐生成研究,使得音乐创作更加易于接触。
基于公开基准数据集生成的模糊超图数据基于公开基准数据集生成的模糊超图数据主要面向基于多模糊超图的协同表示与决策研究,为该方向研究提供性能验证数据基。该数据基于从从UCI数据库中下载的28个基准数据集,针对每个数据集,使用MATLAB内置Fuzzy C-means (FCM)算法生成31个模糊聚类结果。模糊聚类结果中的一个类簇对应于一条超边,模糊隶属度对应于节点属于超边的隶属度。数据主要记录了所生成的模糊超边,数据矩阵中的元素含义为对应样本属于对应超边的模糊隶属度。该数据集于2022年6月1日,在windows10系统上通过运行matlab程序处理得到,数据量272MB。
基于肝胆胰的多模态数据集该数据集主要面向肝胆胰相关疾病的医疗研究、智能会诊系统需求建设,其于医院真实诊疗场景中产生,主要记录了肝癌、胰腺癌等肝胆胰疾病患者的多模态信息,包括 CT 和 MRI 影像数据,涵盖初步诊断、手术情况及出院摘要的病历信息,以及血常规 + CRP、癌胚抗原测定、血清丙氨酸氨基转移酶等多项指标的生化检查数据。数据按疾病、患者 ID 分层构建目录,疾病文件夹下含对应患者的病历 Excel 文件及 CT、MRI 影像文件。本数据集需审批后共享,上传至医疗会诊平台后,可经智能体处理提取结构化数据,为多智能体协同会诊提供支持。
Chinese PIEA datasets本研究创建了两个中文个性化隐式情感分析(PIEA)数据集,旨在解决现有数据集缺乏用户相关信息的问题。这些数据集包含了用户的属性、社交关系和历史帖子,涵盖了隐式和显式情感。数据集的创建过程结合了大规模语言模型(LLM)和图神经网络(GNN)技术,模拟了读者的反应和情感传播。这些数据集主要应用于个性化隐式情感分析任务,旨在通过引入读者反馈信息,提升作者隐式情感识别的准确性。
中国东北部湿润区0.15度分辨率月气象要素的空间分布数据(2000-2018)中国东北湿润区0.15°分辨率月气象要素数据集(2000-2018)根据逐日站点资料插值而成,气象要素数据包括(月平均温度:temperature、月累积降水量:precipitation、月平均相对湿度:humidity、月平均日照时数:illumination)、一共228个月,包含228个excel文件。
太原市生态环境用水需求特征与多源保障技术方案数据集太原作为典型缺水城市,地下水超采、污废水利用率低与生态环境用水保障之间矛盾突出,非常规水源亟需开发利用,然而目前非常规水源存在研究不足、时空分布不明的问题。太原市生态环境用水需求特征与多源保障技术方案以2021至2022年实测数据为依据,开展缺水城市河流健康评价体系构建、太原市生态需水量计算。主要记录了样方调研太原市九河的植被分布频率、高度、覆盖度等数据;太原市九河的河道状态、水文、水质数据;太原市植被的蒸腾量、人工景观水体的需水量等生态环境用水量计算。
时空事件知识库时空事件知识库涵盖了新闻事件和金融公告等多个领域的结构化事件知识。它以时间、地点和事件类型等维度进行索引,支持多维度的查询与分析。时空事件知识库的数据源自公开的事件数据集、以及从互联网爬取的新闻、报告等相关语料,采集时间为2021年6月至2024年6月。数据采用基于启发式规则标注和人机协同标注两种方式进行加工处理。知识库涵盖了新闻事件、金融公告等领域,共包含116种事件类型和620种事件角色。