遇见数据集
官方服务:

资源简介:

该数据集被用于评估模型在生物医学领域识别相似或不同论文的能力。在此数据集上,模型的F1_max得分接近完美,达到了0.97。这项任务的目的是评估句子相似性。

This dataset is utilized to evaluate models' ability to recognize similar or dissimilar papers in the biomedical domain. On this dataset, models achieve a near-perfect F1_max score of 0.97. The objective of this task is to assess sentence similarity.

提供机构:
Hugging Face
搜集汇总
数据集介绍
CVD 数据集图片
背景与挑战
背景概述
该数据集是一个心血管疾病(CVD)相关的学术摘要集合,包含186,337行文本数据,主要用于对比学习和混合专家模型的向量嵌入研究。数据涵盖心血管疾病与COVID-19的关联、血栓风险和治疗效果等主题,支持文本分析和句子相似性任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务