Data from: Gut microbiota dynamics during dietary shift in Eastern African cichlid fishes|肠道微生物数据集|鱼类生态数据集
收藏MAV-VID, Drone-vs-Bird, Anti-UAV
本研究涉及三个数据集:MAV-VID、Drone-vs-Bird和Anti-UAV,总计包含241个视频,共计331,486张图像。这些数据集由杜伦大学创建,用于无人机视觉检测和跟踪的研究。数据集内容丰富,包括从地面和无人机搭载的摄像头捕获的图像,涵盖了多种环境和条件。创建过程中,数据集经过精心标注和处理,以确保数据质量。这些数据集主要用于评估和改进无人机检测和跟踪技术,特别是在复杂环境和动态场景中的应用。
arXiv 收录
中文高质量大模型多轮对话SFT数据集
该数据集来源于晴数智慧LLM多领域超自然SFT多轮对话文本数据集。该数据集包含97184轮中文自然对话句子,涉及【家庭生活、教育医疗、军事战争、科学技术、气候环境、人文科学、商业经济、数码产品、体育竞技、休闲娱乐、衣食住行、艺术美术、政治法律、职业发展、宗教信仰】15个主题。领域覆盖多样,也可以单独抽取相关领域的数据进行领域SFT。本次开源的部分数据,由来自中国的644名不同ID的采集人独家贡献,北京晴数智慧科技有限公司进行授权采集。每组对话由两位采集人围绕一个主题展开,上下文对话与当前的内容逻辑相关。适用于训练大模型多轮对话 (back and forth conversation)、上下文逻辑推理能力,以及端到端对话大模型。
OpenDataLab 收录
FLIR Dataset
该数据集主要提供三种类型的热成像图像:训练集包含8862张热成像图像,验证集包含1366张热成像图像,视频集包含4224张热成像图像。这些图像被用于训练YOLOv3检测器,并在验证集上报告了mAP。视频集用于跟踪检测到的对象。
github 收录
TCM-SD
TCM-SD数据集是首个公开的大规模证型辨识基准,由北京理工大学计算机科学与技术学院创建。该数据集包含54,152条真实世界的临床记录,涵盖148种证型,旨在通过自然语言处理技术推动中医理论的实证研究。数据集的创建过程涉及从网站爬取大量未标记文本,构建中医领域特定的预训练语言模型ZY-BERT。TCM-SD数据集的应用领域主要集中在中医诊断与治疗系统中,特别是证型辨识任务,以解决中医领域数据驱动AI技术的进一步发展需求。
arXiv 收录
Anti-UAV
Anti-UAV数据集由中国科学院大学创建,专注于无人机跟踪研究。该数据集包含318对RGB-T视频,总计超过580,000个手动标注的边界框,适用于长距离无人机跟踪。数据集内容丰富,包括多种场景和光照条件下的视频序列,支持单模态和多模态无人机跟踪。创建过程中,数据集通过精细的标注策略确保高质量。该数据集的应用领域主要集中在无人机监控和跟踪技术的发展,旨在解决无人机在复杂环境中的状态感知问题。
arXiv 收录