官方服务:
资源简介:
Learn to create dataset
学习创建数据集(Dataset)
应用场景:
创建时间:
2020-09-21
相关数据集
HR-Extreme
HR-Extreme数据集是由曼彻斯特大学和湖南大学等机构共同创建的高分辨率极端天气预测数据集。该数据集基于NOAA的HRRR数据,包含17种极端天气类型,如强风、暴雨、冰雹、龙卷风和极端温度等。数据集的创建过程包括从NOAA的Storm Events Database和Storm Prediction Center收集数据,并使用DBSCAN算法进行聚类处理。HR-Extreme数据集旨在提高极
arXiv2024-09-28 更新6491
Forest Inspection Dataset
森林检查数据集是一个结合了真实世界记录和模拟器收集的合成数据的大型航空数据集,旨在解决森林监测中的语义分割、深度估计和场景理解等任务。该数据集包含密集标注的语义图像,包括倒树类别,以及深度和定位信息。数据集的创建涉及使用Adobe Photoshop CS6进行手动标注,以及在Unreal Engine 4中创建虚拟环境。此外,数据集还包括不同光照条件、高度和记录角度的记录,适用于多种场景的训练和
arXiv2024-03-11 更新540
mrinaldi/Proposte_LLM
该数据集提案旨在创建用于训练和微调大型语言模型(LLM)的高质量、多语言数据集,特别是针对意大利语。提案包括创建问答对数据集、文本理解数据集以及推理和思维链数据集。作者强调了当前数据集的问题,如过度依赖英语和文化偏见,并提出了通过众包等方式收集高质量数据的建议。
Hugging Face2024-03-03 更新210
ReSyn
ReSyn数据集是由上海交通大学和腾讯Youtu Lab联合创建的一个大规模图像恢复数据集,旨在解决现有数据集在图像复杂度分布上的不平衡问题。该数据集包含12000张图像,涵盖了从0.25K到4K的多种分辨率,其中30%为高质量的合成图像。数据集的创建过程中,采用了基于灰度共生矩阵(GLCM)的图像复杂度评估方法进行筛选,以确保图像复杂度的平衡分布。ReSyn数据集主要应用于图像恢复任务,旨在提升
arXiv2024-12-05 更新1600
SlideImages
SlideImages是一个专为教育图像分类任务设计的数据集,由TIB – 莱布尼茨科技信息中心创建。该数据集包含从Wikimedia Commons和AI2D数据集等不同来源收集的训练数据,以及从教育幻灯片中收集的测试数据,共计691张图像。SlideImages旨在解决教育图像分类的挑战,特别是针对非传感器衍生的图像,如插图、数据可视化等。数据集的创建过程中,特别注意了图像的多样性和代表性,确
arXiv2020-01-19 更新310



