Additional file 5 of Kangaroo mother care: EN-BIRTH multi-country validation study|袋鼠式护理数据集|数据质量保证数据集
收藏中国区域地面气象要素驱动数据集 v2.0(1951-2024)
中国区域地面气象要素驱动数据集(China Meteorological Forcing Data,以下简称 CMFD)是为支撑中国区域陆面、水文、生态等领域研究而研发的一套高精度、高分辨率、长时间序列数据产品。本页面发布的 CMFD 2.0 包含了近地面气温、气压、比湿、全风速、向下短波辐射通量、向下长波辐射通量、降水率等气象要素,时间分辨率为 3 小时,水平空间分辨率为 0.1°,时间长度为 74 年(1951~2024 年),覆盖了 70°E~140°E,15°N~55°N 空间范围内的陆地区域。CMFD 2.0 融合了欧洲中期天气预报中心 ERA5 再分析数据与气象台站观测数据,并在辐射、降水数据产品中集成了采用人工智能技术制作的 ISCCP-ITP-CNN 和 TPHiPr 数据产品,其数据精度较 CMFD 的上一代产品有显著提升。 CMFD 历经十余年的发展,其间发布了多个重要版本。2019 年发布的 CMFD 1.6 是完全采用传统数据融合技术制作的最后一个 CMFD 版本,而本次发布的 CMFD 2.0 则是 CMFD 转向人工智能技术制作的首个版本。此版本与 1.6 版具有相同的时空分辨率和基础变量集,但在其它诸多方面存在大幅改进。除集成了采用人工智能技术制作的辐射和降水数据外,在制作 CMFD 2.0 的过程中,研发团队尽可能采用单一来源的再分析数据作为输入并引入气象台站迁址信息,显著缓解了 CMFD 1.6 中因多源数据拼接和气象台站迁址而产生的虚假气候突变。同时,CMFD 2.0 数据的时间长度从 CMFD 1.6 的 40 年大幅扩展到了 74 年,并将继续向后延伸。CMFD 2.0 的网格空间范围虽然与 CMFD 1.6 相同,但其有效数据扩展到了中国之外,能够更好地支持跨境区域研究。为方便用户使用,CMFD 2.0 还在基础变量集之外提供了若干衍生变量,包括近地面相对湿度、雨雪分离降水产品等。此外,CMFD 2.0 摒弃了 CMFD 1.6 中通过 scale_factor 和 add_offset 参数将实型数据化为整型数据的压缩技术,转而直接将实型数据压缩存储于 NetCDF4 格式文件中,从而消除了用户使用数据时进行解压换算的困扰。 本数据集原定版本号为 1.7,但鉴于本数据集从输入数据到研制技术都较上一代数据产品有了大幅的改变,故将其版本号重新定义为 2.0。
国家青藏高原科学数据中心 收录
resume-conversations-llm-training
这是一个高质量的职业对话数据集,适用于构建能够理解简历、职业和职业成长的AI。数据集以结构化的JSONL格式提供,包含关于职业发展、技术趋势和专业技能的现实问答,非常适合开发者和AI实践者用于聊天机器人、职业咨询工具或LLM微调。
huggingface 收录
PlantVillage
在这个数据集中,39 种不同类别的植物叶子和背景图像可用。包含 61,486 张图像的数据集。我们使用了六种不同的增强技术来增加数据集的大小。这些技术是图像翻转、伽玛校正、噪声注入、PCA 颜色增强、旋转和缩放。
OpenDataLab 收录
中国1千米分辨率逐日全天候地表土壤水分数据集(2003-2024)
(1、2025年5月19日对V2.0版本进行了最新更新,本次更新将数据集覆盖时段延伸至2024年年末。 2、2023年5月数据更新提示:本数据集的V2.0版本目前已经更新至2022年底,同时填补了2011年10月至2012年6月的空白时段,V2.0版本整体估算结果与V1.0原始版本相同,已下载的V1.0版本数据亦可放心使用,详情请参阅附件"2023年5月数据更新说明.pdf"。) 地表土壤水分(SSM)是了解地球表面水文过程的关键参数。长期以来,被动微波(PM)技术一直是在卫星遥感尺度上估算SSM的主要选择,而另一方面,PM观测的粗分辨率(通常>10 km)阻碍了其在更细尺度上的应用。虽然已经提出了定量研究,以缩小基于卫星PM的SSM的规模,但很少有产品可供公众使用,以满足1km分辨率和全天候条件下每日重访周期的要求。因此,在本研究中,我们在中国开发了一种具有所有这些特征的SSM产品。该产品是通过在36 km处对基于AMSR-E和AMSR-2的SSM进行降尺度生成的,涵盖了2003-2019年间两台辐射计的所有在轨时间。MODIS光学反射率数据和在多云条件下填补空白的每日热红外地表温度(LST)是降尺度模型的主要数据输入,以实现SSM降尺度结果的“全天候”质量。4月至9月期间,这一开发的SSM产品的每日图像在全国范围内实现了准完全覆盖。在其他月份,与最初的每日PM观测值相比,开发产品的全国覆盖率也大大提高。我们根据2000多个专业气象和土壤水分观测站的现场土壤水分测量结果对该产品进行了评估,发现该产品的精度在晴空到多云的所有天气条件下都是稳定的,无偏RMSE的站平均值在0.053 cm3/cm3到0.056 cm3/cm3之间。此外,评估结果还表明,开发的产品在1km分辨率下明显优于广为人知的SMAP Sentinel(主被动微波)组合SSM产品。这表明,我们开发的产品在改善未来水文过程、农业、水资源和环境管理相关调查方面可能带来的潜在重要效益。
国家青藏高原科学数据中心 收录
PASCAL VOC 2007
这个挑战的目标是从现实场景中的许多视觉对象类别中识别对象(即不是预先分割的对象)。它基本上是一个监督学习问题,因为它提供了一组标记图像的训练集。已选择的 20 个对象类别是: 人:人 动物:鸟、猫、牛、狗、马、羊 交通工具:飞机、自行车、船、公共汽车、汽车、摩托车、火车 室内:瓶子、椅子、餐桌、盆栽、沙发、电视/显示器 将有两个主要比赛和两个较小规模的“品酒师”比赛。内容:提供的训练数据由一组图像组成;每个图像都有一个注释文件,为图像中存在的 20 个类别之一中的每个对象提供一个边界框和对象类别标签。请注意,来自多个类的多个对象可能出现在同一图像中。
OpenDataLab 收录
