遇见数据集

rf100-vl-results

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

RF100-VL 基准测试工件数据集是使用 LibreYOLO 进行 RF100-VL 基准测试时产生的原始输出文件集合。该数据集包含每个数据集的训练配置、每轮次指标、训练日志、GPU 遥测数据、评分输入以及提交文件,旨在使基准测试结果可被独立核查而非仅凭信任。其协议为:在 RF100-VL 的 100 个数据集上,分别对每个数据集微调一个预训练检查点,然后使用 pycocotools 在最大检测数为 500 的条件下对测试集进行评分,并报告未加权平均 AP50:95。每个运行的轮次、批量大小、随机种子和选择指标均由记录的配方严格固定。数据集的目录结构按照模型键和运行 ID 组织,包含状态文件、每个数据集的运行详情、训练统计、评估结果、提交文件以及来源信息。每个运行都包含一个 manifest.json 文件,记录了代码提交、配方哈希、数据集版本锁定等信息,以确保结果的可追溯性。该数据集适用于对象检测模型的基准测试结果验证、可重复性研究以及基准测试协议分析。

RF100-VL Benchmark Artifact Dataset is a collection of raw output files generated when conducting the RF100-VL benchmark using LibreYOLO. This dataset contains training configurations, per-epoch metrics, training logs, GPU telemetry data, scoring inputs, and submission files for each of the 100 datasets in RF100-VL, aiming to enable independent verification of benchmark results without relying solely on trust. Its benchmark protocol specifies that: for each of the 100 datasets in RF100-VL, a pretrained checkpoint is fine-tuned individually on that dataset, then the test set is scored using pycocotools with a maximum detection count of 500, and the unweighted average AP50:95 is reported. The number of epochs, batch size, random seed, and selection metric for each run are strictly fixed by the recorded recipes. The directory structure of this dataset is organized by model key and run ID, and includes status files, run details for each dataset, training statistics, evaluation results, submission files, and provenance information. Each run includes a "manifest.json" file that records information such as code commits, recipe hashes, and dataset version locks to ensure the traceability of results. This dataset is applicable to the verification of object detection model benchmark results, reproducibility research, and benchmark protocol analysis.

创建时间:
2026-08-01
原始信息汇总

RF100-VL 基准测试产物数据集概述

该数据集是 RF100-VL 基准测试在 LibreYOLO 框架下运行所产生的原始工件集合,旨在通过发布完整的训练配置、逐周期指标、日志、GPU 遥测数据、评分输入及提交结果,使基准测试结果可被查验而非仅凭信任。

核心协议

  • 对 RF100-VL 全部 100 个数据集,每个数据集微调一个检查点。
  • 使用 pycocotools 在测试集上以 maxDets=500 进行评分。
  • 报告未加权的平均 AP50:95。
  • 周期数、批大小、种子及选择指标均由每个运行记录中的配方固定。

数据布局

每个运行目录(<model_key>/<run_id>/)包含:

路径 内容
state/manifest.json 生成该运行的代码、配方及数据版本信息
state/summary.json 编排器的运行结果概要
state/logs/ 每个数据集的工人日志
runs/<dataset>/<variant>/ 具体训练配置、逐周期指标(metrics.jsonlresults.csv)、训练日志、最终状态、GPU 遥测数据及摘要
stats/<dataset>.json 用于验证协议符合性的训练统计信息
eval/ 各数据集的评分及原始预测输出
submissions/ 提交 JSON 及 Markdown 报告
provenance/ 配方及数据集版本锁定信息

关键使用说明

  • 优先阅读 manifest.json:该文件记录了 LibreYOLO 与基准测试工具链的精确提交哈希、配方哈希、数据集版本锁定哈希、主机及 GPU 清单,以及各数据集状态计数。所有哈希均为工人实际记录值与上传时推导值的对照,不匹配可直接显现。
  • 无法识别确切提交版本的结果仅被视为“轶事”,不作为证据。

现有运行

运行 ID 模型 状态 数据集数量 用途
20260731-yolov9t-partial yolov9-t 实验性,非正式结果 100 个中仅有 7 个完成训练 仅用于工具链开发与调试
关于 20260731-yolov9t-partial 的特别警告
  • 该运行仅完成了 100 个数据集中的 7 个,提交被明确标记为无效,且不存在覆盖全部数据集的平均 AP 值。
  • 其 GPU 遥测数据有误:多个数据集被打包到同一张卡上,且该版本的采样器将整卡归因于单一数据集,导致 16 个数据集无任何追踪记录,21 个数据集的记录包含同卡其他数据集的工作。
  • 该运行中的数据由多个不同版本的工具链提交产生,manifest.json 中单一的提交哈希无法完整描述所有数据集。

正式基准结果必须满足的条件:在单一组提交下,从干净状态运行全部 100 个数据集。

搜集汇总
数据集介绍
rf100-vl-results 数据集图片
构建方式
该数据集是RF100-VL基准测试战役的原始产物,旨在支持可验证的物体检测模型评估。其构建方式严谨而透明:针对100个RF100-VL数据集中的每一个,使用LibreYOLO框架进行微调,每个数据集配备一个检查点。训练协议固定了迭代次数、批次大小、种子及选择指标,确保实验的可重复性。测试阶段,利用pycocotools(maxDets=500)对每个数据集的测试分割进行评分,并报告未加权的平均AP50:95。每个运行记录均包含完整的配置、逐周期指标、日志、GPU遥测数据及评估结果,且通过manifest.json记录代码、配方及数据的确切版本哈希,确保任何偏差均可见而非被掩盖。
特点
该数据集的核心特点在于其无与伦比的透明度和可追溯性。每个运行目录详细存储了训练配置、逐周期指标、状态文件及GPU遥测数据,使得每一项结果均可追溯至确切的代码提交和数据集版本。特别是,GPU遥测数据以1Hz频率记录,并汇总利用率、功率、空闲时间及归属信息,为性能分析提供了丰富依据。此外,数据集明确标注了实验性运行(如部分运行),警告其不可用于比较,体现了科学严谨性。最终,所有产物以标准化布局组织,便于研究者独立验证结果,而非盲目信任。
使用方法
使用该数据集时,研究者应首先阅读每个运行的manifest.json文件,以确认代码、配方及数据集的精确版本,这是验证结果可靠性的基石。随后,可浏览runs/目录下的逐数据集文件,包括train_config.yaml、metrics.jsonl和results.csv,以复现训练过程或分析性能趋势。评估阶段的结果位于eval/目录,包含预测转储和评分,便于深入分析。数据集还提供了submissions/目录,包含最终提交的JSON和Markdown报告。对于GPU遥测数据,可通过gpu_summary.json快速获取综合信息,或解压gpu_trace.jsonl.gz进行细粒度分析。研究者应遵循协议,避免使用实验性运行的结果进行任何比较。
背景与挑战
背景概述
RF100-VL基准测试结果数据集由LibreYOLO团队开发,旨在为基于视觉的语言(Vision-Language)目标检测模型提供可验证、可复现的基准测试工具。该数据集于2026年发布,其主要研究人员来自LibreYOLO项目组,核心研究问题在于解决深度模型在多样化数据集上评估时缺乏透明性和可重复性的问题。该数据集通过记录完整的训练配置、逐周期指标、日志、GPU遥测数据及评分输入,确保每个结果都能被审查而非轻信,对目标检测领域的基准测试实践产生了深远影响,推动了更严格的科研诚信标准。
当前挑战
该数据集面临的挑战包括:首先,领域内普遍存在的评估不可重复性问题——传统基准测试常因代码版本、配置或硬件差异导致结果无法复现,而RF100-VL通过强制记录所有运行细节来应对,但这一过程本身也带来了巨大挑战,如确保跨100个数据集的一致性训练协议和精确的评分机制。其次,构建过程中遭遇了技术性障碍,例如GPU遥测数据的准确归因问题,早期版本因多数据集共享GPU导致数据不完整或错误,迫使团队改进采样和记录方法。此外,部分运行跨越多个代码版本,使得单一提交记录无法完全代表所有数据集的真实状态,凸显了在长期基准测试中维护版本一致性的艰难。
常用场景
经典使用场景
RF100-VL-results数据集作为目标检测领域基准测试的原始工件集,其核心使用场景在于为RF100-VL基准协议的复现与验证提供详尽的技术支撑。该数据集以LibreYOLO框架实施的训练流程为蓝本,完整收录了跨100个数据集的逐数据集训练配置、逐周期度量指标、运行日志、GPU遥测数据及最终评分条目。研究者可通过解析存储于各运行目录下的manifest.json、train_config.yaml与metrics.jsonl等文件,深度剖析从超参数设定到模型收敛的动态过程,从而在完全透明的条件下复现或交叉验证基准实验结果。此数据集特别适用于那些致力于评估目标检测算法泛化能力、探究多数据集联合训练规律以及优化训练协议的研究工作,其严谨的数据组织结构和完整的元数据记录,使之成为连接实验原始输出与科学结论之间的关键桥梁。
实际应用
在实际工程应用中,RF100-VL-results数据集的价值体现在为工业级目标检测系统的开发提供多场景性能的精细化参照。鉴于RF100-VL涵盖了100个多样化的数据集,其训练工件可为模型选型在特定领域(如安防监控、自动驾驶、工业质检等)提供实证支持,工程师可通过查阅相应数据集子目录下的评分与日志,快速评估候选模型在目标任务上的适配度与潜在瓶颈。此外,GPU遥测数据可用于优化推理部署阶段的硬件资源规划,例如通过功率与利用率统计来指导边缘端与云端环境的性能预算分配。该数据集亦可作为持续集成/持续部署流水线中自动化回归测试的基准输入,利用其结构化的状态摘要与结果文件,实现在更新模型或框架后自动比对性能漂移,从而保障系统升级的稳定性与可预期性,将研究阶段的严谨性无缝迁移至实际生产环境的验证环节。
衍生相关工作
围绕该数据集,可衍生出一系列与前序工作紧密关联的研究方向。其直接的衍生物是RF100-VL基准协议的持续演进与扩展,如同类基准以类似结构化工件发布结果,进而催生更为完善的实验追踪与可重复性标准。该数据集所倡导的‘逐结果可查而非轻信’理念,将推动学术社区开发更多自动化审计工具,例如用于检测训练配置文件差异、分析GPU遥测异常或校验提交哈希一致性的框架,这些工具本身即可成为独立的研究课题。此外,基于其中的逐周期度量与训练日志,可开展对目标检测训练动态学的深入分析,例如学习率调度与收敛行为的关系、多数据集联合训练的干扰现象等,这些分析可产出经验性研究论文,为训练策略的优化提供数据驱动指导。最终,该数据集或可作为大型语言模型辅助实验管理领域(如自动配置调优、故障诊断)的训练与评估材料,拓展其在自动化机器学习方向的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务