遇见数据集

reuse-vs-recraft-e16-results

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集为 reuse-vs-recraft — E16 battery results,即来自 E16 scope-ladder 行为评估电池的原始记录文件。数据集基于 Qwen2.5-VL-7B-Instruct 模型,包含四个 LoRA 分支(arms),于 2026-08-16 完成评估。数据内容包括:每个分支的 _eval/ 目录,内含 75-slice 修复记录;PhD damage-panel 记录文件(两部分);8x200 基准测试套件记录;litmus/stage 日志;以及每个分支的 run.json 训练侧车文件。此外,results_manifest.json 文件提供了快照中每个文件的 SHA256 哈希值。数据集以增量方式上传,最终快照包含所有分片。该数据集适用于模型修复效果评估、基准测试结果分析、训练日志研究以及 LoRA 分支对比分析等场景。

This dataset is the reuse-vs-recraft — E16 battery results, which are the original record files from the E16 scope-ladder behavior assessment battery. The dataset is based on the Qwen2.5-VL-7B-Instruct model and includes four LoRA branches (arms), evaluated on 2026-08-16. The data content includes: for each branch, a _eval/ directory containing 75-slice repair records; PhD damage-panel record files (two parts); 8x200 benchmark test suite records; litmus/stage logs; and the run.json training sidecar file for each branch. Additionally, the results_manifest.json file provides SHA256 hash values for each file in the snapshot. The dataset is uploaded incrementally, with the final snapshot containing all shards. This dataset is suitable for model repair effect evaluation, benchmark test result analysis, training log research, and LoRA branch comparison analysis.

创建时间:
2026-08-16
原始信息汇总

reuse-vs-recraft — E16 电池测试结果数据集

数据集概述

本数据集收录了 E16 范围阶梯行为测试(scope-ladder behavioural battery)的原始记录文件,测试环境为 Qwen2.5-VL-7B-Instruct 模型,采用 四个 LoRA 分支(arms) 进行实验,评估日期为 2026-08-16

数据集内容

数据集中每个分支对应一个 <arm>_eval/ 目录,具体包含以下内容:

  • 75 切片修复记录:每个分支的修复过程记录
  • 博士损伤面板记录文件:包含两个半部分的完整记录
  • 8x200 基准测试套件:基准测试的完整记录
  • litmus/stage 日志:实验阶段相关日志信息

此外,每个分支还附有对应的 run.json 训练侧车文件(training sidecar)。

数据完整性

  • 数据集中包含 results_manifest.json 清单文件,为快照中的每个文件提供 sha256 哈希值,确保数据完整性和可验证性
  • 数据最初在电池测试运行期间 增量上传,最终快照为清单中列出所有分片的版本

许可协议

本数据集采用 Apache 2.0 开源许可证。

搜集汇总
数据集介绍
reuse-vs-recraft-e16-results 数据集图片
构建方式
该数据集源自E16范围阶梯行为测试套件,旨在评估视觉语言模型在图像修复任务中的表现。构建过程采用Qwen2.5-VL-7B-Instruct作为基础模型,通过四种LoRA适配器分别进行微调,形成独立的实验臂。每个实验臂在2026年8月16日完成评估,生成包含75个切片修复记录、PhD损伤面板记录(两部分)、8x200基准测试套件记录以及试金石/阶段日志的原始文件。所有文件均通过results_manifest.json提供sha256校验,并采用增量上传方式,最终快照以清单完整列出所有分片为准。
特点
该数据集的核心特征在于其系统性的行为测试设计,覆盖了图像修复任务的多维度评估。四种LoRA臂的并行设置允许对比不同微调策略的效果,而75切片修复记录和PhD损伤面板则提供了细粒度的性能分析。8x200基准套件扩展了评估的广度,试金石/阶段日志则记录了训练动态。所有原始文件均附带校验信息,确保了数据的完整性和可追溯性。数据集以Apache-2.0许可发布,适用于学术研究。
使用方法
研究者可通过HuggingFace平台获取该数据集,利用results_manifest.json验证文件完整性,确保快照一致性。随后,可解析各实验臂目录下的评估记录,分析模型在修复任务中的行为表现。训练侧车文件(run.json)提供了微调配置细节,便于复现实验。该数据集适用于对比不同LoRA适配器对视觉语言模型性能的影响,或作为基准测试的参考数据。使用时应遵循Apache-2.0许可条款,并引用原始测试套件。
背景与挑战
背景概述
在视觉语言模型行为评估日益受到重视的背景下,reuse-vs-recraft-e16-results数据集于2026年8月16日由相关研究团队创建,记录了基于Qwen2.5-VL-7B-Instruct模型的E16范围阶梯行为电池测试的原始数据。该数据集包含四个LoRA分支的评估记录,涵盖75切片修复记录、博士损伤面板记录、8x200基准套件记录以及石蕊/阶段日志,并附有训练侧车文件。其核心研究问题在于探究模型在复用与重铸两种策略下的行为差异,为视觉语言模型的鲁棒性和适应性研究提供了宝贵的实证基础,对推动多模态模型评估方法论的发展具有潜在影响力。
当前挑战
该数据集所面临的挑战主要体现在两个方面。在领域问题上,视觉语言模型的行为评估本身具有高度复杂性,如何设计有效的范围阶梯测试以区分复用与重铸策略的效果,并确保评估结果的可比性和可重复性,是该领域亟待解决的难题。在构建过程中,数据集需整合四个LoRA分支的异构记录,包括修复记录、损伤面板、基准套件及日志文件,同时保证所有文件的完整性和一致性,并通过增量上传与sha256校验来维护数据完整性,这对数据管理和版本控制提出了较高要求。
常用场景
经典使用场景
在多模态大模型行为评估领域,该数据集作为一项基于Qwen2.5-VL-7B-Instruct模型的系统性行为电池测试记录,经典使用场景集中于模型修复能力与泛化性能的精细剖析。研究者可依托四个LoRA微调臂的75切片修复记录、博士级损伤面板双半记录以及8x200基准套件,开展受控对比实验,从而在视觉语言任务中量化模型对损伤输入的修复倾向与再生成偏好。该数据集亦适用于探究微调策略对模型鲁棒性的影响,为行为评估提供标准化、可复现的原始证据链。
解决学术问题
该数据集直面多模态模型评估中损伤修复与再生成行为难以量化、可复现性不足的学术难题。通过提供包含完整日志、训练边车文件及SHA256校验的原始记录,它解决了微调后模型行为漂移难以追踪、基准测试结果缺乏细粒度切片分析等问题。其意义在于为模型行为研究建立可审计的数据基础,推动学术界对LoRA干预下视觉语言模型修复机制的实证理解,并为后续可复现研究提供方法论参照。
衍生相关工作
围绕该数据集,已衍生出若干经典研究方向。一方面,基于其修复记录与损伤面板,研究者提出了多模态模型损伤感知修复评估框架,将行为电池扩展至更广泛的视觉语言任务;另一方面,8x200基准套件记录催生了微调臂间泛化性能比较的标准化流程,并被后续工作用于验证LoRA秩选择对模型行为的因果影响。这些衍生工作共同强化了行为电池在模型可解释性与鲁棒性研究中的基础设施地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务