遇见数据集

vorn-mat-cross-family-results

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

Vorn-Mat跨家族结果数据集是论文《Vorn-Mat: 家族条件KV缓存驱逐与粒度拯救谱》的配套发布,旨在支持论文中配对McNemar测试的可复现性。该数据集包含实验活动中产生的所有49个已发布结果工件、作为参考基线的原始逐夹具观察数据分片以及论文附录A中引用的图表。具体内容包括:JSON格式的结果工件(每个都配有Markdown摘要)、包含原始观察数据的10个gzipped JSON分片以及4个参考图表。数据规模包括49个结果工件、299个计数结果行、270个携带逐夹具观察结果的行、18,000个独立的逐夹具观察记录,实验覆盖9个模型家族(如Mistral 7B v0.3、Llama 3.1 8B、Qwen 3 30B-A3B等),总计消耗32.72 GPU小时。数据集主要基于RULER基准测试,使用`niah_multikey_1_4k`切片进行实验,模型以bf16精度运行,采用贪婪解码。该数据集适用于KV缓存管理、注意力机制优化、长上下文语言模型基准测试结果分析等研究任务,为相关领域的实验复现和结果验证提供了关键数据支持。

The Vorn-Mat Cross-Family Results Dataset is an accompanying release of the paper *Vorn-Mat: Family-Conditional KV Cache Eviction and Granularity Rescue Spectrum*, intended to support the reproducibility of the paired McNemar test described in the paper. This dataset encompasses all 49 published result artifacts generated throughout the experimental campaign, the original per-fixture observational data shards serving as reference baselines, and the figures cited in Appendix A of the paper. Specifically, it includes: result artifacts in JSON format (each paired with a Markdown summary), 10 gzipped JSON shards containing raw observational data, and 4 reference figures. In terms of scale, the dataset contains 49 result artifacts, 299 count result rows, 270 rows with per-fixture observational results, and 18,000 independent per-fixture observation records. The experiments cover 9 model families (e.g., Mistral 7B v0.3, Llama 3.1 8B, Qwen 3 30B-A3B, etc.), with a total GPU hour consumption of 32.72. The dataset is primarily based on the RULER benchmark, with experiments conducted using the `niah_multikey_1_4k` slice. All models are executed with bfloat16 precision and adopt greedy decoding. This dataset is applicable to research tasks including KV cache management, attention mechanism optimization, and benchmark result analysis for long-context language models, providing critical data support for experimental reproduction and result validation in relevant research fields.

创建时间:
2026-05-21
原始信息汇总

Vorn-Mat: Cross-Family Results 数据集详情

数据集概述

该数据集是论文《Vorn-Mat: Family-Conditional KV-Cache Eviction and the Granularity Rescue Spectrum》的配套发布物,包含了实验活动的所有49个结果工件以及支持的原始观测数据碎片和图表。

数据规模

  • 样本量:10K < n < 100K
  • 语言:英语
  • 许可证:MIT

数据集内容

路径 内容
*.json 49个实验活动结果工件,每个配有Markdown摘要文件(*.md
vanilla-observation-2026-05-13-shards/ 10个gzip压缩的JSON碎片,包含原始逐夹具vanilla(无驱逐)观测数据,作为参考基线
figures/ 4个论文中引用的图表(对齐差距、排名稳定性、残差差距、按步骤的答案top-k命中率)

数据结构

大多数结果工件是JSON封装,包含rows[]或专门的数组如sentence_rows[]token_rows[]。遗留和探针工件使用较旧的结构,用于溯源。大多数承载主要结论的行包含逐夹具的observations[]数组,记录每个评估夹具的二元正确性结果和原始预测文本。

主要统计数字(可从本数据集复现)

  • 49个结果工件
  • 299个计数的结果行
  • 270行携带逐夹具观测数据
  • 18,000条独立逐夹具观测记录
  • 32.72 GPU小时(跨9个模型家族)
  • 总计估计计算成本:$77.78

方法论

  • 基准测试:使用RULER基准(通过HuggingFace镜像rbiswasfc/ruler),主要基于niah_multikey_1_4k切片(validation[:50]
  • 测试的模型家族(9个):Mistral 7B v0.3、Llama 3.1 8B、Ministral 8B、Gemma 2 9B、Gemma 4 E4B-it、Qwen 3 8B、Gemma 3 12B-pt、Qwen 2.5 7B Instruct、Qwen 3 30B-A3B
  • 模型使用:直接从HuggingFace获取,bf16精度,贪婪解码
  • 实验硬件:主要使用NVIDIA A100 80GB GPU(通过Modal),Phase 2C Mistral后期预算重试使用H100 80GB

引用

bibtex @article{penney2026vornmat, title={Vorn-Mat: Family-Conditional KV-Cache Eviction and the Granularity Rescue Spectrum}, author={Penney, L.}, journal={arXiv preprint}, year={2026} }

相关资源

  • 论文配套代码仓库:https://github.com/synapt-dev/vorn-mat
  • LOCOMO基准:https://snap-research.github.io/locomo/
  • RULER基准:https://huggingface.co/datasets/rbiswasfc/ruler
搜集汇总
数据集介绍
vorn-mat-cross-family-results 数据集图片
构建方式
该数据集是论文《Vorn-Mat: Family-Conditional KV-Cache Eviction and the Granularity Rescue Spectrum》的附属成果,伴随开源代码仓库一同发布。其构建基于RULER基准测试,主要通过HuggingFace镜像中的`niah_multikey_1_4k`切片(`validation[:50]`)展开实验。涵盖九个模型家族,包括Mistral 7B v0.3、Llama 3.1 8B、Ministral 8B、Gemma 2 9B、Gemma 4 E4B-it、Qwen 3 8B、Gemma 3 12B-pt、Qwen 2.5 7B Instruct及Qwen 3 30B-A3B。模型采用bf16精度和贪婪解码,在NVIDIA A100 80GB GPU上经由Modal平台运行,部分重试实验则使用了H100 80GB GPU。数据集共收录49个结果产物、299个统计结果行、270个携带逐夹具观测值的行、18,000条逐夹具观测记录,累计消耗32.72 GPU小时,总计算成本约77.78美元。
特点
该数据集的核心特性在于其提供了全面的KV缓存驱逐方法比较基准。所有结果产物以JSON格式封装,内含`rows[]`或专用行数组(如`sentence_rows[]`和`token_rows[]`)结构。每个承载主张的行均附带`observations[]`数组,记录了每个夹具的二元正确性结果和原始预测文本,覆盖NIAH和跨任务场景。这一设计为论文中的配对McNemar检验提供了关键的可复现性基础,无需重新运行Modal作业即可恢复全部统计检验结果。数据集的附属资源包括10个压缩JSON分片的原始观测数据分片(作为无驱逐基线)、4幅论文引用的图表,以及描述完整模式、计数契约和桶分配方案的文件。
使用方法
使用该数据集时,研究者可直接加载JSON结果产物,解析其中携带的`observations[]`数组以复现论文中的配对McNemar p值。例如,Llama 3.1在跨任务头条单元中的对比结果可追溯至`token-vorn-qa2-cross-task-2026-05-20.json`文件。数据集附带的复现脚本`scripts/appendix_a_recompute.py`位于配套代码仓库中,可自动对产物执行计数验证。此外,论文附录A详细记录了完整的模式定义、计数契约和桶分配方案,为深入分析提供了参考。该数据集适用于KV缓存驱逐策略的性能评估、长上下文LLM行为研究及基准测试结果复现等场景。
背景与挑战
背景概述
在现代大语言模型推理过程中,KV缓存(KV-Cache)的显存占用随序列长度线性增长,成为长上下文部署的核心瓶颈之一。Vorn-Mat Cross-Family Results数据集由Penney等人于2026年创建,源自论文《Vorn-Mat: Family-Conditional KV-Cache Eviction and the Granularity Rescue Spectrum》,旨在系统性地评估跨模型家族的KV缓存驱逐策略。该数据集包含49个实验结果工件、18,000条观测记录,覆盖Mistral 7B、Llama 3.1 8B、Gemma 2 9B等9种主流模型家族,基于RULER基准测试完成。作为KV缓存优化领域的系统性基准资源,该数据集为理解不同驱逐粒度对模型性能的影响提供了量化依据,推动了长上下文推理的效率研究。
当前挑战
该数据集主要面临两方面的挑战。在领域问题层面,长上下文中KV缓存持续增长导致显存压力剧增,传统简单驱逐策略(如最近最少使用)在保留关键语义时表现不稳定,亟需精细化的驱逐机制以平衡计算效率与模型准确性。在构建过程中,研究者需要跨9种异构模型家族统一实验配置(如bf16精度、贪婪解码),处理不同基准任务(NIAH与跨任务)的观测数据对齐,并确保McNemar检验等统计指标的可复制性,这涉及大规模GPU调度(总计32.72 GPU小时)和复杂的实验结果编排,对数据一致性和工程部署提出了极高要求。
常用场景
经典使用场景
在大语言模型推理优化的研究中,Vorn-Mat Cross-Family Results 数据集被广泛用于评估和验证基于条件式家族感知的键值缓存(KV-Cache)驱逐策略的性能。该数据集围绕论文提出的Vorn-Mat方法,提供了覆盖9个模型家族、超过18,000次实验观测的基准结果,特别适用于在RULER基准下对长上下文任务进行精确的逐项对比分析。研究者借助这些包含二元正确性标签与原始预测文本的观测数组,可复现论文中关键的配对McNemar检验,从而系统验证不同驱逐粒度与策略之间的统计显著性差异。
解决学术问题
该数据集精准回应了长上下文推理中KV-Cache占用与精度权衡这一核心学术挑战。传统驱逐方法往往因忽略模型家族特性而导致性能退化,而Vorn-Mat首次提出家族条件式驱逐与粒度救赎谱系的概念,揭示了不同层级条件(如句子级与令牌级)在保持注意力质量方面的非对称效果。通过统一且高度重复性强的实验框架,该数据集使研究者得以对驱逐策略的稳定性、对齐差距和残差特性进行量化剖析,为理解长上下文推理中记忆保留与计算效率之间的最优边界奠定了实证基础。
衍生相关工作
该数据集衍生了一系列围绕KV-Cache驱逐策略与长上下文评估方法的后续研究。完整的实验账目与开源复现脚本(scripts/appendix_a_recompute.py)催生了多篇在RULER与LOCOMO基准上验证不同驱逐架构的对比分析。研究者基于此处发布的逐观测记录数组,探索了将家族条件式先验与动态预算分配相结合的新范式,并衍生出对注意力排名稳定性以及令牌残差间隙的深入剖析。此外数据集的标准化编排格式已被后续工作采纳为结果存储的参考模板,推动了长上下文推理领域实验可比性的提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务