遇见数据集

dsv4-flash-sm86-8x3090

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集/资源库提供了在 8 块 RTX 3090 (SM86, 24GB) 显卡上运行 W4A16 量化版 DeepSeek-V4-Flash 模型的完整推理服务栈。内容包含:不同并发序列和上下文长度下的聚合解码吞吐量表格(1×262K 至 4×80K 上下文,聚合吞吐量 59.6–120.1 tok/s);预填充性能(262K 边界约 451 tok/s);模型权重来源(Intel/DeepSeek-V4-Flash-W4A16-AutoRound);详细的软件锁定(Python 3.12.12, PyTorch 2.11.0, CUDA 13.0.1, FlashInfer, Marlin MoE 等);启动脚本(最小复现与最大吞吐量);以及多份技术文档(模型构建、运行手册、漏洞利用基准测试、终端基准测试、上下文扩展路线图)。所有数据均通过确定的 needle 探测验证,确保一致性。该资源适用于需要复现或基准测试 DeepSeek-V4-Flash 模型在消费级 GPU 集群上推理性能的研究者和工程师。

This dataset/repository provides a complete inference service stack for running the W4A16 quantized version of the DeepSeek-V4-Flash model on 8 RTX 3090 (SM86, 24GB) GPUs. It includes: aggregated decoding throughput tables under different concurrent sequences and context lengths (1×262K to 4×80K context, aggregated throughput 59.6–120.1 tok/s); prefill performance (approximately 451 tok/s at 262K boundary); model weight source (Intel/DeepSeek-V4-Flash-W4A16-AutoRound); detailed software lock (Python 3.12.12, PyTorch 2.11.0, CUDA 13.0.1, FlashInfer, Marlin MoE, etc.); start scripts (minimum reproduction and maximum throughput); and multiple technical documents (model building, run manual, exploit benchmark, terminal benchmark, context extension roadmap). All data are verified by deterministic needle probing to ensure consistency. This resource is suitable for researchers and engineers who need to reproduce or benchmark the inference performance of DeepSeek-V4-Flash model on consumer-grade GPU clusters.

创建时间:
2026-08-24
原始信息汇总

DeepSeek-V4-Flash on 8x RTX 3090 (SM86) 数据集详情

核心目标

在8张RTX 3090显卡(SM 8.6架构,单卡24GB显存)上运行DeepSeek-V4-Flash级别的W4A16量化模型,实现262K上下文长度与最高120 tok/s的聚合吞吐。该数据集主要提供服务配方、启动封装脚本以及实测的吞吐/上下文阶梯数据。

性能阶梯

不同并发序列数对应的上下文长度与吞吐表现如下:

并发配置 聚合解码吞吐 每序列解码吞吐
1 × 262K 59.6 tok/s 59.6 tok/s
2 × 176K 81.3 tok/s 39.3 / 42.0 tok/s
3 × 114K 104.5 tok/s 32.7 / 36.0 / 35.8 tok/s
4 × 80K 120.1 tok/s 29.2 / 30.3 / 30.3 / 30.2 tok/s
  • 所有数据均通过全上下文精确needle探针验证一致性
  • 262K上下文极限下的预填充速度约为451 tok/s,并成功通过258K token needle测试
  • 随着并发序列增加,聚合吞吐近似线性增长,每序列上下文相应减少

模型与量化

  • 建议复现使用的公开检查点:Intel/DeepSeek-V4-Flash-W4A16-AutoRound
  • 量化方案:AutoRound W4A16,group size 128
  • 量化属于输入检查点属性,本仓库的SM86工作聚焦于服务栈
  • 完整的abliterated变体构建链见 docs/MODEL_PREP.md,量化配置见 reference/config.json

技术栈与软件版本

  • Python 3.12.12,PyTorch 2.11.0+cu130,CUDA 13.0.1(以 TORCH_CUDA_ARCH_LIST=8.6 重新编译)
  • FlashInfer 0.6.14+sm89.1(为SM86进行JIT编译)
  • 使用Marlin MoE、kv_cache_dtype=fp8_ds_mlaattention_backend=FLASHINFER_MLA_SPARSE_DSV4
  • 核心组件包括CUDA graph解码、FlashInfer稀疏MLA、Marlin MoE以及压缩混合KV

数据集内容

  • docs/MODEL_PREP.md:检查点构建链,包括官方FP8基础模型、rank-1 abliteration(固定工具、方向文件、参数)以及确定性无模型AutoRound W4A16配方
  • docs/SM86_DSV4_RUNBOOK.md:硬件/软件固定版本、复现结果、启动命令、内存参数、验证清单及rank0 trace分解(每个graph step 18ms中17.5ms为TP8 allreduce)
  • docs/EXPLOIT_BENCH.md:漏洞利用阶梯测试结果(ExploitBench v8-bench,3个已修补CVE,确定性评分器,T5全覆盖,零漏洞利用原语)
  • docs/TERMINAL_BENCH.md:终端代理工作一致性校验(在未见过的测试框架下,5/18解决,多步工具循环完整)
  • docs/SM86_256K_ROADMAP.md:上下文/序列阶梯方法论、NCCL矩阵、配置分析及内核工作顺序
  • scripts/:已验证的启动封装脚本,启动时打印完整argv、git修订版本、导入来源及内存参数

快速复现

  • 最小复现(262K上下文):运行 scripts/serve_sm86_262k_cudagraph.sh
  • 最大吞吐(80K上下文,4序列):运行 scripts/serve_sm86_80k_4seq_cudagraph.sh

实验构建方式

该技术栈由编排代理工作流构建:PAI(个人AI基础设施)负责管理设备、启动、测试和追踪,驱动GPT-5.5编码代理进行了约三周的迭代内核和后端工作。所有命令通过tmux终端复用器在编排笔记本电脑上执行,编码代理沙箱无外网,代码和文档通过本地Gitea传输。

参考来源

  • DeepSeek-V4技术报告:https://arxiv.org/html/2606.19348v1
  • CSA/HCA详解:https://prathamp.com/blog/deepseek-v4-csa-and-hca/
  • Ampere社区分支:https://github.com/Lasimeri/vllm-dsv4-ampere

许可

启动封装脚本和文档遵循仓库许可证,模型权重遵循其上游许可证。

搜集汇总
数据集介绍
dsv4-flash-sm86-8x3090 数据集图片
构建方式
该数据集源于一项针对DeepSeek-V4-Flash类模型在8块RTX 3090显卡(SM 8.6架构)上高效推理的工程实践,其构建过程融合了量化模型准备、推理栈定制与性能基准测试。构建基线采用Intel/DeepSeek-V4-Flash-W4A16-AutoRound公开检查点(AutoRound W4A16量化,组大小为128),并辅以文档详述的检查点构建链,涵盖官方FP8基座、秩一消融(abliteration)处理及确定性量化配方。推理栈则集成了CUDA图解码、FlashInfer稀疏MLA、Marlin MoE及压缩混合KV缓存等技术,并针对SM86架构进行了软件版本锁定与JIT编译配置。通过编排代理工作流,在约三周内迭代完成内核与后端的调优,每一步执行均被验证并记录,最终形成涵盖上下文长度阶梯、吞吐量数据及启动脚本的完整资源集。
特点
该数据集的核心特色在于其系统化的性能阶梯表,展示了从单序列262K上下文(聚合吞吐59.6 tok/s)到四序列80K上下文(聚合吞吐120.1 tok/s)的扩展规律,其中并发序列可摊销TP8全归约开销,实现近线性聚合吞吐增长。所有数据行均通过全上下文精确计数针探针验证,确保连贯性。此外,数据集提供了详尽的运行手册、内核性能剖析(如每图步18毫秒中17.5毫秒为TP8全归约)以及针对漏洞利用基准(ExploitBench)和终端代理任务的评估结果,彰显了其在长上下文和高并发场景下的实际效能。其构建过程本身亦具独特性,由个人AI基础设施(PAI)驱动编码智能体完成,所有操作经由tmux会话与SSH连接执行,保证了可复现性与可审计性。
使用方法
使用者可通过仓库内提供的验证启动包装脚本快速复现性能结果。最小复现命令为`scripts/serve_sm86_262k_cudagraph.sh`,旨在获取262K上下文下的解码性能;若追求最大聚合吞吐,则运行`scripts/serve_sm86_80k_4seq_cudagraph.sh`,通过四路并发序列实现120 tok/s的聚合解码速率。这些脚本会在启动时打印完整参数、Git修订版、导入来源及内存配置,便于调试与追踪。环境配置需严格遵循软件锁定要求:Python 3.12.12、PyTorch 2.11.0+cu130、CUDA 13.0.1(重新编译以支持SM86)、FlashInfer 0.6.14+sm89.1(为SM86 JIT编译)等。推荐的启动方式是直接执行上述脚本,而详细的硬件/软件固定、内存调优与验证清单则收录于运行手册中,供深度定制与问题排查参考。
背景与挑战
背景概述
该数据集于2025年由个人AI基础设施(PAI)与GPT-5.5编码代理协作构建,旨在解决DeepSeek-V4-Flash类模型在8x RTX 3090(SM86)硬件上的高效推理部署问题。研究团队通过约三周的迭代内核与后端优化,实现了W4A16量化模型在262K上下文长度下59.6 tok/s的单序列吞吐,以及四序列并发时120.1 tok/s的聚合吞吐,展现了在消费级GPU上运行前沿大模型的可能性。该工作不仅提供了完整的启动封装与复现脚本,还通过ExploitBench和Terminal Bench验证了服务检查点的安全性与智能体任务执行能力,对边缘推理和模型部署领域具有重要参考价值。
当前挑战
领域挑战在于如何在显存受限(24 GiB/卡)的SM86架构上高效运行超长上下文(262K)的MoE大模型,需解决TP8全归约通信瓶颈、量化精度与性能平衡、以及长序列KV缓存压缩等难题。构建过程中,团队遭遇了软件生态不匹配(如FlashInfer对SM86的JIT编译支持)、CUDA图解码与稀疏MLA后端的兼容性调试,以及多机协作中无互联网环境的代码传输与结果验证问题。此外,复现结果的高可靠性要求迫使团队设计精确计数针探测与一致性校验流程,确保每一组吞吐数据均经过严格验证,最终克服了传统部署管线在硬件适配和自动化流程上的双重挑战。
常用场景
经典使用场景
该数据集围绕DeepSeek-V4-Flash模型在8块RTX 3090(SM 8.6架构)上的高效推理部署而构建,其经典应用场景聚焦于超长上下文(可达262K)与高并发吞吐(聚合解码速度达120 tok/s)的协同优化。研究者可借助其中提供的启动脚本、性能阶梯数据以及资源调配指南,复现W4A16量化模型在消费级GPU集群上的服务化推理,并针对不同并发序列长度进行性能调优,从而在有限硬件预算下挖掘大模型的极致潜能。
解决学术问题
此数据集直面大模型推理中的经典学术难题:如何在显存受限的消费级硬件上实现长上下文与高吞吐的平衡。通过实测不同并发数下的吞吐与上下文长度阶梯,量化了TP8全归约等通信开销对解码延迟的影响,并展示了CUDA Graph、FlashInfer稀疏MLA及Marlin MoE等技术的协同效应。其方法学与性能数据为研究GPU集群推理优化、量化模型部署策略及上下文窗口扩展提供了可复现的基准与实证依据。
衍生相关工作
该数据集衍生出一系列值得关注的后续工作:一方面,其验证的AutoRound W4A16量化流程与SM86专用推理栈,可被复用至其他模型或GPU架构,推动量化推理的泛化研究;另一方面,其披露的带宽瓶颈分析(rank0 trace显示17.5/18毫秒为TP8通信)可启发进一步优化通信拓扑或设计混合并行策略。此外,基于该栈的模型对齐与安全评测(如ExploitBench与Terminal Bench)开启了面向高危险任务的大模型可靠性研究,可能催生更鲁棒的越狱防护与上下文一致性验证工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务