遇见数据集

YuvrajSingh9886/jetson-non-reasoning-benchmark-maxn

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个名为Jetson非推理基准测试—MAXN超级模式(nvpmodel模式2)的基准测试数据集,专门用于评估在NVIDIA Jetson Orin Nano 8GB边缘AI设备上运行的小型大语言模型(LLM)的推理性能。数据集包含多个模型(如gemma3-1b、lfm2.5-1.2b、llama3.2-1b、qwen2.5-0.5b、qwen3-0.6b等)在不同量化设置(如Q4_K_M、Q8_0)下的性能指标,测试了不同的输入序列长度(128、512、1024、2048词元)和生成序列长度(64、128、256词元)。性能指标包括首词元时间(TTFT)、词元到词元时间(T2T)、输入延迟(ITL)、每秒词元数(Tok/s)、请求延迟、预填充词元速度、功耗(瓦特)以及每焦耳词元数(Tok/J)等。数据集旨在为边缘AI场景中的LLM推理提供详细的性能基准,帮助优化模型部署和能效。

This dataset is a benchmark dataset named Jetson Non-Inference Benchmark — MAXN Super Mode (nvpmodel Mode 2), specifically designed to evaluate the inference performance of small Large Language Models (LLMs) running on the NVIDIA Jetson Orin Nano 8GB edge AI device. It includes performance metrics of multiple models (e.g., gemma3-1b, lfm2.5-1.2b, llama3.2-1b, qwen2.5-0.5b, qwen3-0.6b, etc.) under different quantization settings (e.g., Q4_K_M, Q8_0), with tests covering varying input sequence lengths (128, 512, 1024, 2048 tokens) and output sequence lengths (64, 128, 256 tokens). Performance metrics include Time to First Token (TTFT), Token-to-Token (T2T) latency, Input Latency (ITL), Tokens per Second (Tok/s), request latency, prefill token throughput, power consumption (in Watts), and Tokens per Joule (Tok/J), among others. This dataset aims to provide detailed performance benchmarks for LLM inference in edge AI scenarios, assisting with model deployment optimization and energy efficiency improvement.

提供机构:
YuvrajSingh9886
搜集汇总
数据集介绍
YuvrajSingh9886/jetson-non-reasoning-benchmark-maxn 数据集图片
构建方式
该数据集旨在系统评估在Jetson Orin Nano Super 8GB边缘设备上,以MAXN超级模式(nvpmodel mode 2)运行时,多种小型语言模型的非推理性能。构建过程中,研究者采用llama.cpp CUDA后端,在并发数为1的条件下,通过系统遍历输入提示长度(128、512、1024、2048 token)与生成长度(64、128、256 token)的组合,对gemma3-1b、lfm2.5-1.2b、lfm2.5-350m、llama3.2-1b、qwen2.5-0.5b及qwen3-0.6b等模型进行量化推理测试。测试指标涵盖了首token延迟、token间延迟、端到端吞吐量、请求延迟及功耗等关键维度,最终以Tok/Joule为综合评价指标,全面刻画模型在边缘场景下的能效表现。
特点
本数据集最鲜明的特色在于其聚焦于边缘AI推理的能效评估,首次以每焦耳生成的token数(Tok/J)作为核心度量,直观反映模型在功耗受限设备上的计算效率。数据覆盖了从350M到1.2B参数规模的轻量级模型,并采用Q4_K_M与Q8_0等量化格式,展示了量化和模型容量对延迟、吞吐量及能耗的影响。此外,数据集提供了丰富的分位数统计(p50、p90、p99),细粒度刻画了推理延迟的波动特征,为边缘部署场景下的实时性保障提供了关键参考。同时,数据集明确标记了因内存溢出而失败的模型配置,增加了基准测试的透明度和实用价值。
使用方法
使用者可通过HuggingFace Datasets库加载该数据集,指定配置名'default'并读取训练集分片。数据以Parquet格式存储,便于高效处理。每条记录包含了模型名称、量化类型、输入提示长度、生成长度及详尽的延迟、吞吐量和功耗指标。研究者可基于Tok/Joule指标对模型能效进行排序和比较,或针对特定延迟分位数(如p99)筛选满足实时性要求的模型配置。该数据集尤为适合边缘AI硬件选型、模型量化策略优化及推理引擎调优等场景,为在资源受限设备上部署高效语言模型提供了坚实的数据支撑。
背景与挑战
背景概述
该数据集由研究人员YuvrajSingh9886于2026年创建,专注于评估小型语言模型在边缘计算设备NVIDIA Jetson Orin Nano Super 8GB上的非推理性能。核心研究问题在于量化不同规模的语言模型(如gemma3、Llama等)在受限硬件条件下的推理效率与能效比,尤其是在MAXN功耗模式下,以每秒处理令牌数和每焦耳令牌数等指标衡量。该基准测试填补了边缘AI领域缺乏系统化、细粒度非推理性能评估的空白,为部署轻量级LLM在资源敏感场景中提供了可复现的参考。
当前挑战
该数据集主要挑战包括:1) 解决边缘设备上运行LLM时面临的资源限制问题,如内存不足(OOM)导致模型无法加载,以及如何在功耗与性能间实现平衡;2) 构建过程中需应对不同输入输出长度组合下测量结果的波动,确保TTFT、ITL等延迟指标稳定,同时精确跟踪CPU+GPU电源轨功耗以计算能效比,避免因服务器崩溃或量化误差影响数据完整性。
常用场景
经典使用场景
在边缘智能计算领域,随着大语言模型(LLM)向轻量化部署演进,Jetson系列嵌入式设备成为承载推理任务的重要平台。该数据集聚焦于Jetson Orin Nano设备在MAXN功耗模式(nvpmodel mode 2)下的非推理类基准测试,系统性地收录了gemma3-1b、lfm2.5-1.2b、llama3.2-1b、qwen2.5-0.5b等主流小型LLM在多种提示长度(128至2048 tokens)和生成长度(64至256 tokens)下的推理性能指标。数据集采用llama.cpp CUDA后端,量化精度为Q4_K_M或Q8_0,详细记录了首次令牌生成时间(TTFT)、令牌间延迟(ITL)、吞吐量(tokens/s)、端到端延迟、预填充速度及功耗,并创新性地引入每焦耳生成令牌数(Tok/J)作为能效度量。这一精心设计的基准体系为评估边缘设备上LLM推理的延迟-吞吐量-能效权衡提供了标准化框架。
衍生相关工作
该数据集衍生了一系列关于边缘LLM部署优化的经典工作。研究者基于其测量结果,系统性地比较了不同量化方案(Q4_K_M vs Q8_0)在延迟和能效上的差异,为量化感知训练提供了实证基础。数据集揭示的OOM失败记录(如gemma3-4b的跳过)直接催生了内存感知的模型选择算法研究。同时,针对TTFT随提示长度超线性增长的现象,衍生出前缀缓存和推测解码等加速技术的性能边界分析。Tok/J指标的引入还激励了动态电压频率调整(DVFS)策略的探索,通过实时调整Jetson的MAXN功耗模式来平衡推理质量与续航。这些工作共同推动了边缘人工智能从“能否运行”到“高效运行”的研究范式转变,形成了模型压缩、硬件适配和运行时优化三位一体的方法论体系。
数据集最近研究
最新研究方向
该基准测试聚焦于边缘AI设备上轻量级大语言模型的推理效能评估,以Jetson Orin Nano Super平台为依托,系统性地测度了gemma3-1b、lfm2.5系列、llama3.2-1b、qwen2.5-0.5b及qwen3-0.6b等多款紧凑型模型在不同输入输出长度下的端到端延迟、吞吐量与能效比。研究揭示了量化策略与模型架构对边缘推理性能的显著影响,其中qwen2.5-0.5b在超低功耗场景下展现出卓越的每焦耳令牌产出效率,而小规模模型在长序列生成时面临的上下文窗口限制与内存溢出风险亦被充分暴露。该工作为资源受限环境下部署高性能语言模型提供了可量化的决策依据,推动边缘智能向实用化方向迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务