遇见数据集

YuvrajSingh9886/jetson-non-reasoning-benchmark-15w

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个针对小型大语言模型(LLM)在NVIDIA Jetson Orin Nano 8GB边缘AI设备上的推理性能基准测试集合。测试使用llama.cpp CUDA后端(-ngl 99),并发数为1,覆盖了不同输入token数(128、512、1024、2048)和生成token数(64、128、256)的组合。数据集包含多个模型(如gemma3-1b、lfm2.5-1.2b、llama3.2-1b、qwen2.5-0.5b、qwen3-0.6b等)的量化版本(如Q4_K_M、Q8_0)的详细性能指标,包括首次token时间(TTFT)、token到token延迟(T2T)、输入token延迟(ITL)、token每秒(Tok/s)、请求每秒(Req/s)、端到端token每秒(E2E tok/s)、请求延迟、预填充token每秒、功率消耗(瓦特)以及能效指标(每焦耳token数,Tok/J)。数据用于评估边缘设备上LLM的推理效率和能效,适用于AI推理优化和边缘计算研究。

This dataset is a collection of inference performance benchmark tests for small large language models (LLMs) on the NVIDIA Jetson Orin Nano 8GB edge AI device. The tests use the llama.cpp CUDA backend with the parameter -ngl 99, set the concurrency to 1, and cover combinations of various input token counts (128, 512, 1024, 2048) and output token counts (64, 128, 256). It includes detailed performance metrics for quantized versions of multiple LLMs such as gemma3-1b, lfm2.5-1.2b, llama3.2-1b, qwen2.5-0.5b, qwen3-0.6b and others, with quantization formats like Q4_K_M and Q8_0. The metrics cover Time to First Token (TTFT), token-to-token latency (T2T), input token latency (ITL), tokens per second (Tok/s), requests per second (Req/s), end-to-end tokens per second (E2E tok/s), request latency, prefill tokens per second, power consumption (in watts), and energy efficiency indicator (tokens per joule, Tok/J). This dataset is used to evaluate the inference efficiency and energy efficiency of LLMs on edge devices, and is applicable to research on AI inference optimization and edge computing.

提供机构:
YuvrajSingh9886
搜集汇总
数据集介绍
YuvrajSingh9886/jetson-non-reasoning-benchmark-15w 数据集图片
构建方式
该数据集聚焦于在低功耗边缘设备上评估小型语言模型的推理效率。通过Jetson Orin Nano Super 8GB平台,采用llama.cpp的CUDA后端(-ngl 99)完成全部推理任务。实验设计为单并发(Concurrency=1),并系统性地遍历三档输入长度(128、512、1024、2048 token)与三档生成长度(64、128、256 token)的交叉组合,共计12种测试场景。每项测试均记录首词延迟(TTFT)、词间延迟(ITL)、端到端吞吐量、预填充速度及核心功耗指标,最终以每焦耳处理token数(Tok/J)作为能效综合评价基准。
特点
数据集核心特色在于引入能量效率视角,以Tok/J为关键度量,突破了传统仅关注吞吐量和延迟的评估范式。涵盖了gemma3-1b、lfm2.5-1.2b、lfm2.5-350m、llama3.2-1b、qwen2.5-0.5b、qwen3-0.6b共六款不同规模的小型语言模型,统一采用Q4_K_M或Q8_0量化,确保了对比的公平性。数据记录详尽,包含OOM失败标记与OSL偏差率,真实反映了边缘设备推理的边界情况。测试均在15W功率模式(nvpmodel mode 0)下完成,保障了环境的一致性。
使用方法
数据集以parquet格式存储于HuggingFace,用户可通过datasets库直接加载。加载方式为:from datasets import load_dataset;dataset = load_dataset("YuvrajSingh9886/jetson-non-reasoning-benchmark-15w", split="train")。加载后可获得包含模型名、量化类型、输入输出长度、各类延迟指标、吞吐量、功耗及能效比的完整数据表。适用于比较不同小型LLM在边缘设备上的推理表现,尤其适合研究者在功耗受限场景下进行模型选型,或开发者在边缘AI部署前进行性能预评估。
背景与挑战
背景概述
随着边缘人工智能的迅猛发展,在资源受限的设备上高效部署大型语言模型(LLMs)已成为研究热点。Jetson非推理基准测试15W数据集(创建于2025年5月26日)由研究人员YuvrajSingh9886提出,聚焦于Jetson Orin Nano Super边缘计算平台在15瓦功耗模式(nvpmodel mode 0)下的LLM推理性能评估。该数据集通过系统的输入输出长度扫描,衡量了多种小型语言模型(如Gemma3-1B、Qwen2.5-0.5B等)在量化版本下的延迟、吞吐量与能效(Token/Joule)指标,为理解边缘端LLM部署的能耗-性能权衡提供了宝贵资源。其核心研究问题在于揭示不同模型架构与量化策略在极度受限功耗预算下的实际表现边界,对推动轻量级模型在嵌入式系统中的应用具有重要指导意义。
当前挑战
该数据集旨在应对两大核心挑战:其一,解决边缘AI领域的关键难题——如何在15瓦的超低功耗预算下实现大型语言模型的高效推理,以平衡模型精度、推理速度与能量消耗之间的关系。其二,在构建过程中面临技术挑战,包括因内存溢出(OOM)导致的模型测试失败(如gemma3-4b),以及不同模型在各类输入输出长度组合下表现出的显著差异,例如Qwen2.5-0.5B在高输出长度时出现高达53%的输出长度不匹配率,这些异常现象需通过细粒度的基准测试加以捕获与分析,从而为边缘推理优化提供可靠依据。
常用场景
经典使用场景
在边缘端部署大语言模型时,推理效率与能效的权衡始终是核心议题。该数据集为评估小型语言模型在低功耗边缘设备上的推理性能提供了标准化基准,覆盖了从128到2048 token的提示长度与64到256 token的生成长度,并系统记录了首Token延迟、Token间延迟、吞吐量及功耗等关键指标。经典使用场景包括在NVIDIA Jetson Orin Nano这类资源受限平台上,对Gemma、Llama、Qwen等系列轻量模型及其不同量化策略进行横向对比,从而筛选出最适合特定能效约束的模型配置。
解决学术问题
该数据集直面边缘AI推理中的'能效-性能'帕累托前沿建模难题,解决了学术界长期缺乏标准化、细粒度测量数据的问题。通过统一测量CPU+GPU+CV总功耗并将结果标准化为每焦耳生成Token数,研究得以量化不同模型规模、量化精度与输入输出长度组合下的能源效率。数据揭示出小型模型在低功耗模式下可达到每焦耳20 Token以上的惊人效率,为构建绿色AI系统提供了实证基础,推动了大语言模型在物联网、移动设备等功耗敏感场景中的可行性研究。
衍生相关工作
该基准催生了一系列关于边缘端大模型部署的后续研究。一方面,研究者基于数据集开发了动态量化与自适应推理调度算法,可根据实时功耗与负载动态切换模型量化等级,在保证服务质量的同时最大化能效。另一方面,数据集推动了针对Jetson平台的编译器与推理引擎优化,如llama.cpp的CUDA后端适配与算子融合技术。此外,受数据启发,出现了面向极端低功耗场景的专项模型压缩工作,通过知识蒸馏与结构化剪枝在亚瓦级功耗下保持推理能力,拓展了大语言模型在可穿戴设备上的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务