遇见数据集

YuvrajSingh9886/jetson-non-reasoning-benchmark-7w

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个基准测试数据集,用于评估小型大型语言模型(LLM)在NVIDIA Jetson Orin Nano Super 8GB边缘AI设备上的推理性能,测试在7W功耗模式(nvpmodel模式3)下进行。数据集包含多个模型(如gemma3-1b、lfm2.5-1.2b、llama3.2-1b等)在不同量化设置(如Q4_K_M)下的性能指标,测试参数包括输入序列长度(128、512、1024、2048令牌)和生成序列长度(64、128、256令牌)。指标涵盖时间到第一个令牌(TTFT)、令牌到令牌延迟(T2T)、吞吐量(Tok/s)、请求延迟、功耗(W)以及每焦耳令牌数(Tok/J),旨在为边缘AI场景中的模型选择和优化提供参考。

许可证:Apache-2.0 标签: - 基准测试(benchmark) - Jetson - 大语言模型(LLM/Large Language Model) - 推理(inference) - 边缘人工智能(edge-ai) - 每焦耳Token数(tok-per-joule, tok/J) - llama.cpp 美观名称:"Jetson非推理基准测试 — 7W(nvpmodel模式3)" 配置: - 配置名称:default 数据文件: - 拆分:训练集(train) 路径:data/train-00000-of-00001.parquet # 小型大语言模型基准测试 — Jetson Orin Nano Super 8GB(7W / nvpmodel -m 3) **测试日期:** 2026年5月28日 18:03 **后端:** llama.cpp CUDA(`-ngl 99`) **并发数:** 1 **扫描参数:** 提示词长度取{128, 512, 1024, 2048} Token(tok),生成长度取{64, 128, 256} Token **数据集工件地址:** `https://huggingface.co/datasets/YuvrajSingh9886/jetson-non-reasoning-benchmark-7w` **备注:** 每焦耳Token数(tok/J)基于每次运行的aiperf JSON文件中的`start_time`/`end_time`计算得到。 ## 完整测试结果 > 功率说明:功率为每次aiperf运行窗口内VDD_CPU_GPU_CV的平均值,时间戳取自对应JSON文件。 | 模型 | 量化方式 | 输入序列长度(Input Sequence Length, ISL, tok) | 输出序列长度(Output Sequence Length, OSL, tok) | 输出序列长度偏差率(%) | 首令牌时间平均值(Time to First Token, TTFT, ms) | TTFT p50 | TTFT p90 | TTFT p99 | 令牌到令牌延迟平均值(Token to Token, T2T, ms) | T2T p50 | T2T p90 | T2T p99 | 迭代令牌延迟平均值(Iteration Token Latency, ITL, ms) | ITL p50 | ITL p90 | ITL p99 | 服务器吞吐(Tok/s) | 请求数每秒(Req/s) | 端到端Token每秒平均值 | E2E p50 | E2E p90 | E2E p99 | 请求延迟平均值(ms) | Req lat p50 | Req lat p90 | Req lat p99 | 预填充Token每秒平均值 | Prefill p50 | Prefill p90 | Prefill p99 | 功率(W) | **每焦耳Token数(Tok/J)** | |-------|:-----:|----------:|----------:|-----------------:|--------------:|---------:|---------:|---------:|-------------:|--------:|--------:|--------:|--------------:|--------:|--------:|--------:|---------------:|------:|--------------:|--------:|--------:|--------:|-----------------:|------------:|------------:|------------:|------------------:|------------:|------------:|------------:|----------:|----------:| (保留原表格数值内容) ## 各模型最佳每焦耳Token数 | 模型 | 量化方式 | 最佳每焦耳Token数 | 输入序列长度(tok) | 输出序列长度(tok) | Token每秒 | 功率(W) | |-------|:-----:|----------:|----------:|----------:|------:|----------:| ## 热性能总结(每次运行平均值) | 模型 | 平均功率(W) | 平均CPU温度(℃) | 平均GPU温度(℃) | 峰值结温(℃) | 是否节流 | |-------|-------------:|-------------:|-------------:|-------------:|:---------:| --- *由regen_report.py于2026年5月28日 18:03:24生成 — 每焦耳Token数基于每次运行的aiperf时间戳计算*

提供机构:
YuvrajSingh9886
搜集汇总
数据集介绍
YuvrajSingh9886/jetson-non-reasoning-benchmark-7w 数据集图片
构建方式
该数据集是基于Jetson Orin Nano Super 8GB开发板,在7W功耗模式(nvpmodel mode 3)下,通过llama.cpp CUDA后端(-ngl 99)进行非推理型基准测试构建而成。数据采集过程对prompt长度(128、512、1024、2048 tokens)与生成长度(64、128、256 tokens)进行全组合扫描,共涵盖5款量化至Q4_K_M或Q8_0的轻量级语言模型,包括gemma3-1b、lfm2.5-1.2b、lfm2.5-350m、llama3.2-1b、qwen2.5-0.5b及qwen3-0.6b,每次运行的功耗数据通过VDD_CPU_GPU_CV平均电压计算而得。
特点
本数据集的核心特色在于其多维度的细粒度性能度量,涵盖了首令牌延迟(TTFT)、令牌间延迟(ITL)、端到端吞吐量、预填充速度及请求延迟等关键指标,并提供了p50/p90/p99统计分布。尤为独特的是,其引入了每焦耳生成令牌数(Tok/J)这一能效指标,通过每次aiperf运行的时间戳精确计算功耗与性能的比率,使得在边缘AI场景下对不同模型的能量效率进行客观横向对比成为可能。
使用方法
数据集以Parquet格式存储,包含default配置的train split,使用者可直接通过HuggingFace Datasets库加载。对于从事边缘AI推理优化的研究人员,可基于OSL mismatch、TTFT、ITL及Tok/J等字段进行模型选择与量化策略评估;亦可利用不同prompt与生成长度的组合数据,分析负载特性对推理性能与能耗的影响模式,从而指导在Jetson等资源受限设备上的模型部署参数调优。
背景与挑战
背景概述
该数据集由YuvrajSingh9886于2025年创建,专注于面向边缘智能(Edge AI)场景下的大语言模型推理性能基准测试。随着大型语言模型在资源受限的嵌入式平台(如NVIDIA Jetson Orin Nano Super)上的部署需求日益增长,准确评估模型在低功耗模式下的推理效率与能效比成为关键研究问题。该数据集以Jetson设备在7W功耗模式(nvpmodel mode 3)下的非推理任务为背景,系统性地采集了包括Gemma3、LFM2.5、Llama3.2和Qwen系列等轻量级模型在不同输入/输出长度配置下的性能指标,涵盖TTFT、ITL、吞吐量及Tok/Joule等核心参数,为边缘AI推理的能耗-性能权衡研究提供了宝贵的数据支撑,对推动高效边缘计算与绿色AI发展具有重要意义。
当前挑战
该数据集所解决的领域挑战主要包括:1) 在极低功耗(7W)的嵌入式环境下,大语言模型推理面临着计算资源(内存带宽、浮点算力)与能效约束之间的根本矛盾,传统数据中心级评估指标无法直接迁移,亟需针对边缘场景的精细化基准;2) 构建过程中面临模型量化精度(如Q4_K_M、Q8_0)与推理延迟、生成质量之间的非线性权衡,以及不同提示长度(128至2048 token)和生成长度变化对实际部署稳定性的影响;3) 数据采集涉及对llama.cpp后端、CUDA加速与nvpmodel电源状态的多变量协同控制,需精确同步功耗测量与每轮推理的时间戳,确保Tok/Joule指标的重复性和可靠性,避免因硬件热节流或调度抖动引入噪声。
常用场景
经典使用场景
在边缘智能与低功耗推理的交汇地带,该数据集为评估大型语言模型(LLM)在Jetson Orin Nano Super平台上的非推理类任务表现提供了标准化基准。其经典使用场景聚焦于度量不同量化策略下(如Q4_K_M与Q8_0)、不同模型规模(从350M至1.2B参数量)的吞吐量、首令牌延迟与每焦耳令牌数等核心指标。通过系统性地扫描输入序列长度与生成令牌长度组合,研究者得以构建功耗约束下的性能剖面,尤其适用于探索7W功率模式对推理效率的影响。
解决学术问题
该数据集直击低功耗边缘设备上部署LLM时面临的能量-性能权衡这一核心学术困境。它系统性地回答了在严格功率预算(7W)下,不同量化级别与模型架构如何影响推理延迟、吞吐量及能效比(Tok/J)。这解决了以往研究中缺乏统一、细粒度能耗基准的问题,为“每瓦性能”这一度量指标提供了可靠参考,推动了边缘AI系统中模型压缩与硬件协同优化的理论研究,并揭示了模型规模与推理效率之间的非线性关系。
衍生相关工作
基于该基准数据,已衍生出多项关于模型量化与硬件适配的深入研究。例如,有工作利用其Tok/J指标优化了llama.cpp后端的批处理策略,提出了自适应量化选择算法。另有一些研究在此基础上构建了功率-延迟-精度三维搜索空间,用于自动化神经网络架构搜索。此外,该数据集中的细粒度时间戳数据(如TTFT、ITL分布)被用于校准边缘推理的性能模型,催生了针对Jetson平台的轻量级推理调度器设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务