遇见数据集

YuvrajSingh9886/bonsai-jetson-benchmark-25w

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个在NVIDIA Jetson Orin Nano Super 8GB边缘AI设备上,以25W功率模式进行的语言模型推理性能基准测试数据集。数据集包含多个Bonsai模型(如1.7B、4B、8B)及其三元量化版本,在不同量化配置(如Q1_0、Q2_0)、提示令牌数(256、512、1024、2048)和生成令牌数(128、256、512)下的性能指标,如令牌每秒(Tok/s)、功率消耗(瓦特)和关键能效指标令牌每焦耳(Tok/J)。数据集还包括内存不足(OOM)和跳过的模型记录,以及热和功率摘要,旨在评估边缘AI场景下的模型能效和推理效率。

This is a benchmark dataset for language model inference performance on the NVIDIA Jetson Orin Nano Super 8GB edge AI device, operating in 25W power mode. The dataset includes multiple Bonsai models (e.g., 1.7B, 4B, 8B) and their ternary-quantized versions, with performance metrics under various quantization configurations (e.g., Q1_0, Q2_0), prompt token counts (256, 512, 1024, 2048), and generation token counts (128, 256, 512). Metrics include tokens per second (Tok/s), power consumption (watts), and the key energy efficiency metric tokens per joule (Tok/J). The dataset also records out-of-memory (OOM) and skipped models, along with thermal and power summaries, aiming to evaluate model energy efficiency and inference performance in edge AI scenarios.

提供机构:
YuvrajSingh9886
搜集汇总
数据集介绍
YuvrajSingh9886/bonsai-jetson-benchmark-25w 数据集图片
构建方式
该数据集基于NVIDIA Jetson Orin Nano Super 8GB平台,在25W功耗模式下,采用llama.cpp后端结合CUDA加速,对Bonsai与Ternary-Bonsai系列模型(涵盖1.7B、4B及8B参数量级)进行系统性推理基准测试。实验通过组合不同的输入提示长度(256、512、1024、2048 tokens)与生成长度(128、256、512 tokens),每种组合执行20次请求,并借助tegrastats以1 Hz频率采样VDD_CPU_GPU_CV电源轨的功耗数据,从而构建出以每焦耳输出令牌数(Tok/J)为核心能效指标的评测数据集。所有结果存储于Parquet格式文件中。
使用方法
用户可通过Hugging Face Datasets库直接加载该数据集,并利用其丰富的性能指标深入分析模型在特定边缘设备上的推理表现。建议重点关注Tok/J、功耗及峰值结温等关键参数,以此权衡模型规模、量化精度与能效之间的关系。数据集特别适用于比较不同模型在相同硬件条件下的能效优劣,或用于验证特定优化策略(如量化、上下文窗口调整)对推理性能的实际影响。
背景与挑战
背景概述
Bonsai Jetson Benchmark — 25W 数据集由研究团队于2026年创建,旨在为边缘人工智能推理场景提供标准化能效评估框架。该数据集聚焦于NVIDIA Jetson Orin Nano Super 8GB平台在25瓦功耗模式下的语言模型推理性能,系统性地探索了Bonsai系列模型(从1.7B到8B参数规模)在不同量化方案(Q1_0、Q2_0)、提示长度(256至2048 token)和生成长度(128至512 token)组合下的行为特征。通过引入tokens-per-joule(tok/J)这一核心能效指标,该数据集为评估边缘设备上大语言模型的计算效率与能源成本之间的权衡提供了关键的参照基准,对推动低功耗、高能效的边缘AI部署具有显著影响。
当前挑战
该数据集所解决的领域核心挑战在于边缘设备上大语言模型推理的能效优化与资源限制间的矛盾。具体挑战包括:1)在内存受限(8GB)的边缘平台(如Jetson Orin Nano Super)上,大型模型(如8B参数级)常因显存分配失败(OOM)而无法完成推理,亟需通过量化压缩与架构设计来突破硬件瓶颈;2)构建过程中,研究团队面临JetPack版本兼容性问题(如R36.4.7的NvMap回归错误导致连续内存分配失败),需通过系统级固件升级(如JetPack 6.2.2)来规避障碍;3)不同模型变体在功耗(4.5W至7W)、热管理(峰值温度约69°C)以及能效比(Tok/J跨度从1.691至5.684)上的显著差异,要求开发者针对实际部署场景进行精细化的模型-量化-上下文窗口组合调优。
常用场景
经典使用场景
在边缘人工智能的浪潮中,大语言模型(LLM)在功耗受限设备上的高效推理已成为学术界与工业界共同瞩目的焦点。bonsai-jetson-benchmark-25w 数据集专为 NVIDIA Jetson Orin Nano Super 8GB 平台在 25W 功耗模式下的 LLM 推理性能评估而设计,其核心使用场景是对不同规模(1.7B、4B、8B)和量化级别(Q1_0、Q2_0)的模型进行系统的端到端基准测试。该数据集通过固定输入输出长度组合(prompt 为 256/512/1024/2048 tokens,gen 为 128/256/512 tokens),详尽记录了首令牌延迟(TTFT)、令牌间延迟(ITL)、端到端吞吐量及功耗等关键指标,为开发者提供了可复现的性能比较基准。
解决学术问题
该数据集精准锚定了边缘计算中一个核心矛盾:如何在极低功耗预算下最大化 LLM 的推理效率。它系统性地解答了多个学术问题的交叉领域,包括不同量化策略(如 Q1_0 与 Q2_0)在硬件资源受限条件下的实际能耗表现、模型规模与生成质量之间的权衡(如 1.7B 模型如何以 4.5W 功耗实现 5.684 tok/J 的能效峰值),以及内存溢出(OOM)边界如何划定。通过引入 tok/J(每焦耳产出令牌数)这一复合指标,该数据集重新定义了边缘 AI 场景下能效的度量标准,推动了低比特量化与小模型蒸馏等技术的学术价值验证。
实际应用
在产业落地的层面,该数据集为智能安防、工业物联网和移动终端等领域的离线推理部署提供了直接的技术指引。例如,Bonsai-1.7B Q1_0 模型在 25W 功耗下仅需约 4.5W 即可达到 25 tok/s 的推理速度,这一发现为无人机、便携式巡检设备或车载边缘盒子上的实时智能问答系统铺平了道路。同时,数据集所揭示的 OOM 边界(如 8B 模型在 1536 token 上下文窗口下的失效)为硬件选型和模型裁剪设计划定了清晰的约束条件,使得基于 Jetson 平台的开发者能够依据 tok/J 与延迟分布(p50/p90/p99)进行精准的算力-功耗协同决策。
数据集最近研究
最新研究方向
在边缘计算与生成式AI深度融合的浪潮下,该数据集聚焦于NVIDIA Jetson Orin Nano Super平台在25W功耗约束下的大语言模型推理能效前沿。其核心创新在于引入token per joule(tok/J)作为关键度量,系统评估了不同参数量级与量化策略的Bonsai系列模型在多种序列长度组合下的能效表现。研究揭示了在资源严格受限的边缘设备上,通过极低比特量化(如Q1_0与Q2_0)可显著降低功耗至4-7瓦范围,同时维持可接受的吞吐能力。该基准测试为极小规模模型在边缘侧的实用化部署提供了关键性能边界与优化方向,对推动大模型在物联网、机器人及自主系统中的低功耗落地具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务