遇见数据集

ModelFit — Local LLM Hardware Compatibility Dataset

收藏
github2026-06-15 更新2026-07-03 收录
官方服务:

资源简介:

一个开放数据集,记录了哪些本地AI模型(Ollama)适合哪些硬件——根据参数大小、量化、最小RAM和估计内存负载,覆盖苹果Silicon Mac、iPhone和NVIDIA GPU。

This open dataset documents which local AI models (Ollama) are compatible with various hardware platforms, based on their parameter sizes, quantization levels, minimum required RAM, and estimated memory footprint, covering Apple Silicon Mac, iPhone, and NVIDIA GPUs.

创建时间:
2026-06-15
原始信息汇总

数据集概述

ModelFit — Local LLM Hardware Compatibility Dataset 是一个关于本地 AI 模型(Ollama)与硬件兼容性的开放数据集,涵盖 Apple Silicon Macs、iPhones 和 NVIDIA GPUs。

核心内容

文件列表

文件 说明
models.json 完整导出文件,包含元数据、方法和计数
models.csv 扁平化表格,每行一个模型
generate.mjs 从实时端点重新生成以上两个文件的脚本

数据列说明

  • model — 模型显示名称(如 Qwen3.5 9B Instruct
  • family — 模型系列(Qwen、Llama、Gemma、DeepSeek 等)
  • params — 参数量(十亿为单位,闭源 API 模型为 null
  • quantization — 量化方式,如 Q4_K_M
  • minRamGb — 加载所需的最小统一内存 / VRAM
  • estimatedLoadGb — 该量化下的大致内存占用
  • runsLocally — 是否存在通过注册表验证且适配至少一个消费者 RAM 等级(最高 256GB)的 Ollama 构建
  • openWeights — 权重是否公开可下载;可为 truerunsLocallyfalse(例如超大模型超出现有消费级硬件范围)
  • runtimes — 模型可运行的应用程序(ollamallama.cpplm-studio等,均为 GGUF 构建);CSV 中以竖线分隔,云端行为空
  • bestFor — 主要工作负载
  • ollamaCommand — 精确的 ollama run … 命令(仅限本地模型)

方法论

  • 适配条件:当模型的 estimatedLoadGb 在内存预算内时视为适配。在 32GB 以内设备上,预算约为统一内存的 70%;在 128GB 及以上设备上线性增至 85%(高 RAM Mac 可通过 iogpu.wired_limit_mb 分配更多内存给 GPU)。
  • 内存估计:在 Q4_K_M 量化下,模型约需 0.6 GB 每十亿参数
  • 声明:内存负载和 token/秒 数据为估算值,非实测基准。本地模型标签已通过 Ollama 注册表验证。

更新方式

在本地运行 node generate.mjs 即可从 https://modelfit.io/api/dataset/ 拉取最新数据。

许可与引用

  • 许可协议CC BY 4.0,允许商业使用和改编,但需注明出处。

  • 引用格式

    ModelFit — Local LLM Hardware Compatibility Dataset. https://modelfit.io/data/

搜集汇总
数据集介绍
ModelFit — Local LLM Hardware Compatibility Dataset 数据集图片
构建方式
在本地大语言模型部署日益普及的背景下,ModelFit数据集应运而生。该数据集通过系统性地收集Ollama生态中数百个模型的元信息,并依据严格的内存适配规则进行标注,构建了一套衡量模型与硬件兼容性的开放资源。其构建方式主要基于模型参数量、量化级别及最小内存需求等关键参数,结合苹果统一内存架构与NVIDIA显存特性,利用约70%至85%的动态内存预算线判定模型能否在特定设备上本地运行,最终以JSON和CSV两种格式发布,确保数据的机器可读性与便捷性。
特点
ModelFit数据集的核心特色在于其细粒度的硬件适配标注与实用性导向。它不仅记录了模型的名称、家族、参数量及量化类型,还提供了预估内存占用和确切的Ollama运行命令,使得用户能够快速定位适合自己设备的模型。尤为独到的是,数据集中区分了“本地可运行”与“开放权重”两种状态,揭示了即便权重公开的超大规模模型也可能因内存超限而无法在消费级硬件上使用的现实。此外,所有本地模型均经过Ollama注册表验证,确保了信息的高度可信。
使用方法
使用ModelFit数据集时,用户可直接访问其交互式表格页面浏览或过滤模型,亦可从API端点获取最新的机器可读源文件。对于程序化处理,推荐下载CSV格式的扁平化表格,利用模型名称、家族或最小内存等字段进行筛选;而需要深入元数据及统计信息时,JSON格式则更为合适。开发者还可通过运行generate.mjs脚本,从在线接口拉取最新版本以保持数据集同步。所有数据均采用CC BY 4.0许可,允许商业使用,仅需在派生作品中标注原始出处。
背景与挑战
背景概述
随着大型语言模型(LLM)在本地部署场景中的广泛应用,如何精准匹配模型与硬件资源成为制约其落地的核心瓶颈。ModelFit数据集应运而生,由ModelFit团队维护,旨在系统化记录Ollama框架下本地AI模型与Apple Silicon Mac、iPhone及NVIDIA GPU等消费级硬件的兼容性信息。该数据集创建于2024年,核心研究问题聚焦于模型参数量、量化等级、最小内存需求与实测内存占用之间的量化关系,通过收录超百款模型的全量元数据,为开发者提供从Qwen、Llama等主流系列到闭源API模型的硬件适配参考。其影响力在于首次以结构化方式整合了本地LLM的硬件兼容性知识,填补了该领域缺乏公开基准数据的空白,为模型选型与硬件升级决策提供了科学依据。
当前挑战
该数据集的核心挑战体现在两大维度。领域问题层面,本地LLM部署面临模型内存占用波动大(受上下文长度、KV缓存影响)、量化精度与推理速度的平衡难题,以及异构硬件(如iPhone与NVIDIA GPU)对内存预算的不同分配策略,导致既有的粗略参数-内存估算公式(如0.6GB/十亿参数)难以覆盖实际场景的复杂性。构建过程中,数据准确性验证面临严峻考验:需通过Ollama注册表逐一核对本地模型标签,闭源API模型的参数量缺失需特殊处理;内存负载估算值基于理论推算而非实测基准,且高内存Mac的显存限制(iogpu.wired_limit_mb)因系统配置而异,使得70%-85%的内存阈值线性缩放模型存在精度损失。此外,数据集的持续更新机制依赖社区维护,新模型涌现快迭代速度快,如何保障时效性与完整性亦是重大挑战。
常用场景
经典使用场景
在大语言模型本地化部署日益普及的当下,ModelFit数据集为研究人员和开发者提供了精准的硬件兼容性评估工具。该数据集经典的使用场景是评估不同参数规模(从数B到数百B)的本地AI模型(如Qwen、Llama、Gemma等)在各种消费级硬件上的运行可行性,涵盖Apple Silicon Macs、iPhones及NVIDIA GPUs等平台。通过记录模型的参数量、量化级别(如Q4_K_M)、最小RAM需求及估计内存占用等关键指标,研究者可以系统性地比较不同模型在特定硬件上的适配性,从而筛选出适合特定内存预算的设备-模型组合。这一场景尤其对于资源受限的边缘设备上部署大语言模型的研究至关重要。
实际应用
在实际应用中,ModelFit数据集直接服务于个人开发者与企业用户进行本地大语言模型的选型与部署决策。普通用户、创作者和中小企业可以利用该数据集快速判断其现有设备(如MacBook、iPhone或搭载NVIDIA GPU的个人电脑)能否流畅运行特定本地模型(如通过Ollama、llama.cpp或LM Studio等运行时)。数据集还提供了精确的Ollama命令,便于一键启动。应用场景包括在离线环境中进行文档摘要、代码辅助、文本生成等,避免了云端API的延迟与隐私风险。对于硬件厂商和模型开发者,该数据集也可用于优化产品兼容性测试流程,指导下一代硬件的内存与算力设计,满足用户对本地智能助手日益增长的需求。
衍生相关工作
围绕ModelFit数据集已衍生出若干有价值的后续研究与应用工作。首先,该数据集的交互式网页(modelfit.io/data)与机器可读API接口为社区提供了持续更新的硬件适配检索系统,促进了模型兼容性信息的动态维护。其次,该数据集所定义的内存估算方法论(内存负载约等于0.6 GB×参数量,且考虑不同容量设备下的可支配内存比例)成为了后续量化推理性能预测研究的参考基准。此外,数据集中对开源权重与本地运行状态的分类(runsLocally与openWeights字段)为分析本地与云端模型的可获得性差异提供了结构化数据支撑,激发了关于模型分发、隐私保护与本地算力竞争的跨学科讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务