遇见数据集

LLM Price / Performance Dataset (2026)

收藏
github2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

一个开放、手动验证的数据集,包含30多个AI模型(LLMs)的规格、API定价(每100万令牌美元)、许可证、上下文窗口和复合智能分数,以及衍生的价格/性能排名。由Convly维护,并随着新模型的发布而更新。

An open, manually verified dataset containing specifications, API pricing (USD per 1 million tokens), licenses, context windows, and composite intelligence scores of over 30 AI models (LLMs), as well as derived price/performance rankings. Maintained by Convly and updated as new AI models are released.

创建时间:
2026-07-14
原始信息汇总

数据集概述:LLM Price / Performance Dataset (2026)

该数据集是一个由 Convly (https://convly.ai) 维护的、手工验证的开源数据集,旨在提供 30 多个 AI 模型(LLM)的核心规格、API 定价、许可证、上下文窗口以及复合智能评分,并据此生成性价比排名。

核心内容

  • 数据规模与覆盖:包含 30+ 个 AI 模型,涵盖 OpenAI、Anthropic、DeepSeek、Alibaba、Meta、Google 等主流开发商。
  • 关键发现
    • 模型中每美元智能产出差异高达 ~62 倍(基于综合智能评分)。
    • 性价比最高的模型(DeepSeek V4-Flash)每美元提供约 192 个智能点,而最昂贵的模型(GPT-5.5)仅约 3 个
    • 截至 2026 年 7 月,智能评分最高的是开源模型 Moonshot 的 Kimi K3(评分 57),略高于 Claude Opus 4.8(55.7),且每美元智能产出高出约 1.7 倍
  • 数据格式
    • ai-models.json:完整数据集,每个模型一个对象。
    • ai-models.csv:与 JSON 相同的 CSV 格式,便于数据处理。
    • price-performance.csv:导出数据,包含混合价格、智能评分和每美元智能评分,按性价比从高到低排序。
    • build_dataset.py:用于从 JSON 重新生成 CSV 文件的脚本。

数据列定义

列名 含义
name, slug 模型名称和 URL 别名
developer 开发者(如 OpenAI, Anthropic 等)
model_type 模型类型(稠密 / MoE / 推理 / 多模态)
modality 输入到输出的模态
parameters 总参数量 / 激活参数量(MoE 会注明)
context_window, max_output 上下文窗口和最大输出令牌限制
license, open_weights 许可证类型,是否开放权重(是/否)
release_date 发布日期
input_price, output_price API 价格,单位为每 1M 令牌的美元数
api_providers 可调用的 API 供应商
intelligence 基准测试综合评分(0-100,未评分则留空)

衍生工具

数据集支持以下交互式在线工具(无需实际访问,仅作文本说明):

  • LLM 排行榜:按智能、价格和上下文排名模型 (https://convly.ai/llm-leaderboard/)
  • AI 模型数据库:完整规格表 (https://convly.ai/models/)
  • AI API 成本计算器:估算每月成本 (https://convly.ai/ai-api-cost-calculator/)
  • LLM VRAM 计算器:检查本地 GPU 是否能运行 (https://convly.ai/llm-vram-calculator/)
  • 自托管 vs API 盈亏平衡计算器 (https://convly.ai/self-hosting-vs-api-calculator/)

许可证与贡献

  • 许可证CC-BY-4.0,允许自由使用、分享和改编(包括商业用途),需归属 Convly (https://convly.ai)
  • 贡献方式:发现错误、价格过时或缺失模型时,欢迎提交 Issue 或 Pull Request。

注意事项

  • 免责声明:价格、规格和可用性会频繁变化。智能评分为公开基准测试的综合估算值,重要信息应直接与提供商核实。
搜集汇总
数据集介绍
LLM Price / Performance Dataset (2026) 数据集图片
构建方式
该数据集由Convly团队精心维护,专注于收集并整理30余款主流大语言模型的核心参数与性能指标。构建过程采用手工验证的方式,确保每条数据的准确性与时效性。数据来源涵盖模型开发方的官方文档、API定价页面及公开基准评测,经过统一格式化后整合为JSON与CSV格式。核心数据集保存在ai-models.json中,每条记录包含模型名称、开发者、架构类型、参数量、上下文窗口、许可证与开放权重状态、发布日期、输入输出价格及综合智能评分。基于此,进一步衍生出price-performance.csv,通过计算每美元获得的智能点数,生成性价比排名。数据集的构建逻辑既考虑了信息的全面性,也强调了跨模型横向对比的可操作性,为模型选型提供结构化参考。
特点
该数据集的核心特色在于其多维度的综合评估体系与显著的性价比差异揭示。每条模型记录不仅包含常见的规格参数与API定价,还引入了0至100分的复合智能评分,该评分整合了多项公开基准结果,提供了一种跨越不同任务类型的抽象能力度量。从数据中可观察到,智能单价在不同模型间存在约62倍的巨大差异,例如DeepSeek V4-Flash每美元可提供约192个智能点数,而GPT-5.5仅约3点,这一发现直观反映了开源模型与闭源前沿模型在成本效益上的显著分野。数据集还特别标注了MoE架构与活跃参数量,适合深入分析稀疏化模型的经济性优势。
使用方法
使用者可直接从GitHub仓库下载ai-models.json或ai-models.csv文件,利用Python的pandas库或任何CSV解析工具快速加载数据,进行筛选、排序与可视化分析。对于性价比评估,可直接参考price-performance.csv中的排名结果。若需重现或更新CSV文件,可运行仓库内的build_dataset.py脚本。此外,Convly平台提供了基于该数据集的交互式工具,包括LLM排行榜、模型规格浏览器、API成本计算器及本地部署显存估算器,用户可通过网页界面直观比较模型。数据采用CC-BY-4.0许可证,允许商业用途,使用时需注明来源为Convly。建议使用者结合原始服务商信息,对价格与性能变动进行二次确认。
背景与挑战
背景概述
随着大型语言模型(LLMs)在人工智能领域的广泛应用,开发者和企业在模型选型时面临信息碎片化、规格参数与定价标准不一的困境。为应对这一挑战,Convly团队于2026年创建了Performance Dataset,由该机构维护并持续更新。该数据集核心研究问题在于:如何系统性地量化模型性能与成本之间的关系,从而揭示不同模型在智能体量(intelligence)与每美元智能价值上的巨大差异。数据集收录了30余个主流AI模型的规格、API定价、许可证及上下文窗口等关键属性,并创新性地融合公共基准测试结果形成0-100的复合智能评分。其衍生分析已证明,模型间每美元智能产出差距可达62倍至114倍,为业界提供了极具洞察力的性价比排名基准,对该领域的研究与商业决策产生了重要影响。
当前挑战
该数据集所解决的领域问题聚焦于模型选型的信息不对称性,即用户难以在散落的规格与基准测试中快速评估模型的实际效能与成本效益。构建过程则面临多重挑战:首先,各类模型的定价、规格与可用性频繁变动,需持续追踪并验证数据的实时性与准确性。其次,智能评分的生成依赖于多个公开基准测试的融合,而不同基准的权重设定与评分方法论本身存在主观性,可能导致评分与真实场景表现偏离。此外,数据集需处理Moe架构、多模态、推理模型等异构模型的参数归一化与对比,确保比较的公平性。最后,开放权重模型与商业API模型的许可证差异,也增加了数据标注与法律合规的复杂度。
常用场景
经典使用场景
在人工智能模型选型与评估领域,PerFormance Dataset (2026) 提供了一个系统化、标准化的基准数据平台,涵盖30余种大型语言模型的技术规格、API定价、上下文窗口及综合智能评分。研究者可基于该数据集快速对比不同模型的性价比,例如通过智能-价格比(intelligence-per-dollar)指标,精准识别出如DeepSeek V4-Flash这类以极低成本提供较高智能水平的开源模型,从而在模型选择、预算规划与性能优化中实现数据驱动的决策支持。
衍生相关工作
基于该数据集衍生的经典工作包括Convly平台推出的系列可视化与计算工具,如LLM Leaderboard与AI API Cost Calculator,这些工作将原始结构化数据转化为直观的排名与预算模型,极大降低了非专业用户的认知门槛。此外,该数据集启发了对模型智能-价格比的多维分析研究,例如通过不同成本加权方式测算出模型性价比差异可达114倍,为后续关于大模型经济性、开源与闭源模型竞争格局的学术探讨提供了基础数据支撑。
数据集最近研究
最新研究方向
随着2026年大语言模型生态的持续繁荣,模型选择中的性价比评估已成为前沿焦点。本研究数据集揭示了不同模型间每美元智能得分存在高达62倍甚至114倍的悬殊差距,这一发现为算力资源受限场景下的模型部署提供了关键决策依据。值得关注的是,开源权重模型的竞争力显著提升,如DeepSeek V4-Flash与GLM 5.2以极低成本实现了近前沿水平的智能表现,而Moonshot的Kimi K3更以开源姿态登顶智能评分榜首,标志着开源模型在综合能力上首次实现对闭源标杆的超越。该数据集整合了参数规模、API定价、上下文窗口与复合智能分数等多维信息,为行业提供了从云端调用到本地部署的完整成本效益分析框架,直接回应当前AI应用落地中降本增效的核心诉求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务