遇见数据集

ai-model-pricing-daily

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

AI Model Pricing Daily 是一个每日更新的AI模型定价与元数据快照数据集。该数据集通过Dynamic Feed实时、可验证的API收集并导出,每个API响应均使用Ed25519算法进行数字签名,确保数据的真实性和完整性。数据集以每日一个JSONL文件的形式发布(例如 data/YYYY-MM-DD.jsonl),每行包含一个AI模型的详细记录。 数据内容涵盖多个主流AI服务提供商(如 OpenAI、Anthropic、Google、Mistral、Groq 等)的旗舰模型和开源模型。每条记录包含丰富的字段信息,主要包括:提供商(provider)、模型标识符(model_id, display_name)、定价信息(每百万token的输入、输出及缓存输入成本,以美元计)、技术规格(上下文窗口大小、最大输出token数)、模型能力(支持的多模态特性、工具调用、视觉功能)、元数据(知识截止日期、发布状态如GA或预览版)以及数据溯源信息(测量时间、来源URL、编译者)。 每个数据文件的首行是一个特殊的 `_meta` 记录,包含导出日期、API调用信息、许可证以及原始API响应的Ed25519签名和SHA-256哈希值,用于端到端的签名验证。数据集遵循CC BY 4.0许可证,要求署名“Dynamic Feed (dynamicfeed.ai)”。 该数据集适用于需要跟踪AI模型市场价格变化、进行成本分析、模型比较或构建相关应用程序的任务,特别是表格问答(table-question-answering)场景。其每日快照的特性为研究模型定价的动态演变提供了时间序列数据基础。

AI Model Pricing Daily is a daily-updated dataset of AI model pricing and metadata snapshots. This dataset is collected and exported via real-time, verifiable APIs from Dynamic Feed, with each API response digitally signed using the Ed25519 algorithm to ensure data authenticity and integrity. It is released as one JSONL file per day (e.g., data/YYYY-MM-DD.jsonl), where each line contains a detailed record for one AI model. The dataset covers flagship and open-source models from multiple leading AI service providers including OpenAI, Anthropic, Google, Mistral, Groq, and others. Each record includes rich field information, mainly: provider, model identifiers (model_id, display_name), pricing information (input, output, and cached input costs per million tokens, denominated in USD), technical specifications (context window size, maximum output tokens), model capabilities (supported multimodal features, tool calling, visual functions), metadata (knowledge cutoff date, release status such as GA or preview version), and data provenance information (measurement time, source URL, compiler). The first line of each data file is a special `_meta` record, which contains export date, API call information, license, as well as the Ed25519 signature and SHA-256 hash of the original API response for end-to-end signature verification. The dataset is licensed under CC BY 4.0, requiring attribution to "Dynamic Feed (dynamicfeed.ai)". This dataset is suitable for tasks that require tracking changes in AI model market pricing, conducting cost analysis, model comparison, or building related applications, particularly table-question-answering scenarios. Its daily snapshot nature provides a time-series data foundation for researching the dynamic evolution of model pricing.

创建时间:
2026-06-12
原始信息汇总

数据集概述:AI Model Pricing Daily

名称:AI Model Pricing Daily (live LLM + open-model pricing snapshot)

许可证:CC BY 4.0

语言:英语

任务类型:表格问答

数据规模:少于1000条记录(n<1K)


数据集描述

这是一个每日快照数据集,收录了来自多个提供商(如OpenAI、Anthropic、Google、Mistral、Groq等)的旗舰及开源AI模型的定价与元数据。数据通过Dynamic Feed导出,该API的每次响应均经过Ed25519签名,确保数据可验证。由于模型价格可能随时变动且晚于模型训练截止日期,因此每日签名快照是记录此类数据的必要形式。

  • 实时数据源:https://dynamicfeed.ai (工具:search_ai_models,接口:POST /v1/batch,无需密钥或注册)
  • 数据来源与许可证:由Dynamic Feed测量和编译;每条数据的source_url字段指向其上游定价参考来源。快照许可证为CC BY 4.0,署名要求为"Dynamic Feed (dynamicfeed.ai)"
  • 更新频率:每日更新

文件格式

每个文件的第一行为_meta记录(结构为{"_meta": true, ...}),包含导出日期、API调用信息、许可证以及该行数据来源的Ed25519签名。后续每行对应一个模型,字段如下:

字段 描述
provider 提供商名称(如openai, anthropic, google等)
model_id, display_name 模型标识符和显示名称
input_per_1m, output_per_1m, cached_input_per_1m 每百万tokens的美元价格(输入、输出、缓存输入)
context_window, max_output_tokens token限制(上下文窗口、最大输出)
modalities, supports_tools, supports_vision 模型能力(模态、工具支持、视觉支持)
knowledge_cutoff, status 元数据(知识截止日期、状态如ga、preview等)
measured_at / updated_at 最后测量时间(UTC)
source_url, compiled_by 来源和编译者

签名验证

所有Dynamic Feed API响应均使用Ed25519签名(密钥ID:df-ed25519-4cb32e72f333,规范化方式:json-sorted-compact):

  • 公钥:https://dynamicfeed.ai/.well-known/keys
  • 签名规范:https://dynamicfeed.ai/standard
  • 在线验证器:https://dynamicfeed.ai/proof(可粘贴实时响应进行篡改检测)

_meta行存储了与实时API返回完全一致的签名对象,以及原始签名响应字节的SHA-256哈希。如需端到端验证,可自行调用实时API并按照规范校验签名。


使用示例

通过实时API获取数据: python import json, urllib.request

req = urllib.request.Request( "https://dynamicfeed.ai/v1/batch", data=json.dumps({"calls": [ {"tool": "search_ai_models", "args": {"limit": 100}} ]}).encode(), headers={"Content-Type": "application/json"}, ) resp = json.loads(urllib.request.urlopen(req).read()) models = resp["results"][0]["data"]["results"] signature = resp["signature"] cheapest = min(models, key=lambda m: m["input_per_1m"] or 9e9) print(cheapest["provider"], cheapest["model_id"], cheapest["input_per_1m"], "USD/1M in")

加载本地数据集: python import json

with open("data/2026-06-10.jsonl") as fh: meta = json.loads(next(fh)) models = [json.loads(line) for line in fh] print(len(models), "models, signed by", meta["signature_key_id"])

注意:若使用datasets.load_dataset("json", ...)加载,需过滤掉_meta为true的行。


关于Dynamic Feed

Dynamic Feed提供56个实时数据工具(涵盖天气、CVE、市场、太空、灾害、AI模型定价等),每个数据点附带新鲜度与来源信息,每次响应均带有Ed25519签名。支持无密钥MCP和REST接口。数据源目录:https://dynamicfeed.ai/sources

搜集汇总
数据集介绍
ai-model-pricing-daily 数据集图片
构建方式
该数据集名为AI Model Pricing Daily,由Dynamic Feed平台每日生成并发布,旨在捕捉AI模型定价与元数据的动态变化。构建过程依托于Dynamic Feed的实时数据API,通过调用`search_ai_models`工具,从OpenAI、Anthropic、Google、Mistral、Groq等多个主流提供商处获取旗舰及开源模型的定价信息。每日快照以JSONL格式存储,每个文件的第一行为包含导出日期、API调用详情、许可证及Ed25519签名的`_meta`元记录,后续每一行对应一个模型的完整元数据,包括提供商、模型标识、单位Token价格、上下文窗口、能力标签及来源URL等字段,确保了数据的可追溯性与完整性。
特点
该数据集的核心特点在于其实时性、可验证性与每日更新的高频率。由于模型价格常在无预告情况下变动,且晚于各模型的训练数据截止日期,该数据集以每日快照的形式提供了时间戳明确的历史记录,为追踪定价演变提供了可靠依据。尤为突出的是,每条API响应均经Ed25519数字签名,用户可通过公开密钥验证数据的完整性与来源的真实性,防止篡改。此外,数据集覆盖了多种模型能力维度,如工具支持、视觉识别及模态类型,并包含知识截止日期与状态标签,为精细化分析与比较提供了丰富元数据。
使用方法
用户可通过两种主要方式使用该数据集。其一,直接加载本地JSONL文件:读取文件首行获取`_meta`元记录,随后逐行解析其余行得到模型列表。若使用HuggingFace的`datasets.load_dataset`函数,需注意过滤掉`_meta`为真的行。其二,通过Dynamic Feed的实时API无密钥调用,发送POST请求至`https://dynamicfeed.ai/v1/batch`,指定`search_ai_models`工具及参数,即可获取最新快照并提取签名进行验证。该设计兼顾了离线分析的便捷性与在线获取的即时性,适用于模型成本比较、市场趋势监测及合规性审计等场景。
背景与挑战
背景概述
大型语言模型(LLM)的定价策略正经历前所未有的动态变化,模型提供商频繁调整价格而无需事先通知,这给依赖统一、可信价格数据的下游应用带来了严峻挑战。在此背景下,Dynamic Feed 团队于2024年推出了 AI Model Pricing Daily 数据集,旨在构建一个每日更新、可验证的AI模型定价快照。该数据集由 Dynamic Feed 机构维护,覆盖 OpenAI、Anthropic、Google、Mistral、Groq 等主流提供商,核心研究问题聚焦于捕捉模型输入输出价格、上下文窗口、能力元数据及来源证明的时序变化。通过 Ed25519 签名机制确保每条记录的不可篡改性与来源可信度,该数据集为机器学习模型价格波动分析、经济建模及自动化决策提供了珍贵的高频基准,对 LLM 成本监控和市场透明化研究产生了深远影响。
当前挑战
领域挑战方面,AI模型定价信息缺乏标准化 API 与统一发布渠道,价格变动往往隐匿于服务条款的零星更新中,导致学术界与工业界难以追踪真实的、实时的成本结构。构建挑战则体现在:其一,需要从多个提供商的不同格式定价页面中异构抽取数据,并保证字段(如输入/输出价格、缓存扣费、最大输出令牌数)的精准对齐;其二,每日快照要求可靠的自动化抓取管道,以应对服务中断、接口改版等异常;其三,为应对数据溯源与防篡改需求,每条记录必须附带 Ed25519 数字签名,并确保快照文件与实时 API 响应的哈希一致性,形成了系统化的验证闭环。
常用场景
经典使用场景
在人工智能模型定价与部署优化的研究领域,AI Model Pricing Daily 数据集扮演着不可或缺的角色,它如同一面棱镜,折射出旗舰模型与开源模型在各大服务商之间的价格全貌。该数据集最经典的使用场景在于构建实时定价对比系统,研究者可借此追踪每日更新的模型成本波动,分析 input/output 每百万令牌价格的动态变化,并结合上下文窗口、输出上限等元数据,为成本敏感的模型选择提供数据驱动的决策依据。
解决学术问题
该数据集精准地解决了学术界长期面临的模型定价信息不透明、更新滞后且缺乏统一基准的难题,为计算经济学与机器学习交叉领域的实证研究提供了可靠基石。通过提供每日签署且可验证的定价快照,它使得学者能够量化分析不同提供商之间的价格竞争格局,探索模型定价与性能指标之间的内在关联,进而推动更公平、更高效的模型评估与选择标准的建立,其影响已延伸至资源受限场景下的模型部署策略制定。
衍生相关工作
围绕该数据集的独特价值,一系列经典工作应运而生,包括基于 Ed25519 签名的数据源可验证性框架研究,以及利用每日快照进行模型定价趋势预测的时间序列分析。研究者还借鉴其 provenance 元数据设计,开发了跨平台模型元数据对齐工具,推动了开放模型生态系统中的透明性建设。更值得注意的是,该数据集启发了对动态数据市场基础设施的探索,其签名与验证机制为去中心化数据源的可信度确立提供了可复现的范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务