遇见数据集

validation-set-benchmarks

收藏
github2026-07-05 更新2026-07-13 收录
官方服务:

资源简介:

该仓库包含原始测量数据和JSON格式的基准测试文件,用于验证和复制The Validation Set系列视频中的基准测试结果。数据集包括每集的性能指标、成本模型和评估任务,如本地AI与云成本比较、模型质量考试和运行时性能测试等。

This repository contains raw measurement data and JSON-formatted benchmark files, which are designed to validate and replicate the benchmark results from the "The Validation Set" video series. The dataset includes performance metrics, cost models, and evaluation tasks for each episode, such as local AI versus cloud cost comparisons, model quality assessments, and runtime performance tests, among others.

创建时间:
2026-06-18
原始信息汇总

数据集概述

本仓库是 YouTube 频道 The Validation Set 的配套数据集与渲染引擎,专门用于复现和验证视频中所有基准测试的原始测量结果。

核心内容

数据文件 (data/)

每个 JSON 文件对应一集视频的原始测量数据与建模数据,包含:

  • 每集独立的 JSON 文件:如 ep001_local-vs-cloud.jsonep004_quality.json 等,记录该集所有图表背后的数字。
  • 评估任务集eval_tasks.json(15 个任务的评分考试标准)和 workload.json(提示集)。

渲染引擎 (src/)

  • 基于 Remotion 的数据驱动视频渲染引擎。
  • 包含可复用的图表组件、主题系统,以及一个 TimelineManager,能将带时间戳的对齐脚本自动转化为视频。
  • 提供示例脚本 script.aligned.example.json,供引擎开箱编译和渲染。

各集基准测试摘要

集数 核心问题 关键测量结果
01–02 本地AI是否比云端更便宜? 相同模型:云端快约4.3倍,但托管API每年代理成本约$7,200;本地设备约第5个月即可回本。
03 一台廉价8GB设备能运行多少代理? 可用拐点为2个代理(Ollama默认串行,尾延迟从~6秒升至60秒以上);8B模型完全无法加载。
04 廉价本地模型足够智能吗? 15项任务考试(温度0,确定性评分):3B得分80%(~25 tok/s),8B得分87%(~6 tok/s),14B无法运行。全部差距源于多步数学。
05 Claude Fable 5的实际成本? 每100万token $10 / $50,正好是Opus 4.8的2倍。
06 前沿模型在同一考试中表现如何? 15/15满分,整场考试约$0.02,但每个正确答案的成本是3B模型的约657倍。
07 自托管何时能胜过托管API? 相同8B模型在笔记本上 vs Groq:托管API快约56倍且每个token更便宜,在任何规模下都没有回本点
08 你真的需要向量数据库吗? Chroma默认召回率随语料库增至20万向量从97%滑落至~50%;暴力NumPy始终保持100%
09 哪个本地运行时更快? 相同3B模型,相同Mac:Ollama 23.95 vs MLX 23.8 tok/s,几乎无差异。真正差距是成本:笔记本电力每100万token约$0.12 vs 租用GPU。
10 你的代理能抵御多少提示注入? 间接注入攻击:无防御时本地模型80%遵从;一次上下文隔离防御后降至0%
11 哪种量化方案适合8GB笔记本? FP16(~16GB)和Q8(~8.5GB)无法运行(Q8交换至~0.03 tok/s);只有Q4(~4.8GB)可运行,且得分87%
12 训练感知4-bit(QAT)比朴素4-bit(PTQ)更好? 相同Gemma 12B模型,两者均为4-bit:考试得分80%平手;QAT仅快约9%(32 vs 29 tok/s),多占用约0.8GB。
13 保持本地还是付费上云? 本地3B(80%,仅多步数学弱)+ 前沿云端模型(100%)的组合路由器:仅将弱项数学任务交给云端,可实现100%准确率且仅27%云端调用,节省约73%云端费用
14 RAG重排序器真的有用吗? 双编码器已能准确命中第一召回:简单语料库recall@1从92%提升至100%(修复12项中的1项),困难语料库保持100%。重排序器修复的是顺序而非召回率

基准测试复现方法

所有基准测试方法刻意保持简单透明,便于验证:

  • 本地模型:通过 Ollama 运行(如 ollama pull llama3.2:3b),使用 workload.json 作为输入,直接读取引擎输出的 tok/s 和延迟。
  • 考试(第04/06集):对应 data/eval_tasks.json 中的15项任务,每项由确定性检查器(数值、字母选项、JSON结构或需通过断言的代码)在温度0下评分,不使用LLM作为裁判。
  • 云端/托管通道:需租用计算资源(如 RunPod、Vast.ai、Lambda、Groq、Together AI、Fireworks),具体方式见“复现云端通道”部分。
  • 图表渲染:每个图表直接从对应的 data/*.json 文件读取数字,修改输入后可重新渲染观察变化。

许可与引用

  • 代码src/):MIT 许可。
  • 数据data/):可自由使用,但需注明出处为 The Validation Set
搜集汇总
数据集介绍
validation-set-benchmarks 数据集图片
构建方式
Validation Set Benchmarks数据集以严谨的实测数据为核心,构建过程摒弃主观臆测,采用可复现的标准化方法。针对本地模型,直接调用Ollama引擎加载workload.json等标准化工作负载,精确记录token生成速率及延迟指标;云端模型则通过出租GPU或调用托管推理API(如Groq)进行对比测试。所有评测结果通过经确定的检查器(如数字比对、JSON格式验证、代码断言等)在温度参数设为0的严格条件下执行,避免LLM作为评判者的主观偏差。最终,实测数据与从标注输入中建模得出的成本估算(如美元/年)被汇总为JSON文件存储于data/目录,作为图表渲染的唯一原始来源。
使用方法
使用该数据集以复现基准测试时,用户可遵循平淡无奇但可验证的操作流程:首先安装Ollama并拉取指定模型(如ollama pull llama3.2:3b),再将workload.json作为输入驱动引擎,直接从输出中读取速度与延迟数据。若要选用云端对照,可灵活选择RunPod等GPU租赁或Groq等托管API。数据集中的eval_tasks.json包含15项可重复评分的任务,每项附带确定性检查器,支持在本地8GB苹果硅能Mac或更高配置上重跑,并将自身结果与官方榜单对比。所有图表数据均来自data/目录下对应的JSON文件,用户修改输入后重新渲染即可观察图表联动变化。
背景与挑战
背景概述
The Validation Set 数据集由专注于AI性能实测的团队创建,依托其同名YouTube频道,于2024年陆续发布。该数据集的核心研究问题是量化本地与云端AI部署方案的真实成本与性能差异,涵盖推理速度、吞吐量、准确率及经济性等维度。通过标准化评测框架(如15任务基准测试)和可复现的测量方法,数据集为社区提供了超越厂商宣传的客观数据,对AI系统选型、资源规划及成本效益分析等领域产生了重要影响,促使研究者与工程师以实证为导向重新审视AI部署策略。
当前挑战
该数据集面临的核心挑战包括:1)领域问题挑战:现有AI基准测试多依赖LLM-as-Judge或主观评估,缺乏可复现的确定性评分,导致结果难以横向对比;同时,本地与云端部署的性能差异受硬件配置、模型量化、推理引擎等多变量影响,传统单一指标(如token/s)无法全面反映实际成本效益。2)构建挑战:需要设计对硬件无关的标准化评测管线(如Ollama、Groq等),平衡不同运行时(MLX、Ollama)的测量一致性,并建模动态成本(如电力、API定价波动)。此外,数据集的规模受限于手动生成的评测任务(如15-task exam),缺乏大规模自动化扩展能力,而多语言、多模态评测的缺失也限制了其应用边界。
常用场景
经典使用场景
在人工智能与开源大模型飞速演进的浪潮中,验证实验数据真伪、复现基准测试结果成为学术研究与技术选型的核心痛点。The Validation Set 数据集(validation-set-benchmarks)提供了一套可复现、可校验的本地与云端模型多维度实测数据,涵盖推理延迟、吞吐量、成本核算、量化精度及安全鲁棒性等关键指标。其经典使用场景在于为研究者提供一个标准化的实验锚点:通过统一的量化指标(如 tokens/s、成本/正确回答比)和可执行的复现脚本(基于 Ollama 等运行时),研究人员能够直接对比不同模型(如 3B、8B、14B 参数级别)在同质化硬件条件下的真实表现,从而系统性地评估模型效率与质量的权衡关系。
解决学术问题
该数据集精准回应了当前大模型研究中普遍存在的'基准测试黑箱'难题——即众多研究仅报告理想化性能,却缺乏对硬件约束、量化策略、推理成本等现实因素的彻底解耦。通过提供涵盖 15 项确定性评分任务(evaluated by deterministic checker,杜绝 LLM-as-judge 的主观偏差)的标准化评估体系,数据集有效解决了模型间公平对比的基准缺失问题。其深远意义在于揭示了若干被学术界长期忽视的微妙现象:例如本地部署的 3B 模型在多数任务中仅弱于前沿模型的多步数学推理环节、QAT 量化与 PTQ 量化在准确率上并未显著差异,以及局部推理在特定负载下无法在成本上超越云端 API。这些发现推动研究社区对'高效本地推理'和'成本效益最优路由器'等前沿方向展开更严谨的探索。
实际应用
在实际产业部署中,该数据集为技术选型提供了可量化的决策支持。以企业构建智能客服或自动化代理为例,开发者可依据数据集中的延迟-成本曲线(如 8GB 显存下 Q4 量化 8B 模型独占可行区间)精确匹配模型与硬件资源,避免过早投入高昂的云端 API 费用。同时,针对 RAG 系统开发场景,数据集中关于向量数据库召回率随规模递增而下滑(Chroma 从 97% 降至 ~50%)的实证数据,直接指导工程师采用朴素 NumPy 暴力搜索或引入重排序模块来保障检索质量。此外,面对提示注入攻击威胁,数据集提供的无防御 80% 执行率与上下文隔离后降至 0% 的对比数值,为安全团队设定基线防护策略提供了宝贵的基准参考。这些实测数据有效连接了学术论证与工程落地之间的鸿沟。
数据集最近研究
最新研究方向
在边缘计算与大模型本地化部署的交汇点,'The Validation Set'系列基准测试正聚焦于一个核心矛盾——性能与成本的帕累托边界。该数据集以实测数据揭示了小参数模型(如3B/8B)在消费级硬件(8GB内存)上的真实表现边界,尤其关注量化技术(如Q4)、推理引擎(Ollama vs MLX)与智能路由策略对成本效益的颠覆性影响。研究前沿已从单纯的模型精度对比,转向'混合推理架构'的经济学建模:通过将80%准确率的本地模型与云端前沿模型进行协作,仅将多步数学等薄弱环节的27%查询路由至云端,即可在实现100%准确率的同时降低73%的云端调用成本。这一发现直接挑战了传统API调用的性价比神话,为资源受限场景下的AI代理部署提供了数据驱动的决策指南。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务