遇见数据集

china-ai-bench-benchmarks

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

China AI Bench 是一个用于评估中文AI模型的基准测试数据集,由 Benchmarks Desk 维护。该数据集包含多个模型在11个任务(覆盖6个维度)上的测试结果,以及完整的原始提示-响应日志。数据以JSON格式组织,每条记录包含运行日期、模型标识、API信息、采样参数(如温度、最大token数)、任务名称、提示、响应、检查结果(PASS/FAIL)、延迟和成本等字段。目前数据集包含多个运行批次,例如2026-08-03的DeepSeek V4烟雾测试(22次API调用)、2026-08-07的五个中国模型测试(55次API调用)和四个国际模型测试(44次API调用)。所有运行使用相同的11任务电池和预注册提示集,确保跨模型可比性。数据集可用于复现基准测试、比较模型在中文任务上的表现,以及研究模型行为。数据在GitHub和Hugging Face数据集(EliChen-ai/china-ai-bench-benchmarks)上公开。

China AI Bench is a benchmark dataset for evaluating Chinese AI models, maintained by Benchmarks Desk. It contains test results of multiple models on 11 tasks (covering 6 dimensions) along with complete raw prompt-response logs. The data is organized in JSON format, with each record including fields such as run date, model identifier, API information, sampling parameters (e.g., temperature, max tokens), task name, prompt, response, check result (PASS/FAIL), latency, and cost. The dataset currently includes multiple run batches, e.g., the DeepSeek V4 smoke test on 2026-08-03 (22 API calls), five Chinese model tests on 2026-08-07 (55 API calls), and four international model tests (44 API calls). All runs use the same 11-task battery and pre-registered prompt set to ensure cross-model comparability. The dataset can be used to reproduce benchmarks, compare model performance on Chinese tasks, and study model behavior. The data is publicly available on GitHub and Hugging Face Datasets (EliChen-ai/china-ai-bench-benchmarks).

创建时间:
2026-08-08
原始信息汇总

China AI Bench 数据集概述

基本信息

  • 数据集名称: China AI Bench — evaluation toolkit & methodology
  • 数据集链接: https://huggingface.co/datasets/EliChen-ai/china-ai-bench-benchmarks
  • 许可协议: MIT
  • 维护方: Benchmarks Desk(品牌域名:chinaaibench.com)
  • 关联平台: China AI Bench 排行榜

数据集内容与结构

该数据集是 China AI Bench 排行榜的原始数据镜像,包含完整的模型评测工具链和审计数据,具体结构如下:

  • benchmarks/: 任务电池定义(11 个任务 / 6 个维度)、排行榜快照、已发布的运行摘要
  • data/raw-logs/: 完整的提示词/响应归档,按模型分目录存储,含预注册提示词集
  • backend/: 数据采集管道(RSSHub/直接 RSS 客户端、SQLite 四表持久层)
  • scripts/: 站点构建时数据生成与验证脚本

评测方法

  • 评分规则: 每个任务 PASS/FAIL 判定,模型得分为 X/11
  • 可复现四要素: 任务集、固定采样参数、版本快照、原始日志
  • 采样参数: 温度默认、max_tokens 64–512/任务、禁用思考模式(跨模型可比)
  • N=1 信号明确标注为 smoke-test 信号,非统计评估

已发布测试结果(截至 2026-08-07)

中国模型电池(55 次 API 调用,$0.010518)

模型 得分 失败任务
GLM-5.2 11/11
doubao-seed-2-1-pro 11/11
Step-3.5-Flash 10/11 ipv4-validator
Hunyuan-A13B-Instruct 10/11 math-quadratic-roots
Ling-flash-2.0 11/11

美国/欧洲模型电池(44 次 API 调用,$0.096123)

模型 得分 失败任务
GPT-5.6 Luna Pro 11/11
Claude Opus 5 10/11 writing-product-copy
Gemini 3.6 Flash 11/11
Grok 4.5 11/11

DeepSeek 测试

  • 2026-08-03: V4 Pro 11/11;V4 Flash-0731 10/11(math-consecutive-integers)
  • 2026-08-07: V4 Pro 11/11;V4 Flash 10/11(math-quadratic-roots)

数据分级来源框架

层级 徽章 定义
L1 Tested by us 自有运行,原始日志已发布
L2 Compiled 来源可溯且交叉验证(含来源 URL、捕获日期、性质)
L3 Tracked 在监控中但无可验证数据,不显示分数

编译数据点必须包含四个属性:数值、来源 URL、捕获日期和性质(官方/厂商报告/第三方评估/社区测试/媒体报告)。无法验证的数据标注为 unverifiedn/r

更新频率

  • 事件驱动(重大发布/开源权重/大幅分数变化): 48 小时内更新
  • 定价快照: 每周
  • 数据复核: 每月全面检查
  • 内部重测: 每季度或重大版本后

原始日志格式

每条记录包含运行日期、模型 ID、API 类型、采样参数、任务名称、完整提示词、完整响应、判定结果、延迟、token 数和成本。原始日志同时镜像在 GitHub 仓库和该 Hugging Face 数据集中。

搜集汇总
数据集介绍
china-ai-bench-benchmarks 数据集图片
构建方式
该数据集的构建遵循严格的科学评估范式,依托于一套完整的任务电池与预注册提示集。数据集的核心架构由11项任务、6个评估维度构成,每项任务均配有预先撰写的评分细则及可核对的基准答案。所有测试运行均采用固定的采样参数,包括温度、top_p及max_tokens,并统一关闭思考模式以确保跨模型可比性。每次运行需记录模型版本快照与API日期,并发布原始日志作为审计证据。数据集还包含多层次的数据来源体系,将自测数据、第三方编译数据及追踪数据清晰分级,每种级别绑定特定的表述权限,确保每一条数据皆有据可查。
特点
该数据集最显著的特征在于其可复现性与透明性。每一轮测试均附带完整的提示词、响应、判定结果、延迟、token消耗及成本明细,原始日志以结构化格式存档并同步至HuggingFace平台。数据集采纳N=1信号标记,明确区分冒烟测试与统计评估,对于复现的失败案例会如实记录两次,若在不同配置下通过则附注修复条件。此外,数据集成为了多维度的评分体系,编辑评分与任务结果相辅相成,既提供细粒度的任务级PASS/FAIL判定,又汇总为0至10的维度分数,使模型能力的刻画更为立体。来源追踪功能确保了每条数据均可追溯至官方文档、第三方评测或媒体报告,未经验证的数据标注为'未核实',绝不使用'据称'等模糊表述。
使用方法
使用者可通过浏览benchmarks目录下的任务电池定义文件了解全部评测任务与评分规则,参考results文件夹中的运行摘要快速掌握各模型的横向对比成绩。若要深入验证具体模型的输出质量,可访问data/raw-logs目录查阅完整提示词与响应记录,或直接加载HuggingFace数据集进行离线分析。该数据集支持复现实验,使用者可在固定采样参数与同一预注册提示集的前提下,对任意模型执行相同任务电池,并将结果与现有榜单数据进行比对。数据集的定期更新机制保证了信息的时效性,事件驱动的行更新确保重大模型发布或分数变化在48小时内反映,月度数据重检与季度内部复测进一步巩固了数据的可靠性与持续性。
背景与挑战
背景概述
中国人工智能领域的蓬勃发展催生了众多国产大模型,但缺乏统一、透明且可复现的评测体系,使得模型性能的比较与选择变得困难。在此背景下,Benchmarks Desk于2026年推出了China AI Bench数据集,旨在构建一个桌面级的中文AI模型基准测试工具集与排行榜。该数据集由Eli Chen等研究人员维护,通过严格的测试协议(包括固定任务集、采样参数、版本快照和原始日志)对不同模型进行标准化评估,其影响力在于提供了一个开源、可审计的评测框架,促进了中国AI模型的良性竞争与透明度,并已成为该领域内具有参考价值的第三方评测基准。
当前挑战
China AI Bench数据集面临多重挑战。首先,其核心任务11项测试电池(11-task battery)虽覆盖6个维度,但样本量小(每模型仅11项),且N=1信号被明确标注为smoke-test,这降低了统计显著性,难以精确反映模型真实能力,是领域内评测普遍存在的难题。其次,构建过程中需确保跨模型、跨平台(如OpenRouter)的公平性,但实际运行遭遇了诸如模型因‘思考模式’消耗预算导致输出为空、API重试影响结果等情形,需进行标准化处理。此外,数据来源的多层架构(Tested-by-us、Compiled、Tracked)与严格的溯源要求,加剧了数据收集的复杂度;同时,成本控制(如每次运行需花费美元)与定期的数据更新(如48小时内响应重大发布)也对资源的持续投入提出了要求,构成了可持续性挑战。
常用场景
经典使用场景
china-ai-bench-benchmarks数据集作为中国AI模型基准测试的核心工具集,其经典使用场景在于构建一个可复现、透明且可审计的模型评估框架。研究者利用该数据集中的11项任务、6个维度的预注册提示集和评分规则,对各类中文AI模型进行标准化测试。通过固定采样参数、记录完整原始日志和版本快照,数据集确保了跨模型、跨时间点比较的公平性和可比性,为学术界提供了一套严谨的模型性能度量基准。
衍生相关工作
基于该数据集的方法论和数据架构,衍生出了一系列相关工作。其RSSHub采集管道与SQLite持久层设计为构建自动化的模型测评聚合系统提供了范例;预注册提示集和原始日志归档模式被后续研究借鉴,以提升评估的严谨性。此外,该数据集促进了面向中文语境的定制化基准测试的开发,其“测试于己”与“编译数据”的分层理念也影响了后续评估工具的设计,鼓励研究者公开完整评估材料,推动了开放科学在AI评估领域的实践。
数据集最近研究
最新研究方向
在人工智能伦理与治理领域,中国AI基准(China AI Bench)的开源评测套件正引领着一场关于模型能力验证的范式革新。该数据集不仅承载着对DeepSeek、GLM等国产前沿模型的细粒度性能剖析,更通过预设任务组、固定采样参数与完整原始日志的三重保险,构建起抵御‘评测通胀’的可审计基准。其前沿性体现在对N=1信号明确定位为烟测而非统计评估的审慎态度,以及跨中西模型同台竞技时对采样方差与配置依赖性的坦率披露。这一方法论体系,呼应着全球对AI评测透明化与可复现性的迫切需求,为行业树立了‘可溯源真相’的标杆,其影响深远,正重塑着从学术认证到产业部署的信任链路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务