china-ai-bench-benchmarks
收藏资源简介:
China AI Bench 是一个用于评估中文AI模型的基准测试数据集,由 Benchmarks Desk 维护。该数据集包含多个模型在11个任务(覆盖6个维度)上的测试结果,以及完整的原始提示-响应日志。数据以JSON格式组织,每条记录包含运行日期、模型标识、API信息、采样参数(如温度、最大token数)、任务名称、提示、响应、检查结果(PASS/FAIL)、延迟和成本等字段。目前数据集包含多个运行批次,例如2026-08-03的DeepSeek V4烟雾测试(22次API调用)、2026-08-07的五个中国模型测试(55次API调用)和四个国际模型测试(44次API调用)。所有运行使用相同的11任务电池和预注册提示集,确保跨模型可比性。数据集可用于复现基准测试、比较模型在中文任务上的表现,以及研究模型行为。数据在GitHub和Hugging Face数据集(EliChen-ai/china-ai-bench-benchmarks)上公开。
China AI Bench is a benchmark dataset for evaluating Chinese AI models, maintained by Benchmarks Desk. It contains test results of multiple models on 11 tasks (covering 6 dimensions) along with complete raw prompt-response logs. The data is organized in JSON format, with each record including fields such as run date, model identifier, API information, sampling parameters (e.g., temperature, max tokens), task name, prompt, response, check result (PASS/FAIL), latency, and cost. The dataset currently includes multiple run batches, e.g., the DeepSeek V4 smoke test on 2026-08-03 (22 API calls), five Chinese model tests on 2026-08-07 (55 API calls), and four international model tests (44 API calls). All runs use the same 11-task battery and pre-registered prompt set to ensure cross-model comparability. The dataset can be used to reproduce benchmarks, compare model performance on Chinese tasks, and study model behavior. The data is publicly available on GitHub and Hugging Face Datasets (EliChen-ai/china-ai-bench-benchmarks).
China AI Bench 数据集概述
基本信息
- 数据集名称: China AI Bench — evaluation toolkit & methodology
- 数据集链接: https://huggingface.co/datasets/EliChen-ai/china-ai-bench-benchmarks
- 许可协议: MIT
- 维护方: Benchmarks Desk(品牌域名:chinaaibench.com)
- 关联平台: China AI Bench 排行榜
数据集内容与结构
该数据集是 China AI Bench 排行榜的原始数据镜像,包含完整的模型评测工具链和审计数据,具体结构如下:
- benchmarks/: 任务电池定义(11 个任务 / 6 个维度)、排行榜快照、已发布的运行摘要
- data/raw-logs/: 完整的提示词/响应归档,按模型分目录存储,含预注册提示词集
- backend/: 数据采集管道(RSSHub/直接 RSS 客户端、SQLite 四表持久层)
- scripts/: 站点构建时数据生成与验证脚本
评测方法
- 评分规则: 每个任务 PASS/FAIL 判定,模型得分为 X/11
- 可复现四要素: 任务集、固定采样参数、版本快照、原始日志
- 采样参数: 温度默认、max_tokens 64–512/任务、禁用思考模式(跨模型可比)
- N=1 信号明确标注为 smoke-test 信号,非统计评估
已发布测试结果(截至 2026-08-07)
中国模型电池(55 次 API 调用,$0.010518)
| 模型 | 得分 | 失败任务 |
|---|---|---|
| GLM-5.2 | 11/11 | — |
| doubao-seed-2-1-pro | 11/11 | — |
| Step-3.5-Flash | 10/11 | ipv4-validator |
| Hunyuan-A13B-Instruct | 10/11 | math-quadratic-roots |
| Ling-flash-2.0 | 11/11 | — |
美国/欧洲模型电池(44 次 API 调用,$0.096123)
| 模型 | 得分 | 失败任务 |
|---|---|---|
| GPT-5.6 Luna Pro | 11/11 | — |
| Claude Opus 5 | 10/11 | writing-product-copy |
| Gemini 3.6 Flash | 11/11 | — |
| Grok 4.5 | 11/11 | — |
DeepSeek 测试
- 2026-08-03: V4 Pro 11/11;V4 Flash-0731 10/11(math-consecutive-integers)
- 2026-08-07: V4 Pro 11/11;V4 Flash 10/11(math-quadratic-roots)
数据分级来源框架
| 层级 | 徽章 | 定义 |
|---|---|---|
| L1 | Tested by us | 自有运行,原始日志已发布 |
| L2 | Compiled | 来源可溯且交叉验证(含来源 URL、捕获日期、性质) |
| L3 | Tracked | 在监控中但无可验证数据,不显示分数 |
编译数据点必须包含四个属性:数值、来源 URL、捕获日期和性质(官方/厂商报告/第三方评估/社区测试/媒体报告)。无法验证的数据标注为 unverified 或 n/r。
更新频率
- 事件驱动(重大发布/开源权重/大幅分数变化): 48 小时内更新
- 定价快照: 每周
- 数据复核: 每月全面检查
- 内部重测: 每季度或重大版本后
原始日志格式
每条记录包含运行日期、模型 ID、API 类型、采样参数、任务名称、完整提示词、完整响应、判定结果、延迟、token 数和成本。原始日志同时镜像在 GitHub 仓库和该 Hugging Face 数据集中。





