evalscope-datasets
收藏资源简介:
## 资源信息 | 资源 | ModelScope ID | 说明 | |------|--------------|------| | **代码** | `SoraAmami/evalscope-code` | 评测脚本与配置 | | **数据集** | `SoraAmami/evalscope-datasets` | 26 个 benchmark 缓存数据 (~7.7GB) | | **Docker 镜像** | `SoraAmami/evalscope-docker` | 完整 evalscope 运行环境 (~912MB tar.gz) | | **Sandbox 镜像** | `SoraAmami/evalscope-sandbox-images` | `bigcodebench-sandbox` + `python:3.11-slim` | --- ## 数据集分类与实测结果 以下结果基于 **DeepSeek-V4-Flash-INT8(no-thinking)** 在本数据集上的完整评测(`--limit none`),总耗时约 **75.24 小时**。 > **注意**:下表实测结果**不包含 SWE-bench 系列**。SWE-bench 数据已缓存在本数据集中,但每个样本需要独立 Docker 镜像运行,未包含在本次 CSV 结果中。 ### 1. 代码与工程 | Benchmark | 得分 | 实测时间(h) | 总样本数 | 延迟_mean(s) | 输出 TPS | 特殊要求 | |-----------|------|------------|---------|-------------|---------|----------| | bigcodebench | 0.9956 | 0.99 | 1140 | 10.16 | 32.99 | sandbox 镜像 | | humaneval | 0.9044 | 0.12 | 164 | 2.78 | 42.59 | sandbox 镜像 | | live_code_bench | 0.6756 | 7.95 | 100 | 10.42 | 43.58 | 无 | ### 2. 推理与数学 | Benchmark | 得分 | 实测时间(h) | 总样本数 | 延迟_mean(s) | 输出 TPS | 特殊要求 | |-----------|------|------------|---------|-------------|---------|----------| | aime24 | 0.6167 | 1.22 | 30 | 42.44 | 44.85 | multi-run x12 | | aime25 | 0.4639 | 2.04 | 30 | 59.98 | 46.04 | multi-run x12 | | aime26 | 0.5611 | 1.48 | 30 | 51.64 | 44.66 | multi-run x12 | | hmmt26 | 0.4015 | 1.55 | 30 | 50.86 | 44.73 | multi-run x12 | | imo_answerbench | 0.3600 | 1.25 | 400 | 39.60 | 44.94 | multi-run x4 | | hle | 0.0508 | 14.69 | 3000 | 61.79 | 34.42 | 无 | | gsm8k | 0.9704 | 0.32 | 1319 | 3.03 | 43.80 | 无 | | competition_math | 0.9410 | 3.18 | 500 | 8.68 | 51.00 | 无 | | bbh | 0.9032 | 1.80 | 6513 | 3.56 | 42.95 | 无 | | drop | 0.8183 | 1.53 | 9536 | 1.82 | 36.31 | 无 | ### 3. 知识与语言理解 | Benchmark | 得分 | 实测时间(h) | 总样本数 | 延迟_mean(s) | 输出 TPS | 特殊要求 | |-----------|------|------------|---------|-------------|---------|----------| | gpqa_diamond | 0.6944 | 0.32 | 198 | 10.55 | 41.34 | multi-run x2 | | mmlu_pro | 0.8285 | 5.62 | 12032 | 6.26 | 31.05 | 无 | | simple_qa | 0.3814 | 1.90 | 4326 | 1.89 | 30.69 | LLM judge | | mmlu | 0.9045 | 3.03 | 14042 | 2.70 | 35.98 | 无 | | cmmlu | 0.9001 | 3.49 | 11515 | 3.92 | 36.65 | 无 | | arc | 0.9476 | 0.21 | 1172 | 0.66 | 13.65 | 无 | | hellaswag | 0.8666 | 0.45 | 10042 | 0.60 | 7.32 | 无 | | trivia_qa | 0.7768 | 5.30 | 11313 | 9.16 | 3.78 | 无 | | winogrande | 0.7845 | 0.08 | 1267 | 0.70 | 13.88 | 无 | ### 4. 长上下文 | Benchmark | 得分 | 实测时间(h) | 总样本数 | 延迟_mean(s) | 输出 TPS | 特殊要求 | |-----------|------|------------|---------|-------------|---------|----------| | longbench_v2 | 0.5686 | 3.06 | 503 | 84.12 | 2.75 | middle-truncation | | openai_mrcr | 0.7768 | 5.28 | 2399 | 29.15 | 12.95 | middle-truncation | ### 5. 智能体与工具 | Benchmark | 得分 | 实测时间(h) | 总样本数 | 延迟_mean(s) | 输出 TPS | 特殊要求 | |-----------|------|------------|---------|-------------|---------|----------| | tau2_bench | 0.7684 | 1.76 | - | - | - | Agent + judge model | | general_fc | 0.6988 | 1.38 | 2000 | 9.41 | 39.21 | function calling | | bfcl_v3 | 0.6643 | 5.23 | 4441 | 4.30 | 25.32 | function calling | ### 6. 汇总 | 指标 | 数值 | |------|------| | 总 benchmark 数 | 26 个(不含 swe_bench 系列) | | 总实测时间 | 75.24 h | | 平均得分 | 0.7120 | --- ## 快速开始 ### 1. 下载数据集 由于不同 benchmark 的数据 schema 不同,**不要直接用 `MsDataset.load()` 一次性加载所有数据**(会报 `CastError: column names don't match`)。 推荐用 `snapshot_download` 直接下载所有缓存文件: ```bash pip install modelscope modelscope login --token your-token python -c " from modelscope.hub.snapshot_download import snapshot_download snapshot_download( 'SoraAmami/evalscope-datasets', repo_type='dataset', cache_dir='/data1/sora/evalscope', local_dir='/data1/sora/evalscope' ) " ``` 下载后目录结构: ``` /data1/sora/evalscope/ ├── datasets/ │ ├── evalscope_aime24-*/ │ ├── evalscope_aime25-*/ │ ├── evalscope_gsm8k-*/ │ └── ... ├── bash/ ├── config/ └── myread.md ``` 运行时指向: ```bash --dataset-dir /data1/sora/evalscope ``` > evalscope 会自动在 `--dataset-dir` 后拼接 `datasets/` 查找数据。 ### 2. 运行评测 ```bash cd /data1/sora/evalscope # 运行单个 benchmark python bash/run.py --datasets gsm8k --limit 50 # 运行官方对比套件 python bash/run.py --suite official --limit none # 运行完整套件 python bash/run.py --suite full --limit none ``` 完整参数见 `bash/run.py --help` 或 `myread.md`。 --- ## 输出目录结构 ``` output/ └── {folder_name}/ # 默认 model_name ├── {benchmark}/ │ ├── seed_{seed}/ │ │ ├── predictions/ │ │ ├── reviews/ │ │ ├── reports/{benchmark}.json │ │ └── logs/ │ └── seed_{seed}_run_{n}/ # multi-run 第 n 次 └── active_time/ # 真实运行时间累计 results/ └── {folder_name}.xlsx # 汇总 Excel ``` --- ## 数据集内容 ``` datasets/ ├── AI-ModelScope_DROP-*/ ├── AI-ModelScope_gpqa_diamond-*/ ├── AI-ModelScope_gsm8k-*/ ├── AI-ModelScope_winogrande_val-*/ ├── allenai_ai2_arc-*/ ├── cais_hle-*/ ├── cais_mmlu-*/ ├── evalscope_aime24-*/ ├── evalscope_aime25-*/ ├── evalscope_aime26-*/ ├── evalscope_bbh-*/ ├── evalscope_bigcodebench-*/ ├── evalscope_browse_comp-*/ ├── evalscope_cmmlu-*/ ├── evalscope_competition_math-*/ ├── evalscope_hellaswag-*/ ├── evalscope_hmmt_feb_2026-*/ ├── evalscope_human_eval-*/ ├── evalscope_imo-answerbench-*/ ├── evalscope_livecodebench_code_generation_lite_parquet-*/ ├── evalscope_SimpleQA-*/ ├── evalscope_trivia_qa-*/ ├── m-a-p_SuperGPQA-*/ ├── openai-mirror_mrcr-*/ ├── opencompass_humaneval-*/ ├── princeton-nlp_SWE-bench_Verified-*/ ├── ScaleAI_MCP-Atlas-*/ ├── ScaleAI_SWE-bench_Pro-*/ ├── SWE-bench_SWE-bench_Multilingual-*/ ├── TIGER-Lab_MMLU-Pro-*/ └── ZhipuAI_LongBench-v2-*/ ``` 每个子目录包含对应 benchmark 的 HuggingFace Datasets 缓存文件(Arrow 格式)。 --- ## 注意事项 1. **SWE-bench 系列**(`swe_bench_pro`、`swe_bench_verified`、`swe_bench_multilingual_agentic`):数据缓存已包含,但每个样本需要独立 Docker 镜像运行,未计入上述 75h。 2. **Agent benchmark**(`tau2_bench`、`browsecomp`):需要额外配置 judge model 或 MCP 搜索工具。 3. **首次运行**:evalscope 可能会根据配置自动补全部分数据,建议保持网络畅通。 4. **数据集路径**:始终让 `--dataset-dir` 指向 `datasets/` 的父目录,不要直接指向 `datasets/` 本身。 --- ## 实验分组参考(多机并行) | 机器 | Benchmark | 预计时间 | |------|-----------|----------| | 机器1 | 知识与语言理解(9 个) | ~22h | | 机器2 | 推理/数学(10 个)+ 代码/工程(3 个) | ~28h | | 机器3 | 长上下文(2 个)+ 智能体(3 个) | ~17h | --- ## 大小 | 资源 | 大小 | |------|------| | 数据集 | ~7.7 GB (330+ files) | | Docker 镜像 tar.gz | ~912 MB | | 解压后 Docker 镜像 | ~3-5 GB | --- ## License 原始数据集保留其各自的许可证。本仓库仅提供缓存副本以方便评测使用。



