eval-Hermes-4-70B-reasoning
收藏资源简介:
该数据集包含了各种配置和数据文件,用于不同的基准测试。每个配置指定了数据文件的分割和路径,语言为英语。数据集的大小类别在1K到10K之间。数据集的标签包括评估和基准测试。此外,README还包含了不同基准测试的评估结果,包括分数、指标、样本和超长率。每个基准测试的详细结果也包括指标、分数、标准误差和超长样本。
This dataset contains various configuration and data files for different benchmark tests. Each configuration specifies the splits and paths of the data files, using English as its language. The dataset has a size range of 1K to 10K. The dataset's labels cover evaluation and benchmark-related categories. Additionally, the README document includes evaluation results for various benchmark tests, covering scores, metrics, sample quantities, and out-of-length rates. Detailed results for each benchmark test also include metrics, scores, standard errors, and out-of-length samples.
Hermes-4-70B-Reasoning 数据集评估结果
数据集概述
- 数据集名称: eval-Hermes-4-70B-reasoning
- 语言: 英语
- 规模: 1K<n<10K
- 标签: 评估、基准测试
数据集结构
特征
- benchmark_results (string)
配置列表
- aime24_groups: aime24/details.parquet
- aime24_samples: aime24/conversations.parquet
- aime25_groups: aime25/details.parquet
- aime25_samples: aime25/conversations.parquet
- arenahard_samples: arenahard/samples.jsonl
- bbh_generative_groups: bbh_generative/details.parquet
- bbh_generative_samples: bbh_generative/conversations.parquet
- creative-writing-v3_samples: creative-writing-v3/samples.jsonl
- drop_generative_nous_groups: drop_generative_nous/details.parquet
- drop_generative_nous_samples: drop_generative_nous/conversations.parquet
- eqbench3_samples: eqbench3/samples.jsonl
- gpqa_diamond_groups: gpqa_diamond/details.parquet
- gpqa_diamond_samples: gpqa_diamond/conversations.parquet
- ifeval_groups: ifeval/details.parquet
- ifeval_samples: ifeval/conversations.parquet
- lcb-v6-aug2024+_samples: lcb-v6-aug2024+/samples.jsonl
- lcb-v6-aug2024+_groups: lcb-v6-aug2024+/group.jsonl
- math_500_groups: math_500/details.parquet
- math_500_samples: math_500/conversations.parquet
- mmlu_generative_groups: mmlu_generative/details.parquet
- mmlu_generative_samples: mmlu_generative/conversations.parquet
- mmlu_pro_groups: mmlu_pro/details.parquet
- mmlu_pro_samples: mmlu_pro/conversations.parquet
- musr_generative_groups: musr_generative/details.parquet
- musr_generative_samples: musr_generative/conversations.parquet
- obqa_generative_groups: obqa_generative/details.parquet
- obqa_generative_samples: obqa_generative/conversations.parquet
- rewardbench_samples: rewardbench/samples.jsonl
- simpleqa_nous_groups: simpleqa_nous/details.parquet
- simpleqa_nous_samples: simpleqa_nous/conversations.parquet
评估结果摘要
| 基准测试 | 得分 | 指标 | 样本数 | 过长率 |
|---|---|---|---|---|
| aime24 | 0.735 | math_pass@1:64_samples | 64 | 8.4% |
| aime25 | 0.674 | math_pass@1:64_samples | 64 | 9.6% |
| arenahard | 0.901 | eval/overall_winrate | 500 | 0.0% |
| bbh_generative | 0.878 | extractive_match | 1 | 4.8% |
| creative-writing-v3 | 0.775 | creative_writing_score | 96 | 0.0% |
| drop_generative_nous | 0.850 | drop_acc | 1 | 1.4% |
| eqbench3 | 0.847 | eqbench_score | 135 | 0.0% |
| gpqa_diamond | 0.661 | gpqa_pass@1:8_samples | 8 | 3.0% |
| ifeval | 0.787 | inst_level_loose_acc | 1 | 6.5% |
| lcb-v6-aug2024+ | 0.505 | eval/pass_1 | 1 | 16.6% |
| math_500 | 0.956 | math_pass@1:4_samples | 4 | 0.9% |
| mmlu_generative | 0.884 | extractive_match | 1 | 0.3% |
| mmlu_pro | 0.807 | pass@1:1_samples | 1 | 0.7% |
| musr_generative | 0.704 | extractive_match | 1 | 0.5% |
| obqa_generative | 0.948 | extractive_match | 1 | 1.6% |
| rewardbench | 0.649 | eval/percent_correct | 1 | 0.4% |
| simpleqa_nous | 0.179 | fuzzy_match | 1 | 2.5% |
总体过长率: 2,311 / 64,523 样本 (3.6%) 缺少闭合 </think> 标签




