kth8/Qwen3.5-4B-imo-answerbench-benchmark
收藏资源简介:
--- license: apache-2.0 language: - en base_model: Qwen/Qwen3.5-4B datasets: - Hwilner/imo-answerbench --- Benchmark of [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B) against [Hwilner/imo-answerbench](https://huggingface.co/datasets/Hwilner/imo-answerbench) dataset. Accuracy: 56.0% with Python tool. | Metric | Value | |----------------------|---------------| | **Correct** | 224 | | **Incorrect** | 171 | | **Errors** | 5 | | **Total samples** | 400 | | **Python tool calls**| 4213 | | **Total completion tokens** | 9,726,875 | Raw stats: ```json { "accuracy": 0.56, "correct": 224, "incorrect": 171, "error": 5, "total": 400, "python_tool_calls": 4213, "completion_tokens": 9726875 } ```
许可证:Apache-2.0 语言:英语 基础模型:Qwen/Qwen3.5-4B 关联数据集: - Hwilner/imo-answerbench 本基准测试针对[Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B)与[Hwilner/imo-answerbench](https://huggingface.co/datasets/Hwilner/imo-answerbench)数据集展开对比评测。借助Python工具测得本次评测的准确率为56.0%。 | 评估指标 | 数值 | |------------------------|--------------| | **正确预测** | 224 | | **错误预测** | 171 | | **执行错误** | 5 | | **总样本量** | 400 | | **Python工具调用次数** | 4213 | | **总补全Token数** | 9,726,875 | 原始统计数据: json { "准确率": 0.56, "正确预测数": 224, "错误预测数": 171, "执行错误数": 5, "总样本量": 400, "Python工具调用次数": 4213, "补全Token总数量": 9726875 }




