登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Classification model performance both overall and by subgroup.
Classification model performance both overall and by subgroup.
收藏
Figshare
2025-04-08 更新
2026-04-28 收录
模型公平性评估
模型性能分析
数据链接:
https://figshare.com/articles/dataset/Classification_model_performance_both_overall_and_by_subgroup_/28753276
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Classification model performance both overall and by subgroup.
应用场景:
创建时间:
2025-04-08
相关数据集
MoE-CAP
机器学习评估
模型性能分析
MoE-CAP是一个专门为评估MoE系统而设计的基准,旨在理解和评估MoE系统的成本、准确性和性能。该数据集包含多种MoE模型,并使用新的稀疏感知性能指标进行评估,包括稀疏内存带宽利用率和稀疏模型FLOPS利用率。MoE-CAP还引入了CAP雷达图,以直观地展示MoE系统在成本、准确性和性能方面的权衡。
arXiv
2025-05-17 更新
69
0
ROC curve parameters according to sensitivity and specificity values.
测试评估
模型性能分析
ROC curve parameters according to sensitivity and specificity values.
NIAID Data Ecosystem
10
0
Qwen3-8B_eval_08c7
机器学习评估
模型性能分析
# mlfoundations-dev/Qwen3-8B_eval_08c7 Precomputed model outputs for evaluation. ## Evaluation Results ### HMMT - **Average Accuracy**: 44.33% ± 1.06% - **Number of Runs**: 10 | Run | Accuracy |
魔搭社区
2025-11-13 更新
8
0
Lansechen/details_Lansechen__Qwen2.5-7B-Open-R1-GRPO-math-lighteval
数学评估
模型性能分析
在模型Lansechen/Qwen2.5-7B-Open-R1-GRPO-math-lighteval评估过程中自动生成的数据集,包含5种配置,每种配置对应一个评估任务。该数据集由23次运行结果组成,每次运行结果在各个配置中作为特定分割存在,分割名称以运行时间戳命名。train 分割指向最新运行结果,而results 配置则存储了所有运行的汇总结果。
Hugging Face
2025-04-10 更新
12
0
llama-duo/llama3-1b-coding-eval-by-claude3sonnet
编程评估
模型性能分析
该数据集包含与模型评估相关的多个字段,如指令、响应和评分等,用于评估模型在特定任务上的表现。具体包括:指令(instructions)、目标响应(target_responses)、候选响应(candidate_responses)、模型ID(model_id)、模型SHA(model_sha)、评估提示(eval_prompts)、相似度评分(similarity_scores)、精确度评分(p
Hugging Face
2025-04-02 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广