登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Benchmarking and Comparative Testing of Proposed Stacking Ensemble.
Benchmarking and Comparative Testing of Proposed Stacking Ensemble.
收藏
Figshare
2025-06-26 更新
2026-04-28 收录
集成学习评估
模型基准测试
数据链接:
https://figshare.com/articles/dataset/Benchmarking_and_Comparative_Testing_of_Proposed_Stacking_Ensemble_/29417975
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Benchmarking and Comparative Testing of Proposed Stacking Ensemble.
应用场景:
创建时间:
2025-06-26
相关数据集
🏆 AI Models Benchmark Dataset 2026 (latest)
模型基准测试
大语言模型
Comprehensive Benchmark of 188+ AI Models - LLM Performance
kaggle
2026-01-13 更新
22
0
OMNIX_Benchmarks_Latest
大型语言模型评估
模型基准测试
OMNIX Benchmarks 是一个用于评估和基准测试大型语言模型性能的数据集。它旨在通过一套标准化的指标对模型进行综合比较,涵盖格式遵循、逻辑推理、知识回忆、约束遵循、成功率(首次通过和最终)以及推理延迟等多个关键维度。该数据集支持文本生成和问答任务类别,并提供了对多个流行模型(如 Qwen、Gemma、Llama 等系列的不同版本)在上述维度上的量化评分和排名分析,帮助研究人员和开发者了解
Hugging Face
2026-07-07 更新
10
0
Comparison of true predictions between every two individual predictors for all the 1679 positive samples in the D1679 dataset.
预测器一致性分析
集成学习评估
Comparison of true predictions between every two individual predictors for all the 1679 positive samples in the D1679 dataset.
NIAID Data Ecosystem
5
0
open-llm-leaderboard/details_OptimalScale__robin-7b-v2-delta
大型语言模型评估
模型基准测试
该数据集是在Open LLM Leaderboard上对模型OptimalScale/robin-7b-v2-delta进行评估时自动创建的。数据集包含61个配置,每个配置对应一个评估任务。数据集由1次运行创建,每次运行可以在每个配置的特定分割中找到,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,并用于计算和显示Open
Hugging Face
2023-08-27 更新
12
0
next-tat/MMDocBench
视觉文档理解
模型基准测试
--- license: cc-by-sa-4.0 task_categories: - question-answering - visual-question-answering - table-question-answering language: - en pretty_name: MMDocBench size_categories: - 1K<n<10K tags: - LVLMs
Hugging Face
2024-10-30 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广