登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
jmichaelov/inverse_scaling_prize-redefine
jmichaelov/inverse_scaling_prize-redefine
收藏
Hugging Face
2023-08-23 更新
2024-03-04 收录
逆缩放评估
语言模型基准测试
数据链接:
https://hf-mirror.com/datasets/jmichaelov/inverse_scaling_prize-redefine
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: cc-by-4.0 ---
应用场景:
提供机构:
jmichaelov
原始信息汇总
数据集许可证信息
许可证类型
: CC-BY-4.0
许可证说明
: 该数据集遵循知识共享署名4.0国际许可证。
相关数据集
kth8/Qwen3.5-27B-AWQ-4bit-GPQA-Diamond-benchmark
语言模型基准测试
专业问答评估
--- license: apache-2.0 language: - en base_model: cyankiwi/Qwen3.5-27B-AWQ-4bit datasets: - fingertap/GPQA-Diamond --- Benchmark of [cyankiwi/Qwen3.5-27B-AWQ-4bit](https://huggingface.co/cyankiwi/Qw
Hugging Face
2026-04-10 更新
14
0
jmichaelov/inverse_scaling_prize-into_the_unknown
--- license: cc-by-4.0 ---
Hugging Face
2023-08-23 更新
8
0
Results of the Benchmark Dataset with 28 document pairs
长文本相似度评估
语言模型基准测试
Set of results for the benchmark dataset for long text similarity research. The results were tested with the following language modelsall-MiniLM_6_v2all-MiniLM-L12-v2all-mpnet-base-v2glove.6B.300dLong
Figshare
2025-05-15 更新
5
0
heurigen/heurigen-data
组合优化
语言模型基准测试
HeuriGen是一个用于严格评估大型语言模型在组合优化问题上的基准和代理评估框架。该框架通过引入具有明确客观目标和广泛解决方案空间的现实世界组合优化任务,要求模型具备创造性算法设计、多步骤规划、工具使用和适应性推理的能力。
Hugging Face
2025-05-22 更新
14
0
M3Exam
多语言多模态评估
语言模型基准测试
A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models"
OpenXLab
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广