登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Phyla Model and Tree Reasoning Benchmark
Phyla Model and Tree Reasoning Benchmark
收藏
DataONE
2025-11-17 更新
2025-12-06 收录
模型评估
树推理
数据链接:
https://search.dataone.org/view/sha256:cfe375ac4b7486f0413fc4281a407aef6465ac520fe2feb97cbf1914e380e6b3
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Phyla model and ablation checkpoints along with data for tree reasoning benchmark
应用场景:
创建时间:
2025-11-20
相关数据集
GRACE
自然语言处理
模型评估
GRACE数据集是由马里兰大学、伯克利加州大学和孟买印度理工学院的研究人员创建的,用于评估语言模型校准的细粒度基准。该数据集包含由专家编写的问题,每个问题至少有五个逐渐变简单的线索,这些问题在实时的人类与模型竞赛中收集。数据集旨在通过将人类的表现作为参考点,来测量模型的校准性能。
arXiv
2025-02-27 更新
27
0
open-llm-leaderboard-old/details_bn22__Nous-Hermes-2-SOLAR-10.7B-MISALIGNED
模型评估
自然语言处理
该数据集是在评估模型bn22/Nous-Hermes-2-SOLAR-10.7B-MISALIGNED在Open LLM Leaderboard上的表现时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,并用于计算
Hugging Face
2024-01-04 更新
14
0
open-llm-leaderboard-old/details_TheBloke__wizard-vicuna-13B-GPTQ
自然语言处理
模型评估
该数据集是在评估模型TheBloke/wizard-vicuna-13B-GPTQ时自动生成的,包含3个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果作为特定分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,还有一个results配置存储所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。
Hugging Face
2023-11-07 更新
14
0
open-llm-leaderboard-old/details_SanjiWatsuki__neural-chat-7b-v3-3-wizardmath-dare-me
自然语言处理
模型评估
该数据集是在模型SanjiWatsuki/neural-chat-7b-v3-3-wizardmath-dare-me在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个被评估的任务。数据集包含一次运行的结果,每次运行都作为一个特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。一个名为results的额外配置存储了运行
Hugging Face
2023-12-27 更新
17
0
open-llm-leaderboard-old/details_Gille__StrangeMerges_47-7B-dare_ties
模型评估
自然语言处理
该数据集是在模型Gille/StrangeMerges_47-7B-dare_ties在Open LLM Leaderboard上的评估运行过程中自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LL
Hugging Face
2024-04-02 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广