数据链接:
官方服务:
资源简介:
Evaluation Sets for Flashfold
应用场景:
创建时间:
2025-04-10
相关数据集
open-llm-leaderboard-old/details_Steelskull__Umbra-MoE-4x10.7
该数据集是在Open LLM Leaderboard上对模型Steelskull/Umbra-MoE-4x10.7进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM L
Hugging Face2024-01-21 更新210
Appendix D. The parameter estimates from the model fits with their AICc's.
The parameter estimates from the model fits with their AICc's.
DataCite Commons2020-09-04 更新90
arjun3103/haystack_faithfulness_evaluation
--- dataset_info: features: - name: questions dtype: string - name: contexts sequence: string - name: answers dtype: string - name: ans_type dtype: string - name: faithfuln
Hugging Face2024-06-06 更新80
open-llm-leaderboard-old/details_jsfs11__WildMBXMarconi-SLERP-7B
该数据集是在模型 jsfs11/WildMBXMarconi-SLERP-7B 在 Open LLM Leaderboard 上的评估运行期间自动创建的。数据集由 63 个配置组成,每个配置对应一个评估任务。它包含 1 次运行的结果,每次运行都作为每个配置中的一个特定分割存储。train 分割始终指向最新的结果。一个名为 results 的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示
Hugging Face2024-01-24 更新140
tartuNLP/ifeval_et
ifeval_et是IFEval数据集的爱沙尼亚语版本,用于测量语言模型的指令遵循能力。每个示例都由专业翻译手动翻译并适应爱沙尼亚的文化背景。指令被修改以去除请求输出语言不是英语或爱沙尼亚语的情况。
Hugging Face2025-12-30 更新90



