相关数据集
open-llm-leaderboard-old/details_jeonsworld__CarbonVillain-en-10.7B-v3
该数据集是在模型jeonsworld/CarbonVillain-en-10.7B-v3的评估运行中自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割使用运行的时间戳命名。train分割始终指向最新的结果。此外,一个名为results的配置存储了所有运行的聚合结果,并用于计算和显示在Open LLM Leaderb
Hugging Face2023-12-30 更新140
Test-time scaling reasoning models evaluation data
该数据集包含12个推理模型在两个知识密集型基准测试(SimpleQA和FRAMES)上不同思考级别的输出结果。SimpleQA包含800个简短的事实寻求问题,FRAMES包含824个复杂的事实寻求问题。每个输出包括模型响应、推理轨迹(如适用)、评估标签(正确、不正确或未尝试)以及令牌计数等元数据
github2025-09-09 更新110
Appendix D. The parameter estimates from the model fits with their AICc's.
The parameter estimates from the model fits with their AICc's.
DataCite Commons2020-09-04 更新90
open-llm-leaderboard-old/details_mosaicml__mpt-30b-instruct
该数据集是在模型mosaicml/mpt-30b-instruct在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个特定的评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割,使用运行的时间戳命名。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,用于计算和显示Open LL
Hugging Face2023-10-14 更新120
formermagic/github_python_1m
--- annotations_creators: - found language_creators: - found language: - py license: - mit multilinguality: - monolingual size_categories: - 100K<n<1M source_datasets: - original task_categories: - se
Hugging Face2022-10-21 更新100



