Stine Benchmark Dataset
收藏官方服务:
资源简介:
A diverse tasks to for evaluating meta-cognition in LLMs
用于评估大语言模型(Large Language Models,LLMs)元认知(meta-cognition)的多样化任务集
创建时间:
2026-04-09

A diverse tasks to for evaluating meta-cognition in LLMs
用于评估大语言模型(Large Language Models,LLMs)元认知(meta-cognition)的多样化任务集