登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
PPI-LLM Metacognition Benchmark Data
PPI-LLM Metacognition Benchmark Data
收藏
kaggle
2026-04-17 更新
2026-05-09 收录
大语言模型元认知评估
LLM基准测试
数据链接:
https://www.kaggle.com/datasets/seanryansullivan/ppi-llm-benchmark-data
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Assess LLM Paradigm Dimensions and Properties
大语言模型(Large Language Model)范式维度与特性评估
应用场景:
创建时间:
2026-04-16
相关数据集
JMLE2026-Bench (IgakuQA120)
医学考试
LLM基准测试
日本医学执照考试第120届(2026年2月7-8日)的LLM基准测试,包含400个问题(302个纯文本问题和98个带有临床图像的问题),并以JSON格式结构化,带有真实答案。
github
2026-02-26 更新
19
0
squeezebits/dynamic_sonnet_llama2
LLM基准测试
文本生成
--- task_categories: - question-answering - text-generation language: - en size_categories: - 1K<n<10K configs: - config_name: default data_files: - split: 1k path: "dynamic_sonnet_llama_2_pre
Hugging Face
2024-08-14 更新
10
0
arxivmath-0426_outputs
推理评估
LLM基准测试
该数据集包含使用MathArena GitHub仓库生成的针对2026年4月ArXivMath问题的模型答案。数据集详细记录了每个问题的索引、问题陈述、模型名称、模型配置、回答尝试索引、完整对话记录、用户提示、模型响应、输入输出令牌数、成本估算、来源论文标识、标准答案、解析后的答案以及答案正确性。数据集适用于评估大型语言模型在数学问题上的表现,支持自动评分和成本分析。数据集规模为492个训练样本,
Hugging Face
2026-05-10 更新
2
0
Cleanlab/pii-extraction
PII提取
LLM基准测试
This dataset can be used for benchmarking LLM Structured Outputs via the code here: https://github.com/cleanlab/structured-output-benchmark/
Hugging Face
2025-12-03 更新
18
0
squeezebits/dynamic_sonnet_llama3
LLM基准测试
动态令牌长度评估
--- task_categories: - question-answering - text-generation language: - en size_categories: - 1K<n<10K configs: - config_name: default data_files: - split: 1k path: "dynamic_sonnet_llama_3_pre
Hugging Face
2024-08-14 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广