登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Alien Colony Hidden State Benchmark — Task 1
Alien Colony Hidden State Benchmark — Task 1
收藏
kaggle
2026-04-13 更新
2026-05-09 收录
隐藏状态推理
AI基准测试
数据链接:
https://www.kaggle.com/datasets/xjoannax88/alien-colony-hidden-state-benchmark-task-1
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Task 1 for evaluating hidden-state reasoning
任务1:隐状态(hidden-state)推理能力评估
应用场景:
创建时间:
2026-04-08
相关数据集
FigureBench
科学插图生成
AI基准测试
FigureBench是由西湖大学团队构建的首个面向长文本科学插图生成的大规模基准数据集,包含3300组高质量科学文本-插图对,覆盖论文、综述、博客和教材四类来源。数据集平均文本长度达10300词,包含41.2%的图文密度和6.4个平均形状组件,通过GPT-5筛选和人工标注(Cohen's κ=0.91)确保质量。该数据集旨在解决科学插图自动生成中结构保真度与美学表现的平衡问题,为AI科学家提供可
arXiv
2026-02-04 更新
193
0
OmniaBench
通用AI代理评估
AI基准测试
OmniaBench是一个用于评估通用AI代理的广泛诊断基准,其场景知识来源于应用商店、产品文档、行业资源和网络检索,涵盖90个一级和354个二级领域。它通过四种互补的构建路线合成任务,包含1,431个任务,并提供一个644个任务的挑战子集用于高效评估。数据集支持十维能力分类和八个难度因素的细粒度分析。
github
2026-07-17 更新
33
0
yizhilsy/Toy_SafetyBench
玩具安全评估
AI基准测试
--- dataset_info: features: - name: id dtype: int64 - name: image dtype: image - name: question dtype: string - name: category dtype: string - name: harmful dtype: int6
Hugging Face
2026-04-03 更新
8
0
ClockBench
视觉推理
AI基准测试
ClockBench是一个视觉推理AI基准测试数据集,包含10个时钟(完整私有数据集包含180个时钟)。该数据集专门设计用于评估AI模型的视觉推理能力,通过OpenRouter API对选定模型进行评估和评分。
github
2025-09-04 更新
42
0
Leading AI model score in HLE 2025
AI基准测试
通用智能评估
Leading artificial intelligence (AI) models in humanity's last exam (HLE) in 2025
Statista
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广