登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
MMSI-Video-Bench
MMSI-Video-Bench
收藏
kaggle
2026-05-03 更新
2026-05-09 收录
视频空间智能
推理基准测试
数据链接:
https://www.kaggle.com/datasets/abcdwdedwefw/mmsi-video-bench
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
应用场景:
创建时间:
2026-05-02
相关数据集
LLM-Rationality-Benchmark
语言模型评估
推理基准测试
该数据集是用于评估大型语言模型(LLMs)的理性程度,涵盖了广泛的领域和LLMs。数据集由清华大学团队创建,旨在为LLMs的开发者和用户提供一个基础评估工具,帮助优化和训练模型,并识别潜在的提升领域。数据集基于对各种理性评价的广泛文献回顾,将理性分为个体、人际和社会三个层面,涵盖了六个理性研究领域的评估。数据集包含了大量的问卷、测试和分析,以揭示LLMs在不同领域的理性程度,并提供了与人类理性的比
arXiv
2025-09-18 更新
27
0
meituan-longcat/General365_Public
大型语言模型评估
推理基准测试
--- license: mit configs: - config_name: default data_files: - split: test path: data/test-* dataset_info: features: - name: id dtype: string - name: question dtype: string - n
Hugging Face
2026-04-14 更新
12
0
Baital Evaluation: Benchmarks and Results
评估工具验证
推理基准测试
This deposit contains benchmarks used for evaluation of Baital tool https://github.com/meelgroup/baital and a csv file with evaluation results on these benchmarks.
NIAID Data Ecosystem
8
0
MorphoBench
推理基准测试
模型评估
MorphoBench是一个自适应推理基准测试,包含超过1300个多学科问题,能够根据模型推理轨迹动态调整任务难度,为评估o3和GPT-5等先进模型的推理性能提供可扩展且可靠的框架
github
2025-10-20 更新
26
0
Multi-Domain-Reasoning-Benchmark
语言模型评估
推理基准测试
CMDR-Bench(综合多领域推理基准)是一个系统化的评估套件,包含跨10个不同认知领域的100个精心设计的测试案例。该数据集旨在全面评估大型语言模型在推理、问题解决和指令遵循方面的能力。每个认知领域都设有分级难度量表(1-10级),支持从基础到专家级复杂度的细粒度能力阈值分析。数据集规模为小于1,000个样本,适用于文本生成任务,语言为英语,采用Apache 2.0许可协议。
Hugging Face
2026-04-10 更新
9
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广