登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Data file from The Role of Action Concepts in Physical Reasoning: Insights from Late Childhood
Data file from The Role of Action Concepts in Physical Reasoning: Insights from Late Childhood
收藏
NIAID Data Ecosystem
2026-05-02 收录
物理推理
动作概念认知
数据链接:
https://figshare.com/articles/dataset/Data_file_from_The_Role_of_Action_Concepts_in_Physical_Reasoning_Insights_from_Late_Childhood/26531598
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Data_GameRaw_Supplemental_.csv
应用场景:
创建时间:
2024-08-10
相关数据集
PHYSICS
物理推理
教育评估
我们引入了一个大规模、高质量且广泛具有挑战性的PHYSICS数据集,用于训练和评估,同时提供了一个Rule+Model评估框架,为增强大型模型的物理推理能力提供了新的解决方案。数据集包含16,568个样本,覆盖力学、电磁学、热力学、光学和现代物理五个领域,以及从高中到研究生四个难度级别。
github
2025-06-17 更新
105
0
MARS
语言模型评估
物理推理
MARS数据集由香港科技大学计算机科学与工程系创建,包含35.5万条标注数据,用于评估大型语言模型在处理分布变化时的元物理推理能力。该数据集通过ChatGPT从Wikitext和BookCorpus中提取事件,并对其可变组件进行抽象化和数值变异,以创建元物理推理状态。MARS数据集旨在解决语言模型在面对环境因素和自身或其他代理行动引发的分布变化时的推理挑战,适用于评估和提升语言模型在复杂环境中的推
arXiv
2024-06-04 更新
69
0
Phy-Q
物理推理
人工智能
受人类智商计算方式的启发,我们定义了反映智能体物理推理智能的物理推理商(Phy-Q 分数)。我们的评估表明,1) 所有智能体的表现都远低于人类,2) 学习智能体,即使具有良好的局部泛化能力,也难以学习潜在的物理推理规则,无法进行广泛的泛化。我们鼓励开发可以达到人类水平 Phy-Q 分数的智能代理。
OpenDataLab
2026-07-12 更新
44
0
MVPBench
物理推理
基准测试
MVPBench是一个精心设计的基准测试,旨在通过视觉链式思维(CoT)严格评估视觉物理推理能力。每个示例包含交错的多图像输入,并要求不仅正确的最终答案,还需要一个连贯的、逐步的推理路径,基于演变的视觉线索。这种设置反映了人类如何随着时间的推移通过现实世界的物理过程进行推理。MVPBench包含1211个样本,总共4701张图像,涵盖独特和重复的图像。每个问题和相应的答案都是独特的,突出了数据集在
github
2025-06-05 更新
94
0
QuantiPhy
物理推理
视觉语言模型
QuantiPhy是由斯坦福大学团队构建的首个定量物理推理基准数据集,包含569个独特视频和3355个标注问题,涵盖2D/3D运动场景。该数据集通过Blender模拟、实验室采集和网络爬取三种方式构建,每个视频关联多组(先验、问题、真值)三元组,要求模型根据给定先验(如物体尺寸、速度或加速度)推算目标物体的运动学属性。其核心价值在于突破传统定性评估,为视觉语言模型在自动驾驶、增强现实等需要精确物理
arXiv
2025-12-23 更新
61
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广