登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Pixel Aligned Language Models
Pixel Aligned Language Models
收藏
Zenodo
2024-03-07 更新
2026-04-07 收录
视觉定位
引用表达
数据链接:
https://zenodo.org/doi/10.5281/zenodo.10795249
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
RefCOCO json files for PixelLLM
应用场景:
创建时间:
2024-03-07
相关数据集
InLoc dataset
视觉定位
图像处理
InLoc数据集包含由iphone7在不同位置和时间拍摄的彩色RGB图像,以及手动验证的6DoF参考姿势,用于评估视觉定位方法。此外,还提供了由原始WUSTL RGBD扫描生成的彩色RGB透视图像和深度图,作为我们论文中InLoc数据集的数据库。
github
2024-03-27 更新
242
0
Grounded conversation Generation (GCG)
视频理解
视觉定位
一个用于视频视觉定位的基准数据集,包含38k个视频问答三元组、87k个对象和大约671k个细粒度的时空掩码。
github
2024-11-08 更新
98
0
TUM-VIE
机器人导航
视觉定位
该数据集是一个高分辨率的以自我为中心的导航集,它将立体事件与视觉-惯性轨迹对齐。此外,该数据集提供了更高分辨率的传感器,以便进行精确的研究。其规模达到了亚厘米级的惯性姿态数据,任务包括深度估计和视觉-惯性同步定位与地图构建(SLAM)。
arXiv
54
0
UAV-VisLoc
无人机
视觉定位
UAV-VisLoc数据集是由北京邮电大学网络与交换技术国家重点实验室创建,旨在支持无人机视觉定位任务。该数据集包含来自中国11个不同地点的6742张无人机图像和11张卫星地图,涵盖了多种地形特征,如城市、乡村、河流和山丘。数据收集过程中,使用了固定翼和多地形无人机,捕捉了不同高度和方向的图像。此数据集特别适用于训练和测试模型,以解决无人机在全球导航卫星系统不可靠时的精确位置定位问题。
arXiv
2024-05-20 更新
241
0
360SPR
计算机视觉
视觉定位
360SPR数据集是由卡尔斯鲁厄理工学院创建的,包含超过20万张全景图和360万张针孔图像,分布在270个场景中。这些图像通过Habitat模拟器生成,并采用手动检查的方式确保质量。数据集考虑了不同采样间隔和传感器高度,提供了丰富的视觉信息,适用于视觉定位任务,特别是在室内场景中,有助于提高模型的泛化能力和准确性。
arXiv
2025-03-25 更新
90
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广