在人工智能领域的顶级会议NeurIPS上,斯坦福大学的杰出教授李飞飞发表了题为《From Seeing to Doing: Ascending the Ladder of Visual Intelligence》的主题演讲。在这次演讲中,李飞飞教授探讨了机器视觉的未来以及人工智能如何塑造我们的现实世界。她强调了空间智能的重要性,并将其视为全面智能的基石。李飞飞教授指出,解决空间智能问题是迈向全面智能的基础性、关键性步骤,并对实现真正理解三维世界的AI系统充满信心。
同时李飞飞教授还在会议开始前接受了IEEE Spectrum的独家专访。作为AI领域的领军人物,李飞飞教授和团队成员和在访谈中分享了一些观点:
1、AI视觉模型与语言模型的关系
李飞飞教授强调了AI视觉模型与语言模型同等重要性,并认为空间智能是视觉智能的发展方向。她指出,视觉和语言是AI发展的两大重要方向,它们各自独立但又相辅相成。
2、空间智能是什么?
空间智能是指机器在三维和思维时空中感知、推理和行动的能力,理解物体和事件的位置以及它们如何相互作用。这很重要,因为视觉空间智能被认为是包括人和机器人在内的任何智能的基础,对于导航、操纵和建立文明至关重要。
3、World Labs 的空间智能 与过去的人工智能研究不同之处
World Labs 的空间智能方法侧重于将机器学习从数据中心带入对3D和4D空间的现实世界理解中。这与过去的AI研究不同,过去的AI研究更受限制,专注于预定义的数据集和任务。
4、未来十年数据理解焦点的预期转移是什么?
预计未来十年数据理解的重点将转向理解新类型的数据,特别是可以通过带有摄像头和传感器的智能手机收集的数据,而不是以前存在的数据,如网络图像和视频。
5、2D图像在理解3D和4D结构方面的重要性是什么?
2D图像非常重要,因为它们是3D世界的投影,提供了一种数学连接,可用于理解物理世界的3D和4D结构。 它们提供了一种将图像用作物理世界的通用传感器的方法,并使大量2D观测能够恢复3D结构。
6、语言模型的一维性质与空间智能的三维性质有何对比?
语言模型的一维性质,其底层表示是一维的标记序列,与空间智能的三维性质形成对比,后者强调三维世界在其表示中的重要性。 空间智能利用一种基本的三维表示形式,允许不同的数据处理方法和输出,使其能够解决与在1D序列上操作的语言模型略有不同的问题。
7、在场景复杂度方面,这项技术的预期进展是什么?
这项技术的发展预计将从静态场景转向更加动态、完全可交互的环境,并具有所有提到的功能,如运动、物理和交互语义。
8、视觉空间智能和人工智能进步的基本要素是什么?
视觉空间智能和人工智能发展的基本要素包括强大的通用学习算法、大量的计算和大量的数据
9、团队构建所需的AI技术需要哪些特定的专业知识?
这个团队需要高质量的大规模工程专业知识,对3D世界的深刻理解,以及与计算机图形学的联系,以便从不同的角度解决问题。
10、对空间智能的长期愿景及其意义是什么?
对空间智能的长期愿景是解锁机器在三维空间和时间中感知、推理和行动的能力,理解物体和事件如何在其中定位和交互。 空间智能被视为高级人工智能的基础。
另外World Labs还分享迈向空间智能的第一步:从单个图像生成 3D 世界的 AI 系统。
World Labs