李飞飞团队推出多模态模型Atlas:凭图像即能重建世界

李飞飞的Atlas模型正式亮相。通过一张照片,AI可以识别出房间里有一张桌子,但如果镜头切换到桌子背后,情况会怎样?机器人推倒杯子后又会发生什么?物体识别、画面生成和空间理解是相互关联却又各自独立的能力。李飞飞创立的World Labs正在努力将这些能力结合。

Atlas是一款全新的世界模型,通过从零开始进行预训练,能够处理文本、图像、视频和3D数据。它仍处于早期访问阶段,目前向部分合作伙伴开放。Atlas的主要特点是其在世界生成、重建和模拟等方面的多种能力:

- 可控运镜:Atlas可以利用像素级别的相机控制技术,从一张或多张图像生成长达1分钟的1440p视频。 - 空间重建:根据输入图像,Atlas能够重建真实世界的场景,不仅可以生成新视角的图像,还能输出3D效果,其性能超过现有专用重建模型。 - 时空模拟:通过输入视频,Atlas可以建模空间和时间,重新构建视频以获得戏剧化效果,支持机器人从真实到模拟的工作流。 - 图像生成:Atlas能根据文本生成图像和360度全景,灵活渲染各种视觉风格。 球友会

Atlas使用了多模态自回归扩散Transformer,逐步生成序列元素,并参考上下文。相机位姿和深度数据也是模型的重要组成部分。这种设计的优势在于改善拍摄过程中的控制精度,使创作者能够反复使用同一环境,而不必每次都重新提取视频段落。

值得注意的是,生成的结果虽然合理,但不一定与现实完全一致。尽管如此,Atlas的生成效果依然令人印象深刻。更引人关注的是,这款模型的背后是李飞飞和其在2024年成立的World Labs,而非资源雄厚的科技巨头。

李飞飞的履历为这款模型的诞生提供了背景。从1999年普林斯顿大学物理学学士,到2005年加州理工学院电气工程博士,李飞飞推动的ImageNet等项目为现代计算机视觉发展奠定了基础。她曾在谷歌任职,推动AI技术的研究与应用。 球友会

World Labs的目标是推动感知、生成与交互的三维世界,计划从虚拟空间的创作者入手,再逐步拓展。团队成员的背景也支持这一愿景,包括李飞飞与其同事们的专业知识共同构成了这一创新方向的基础。

发表评论

订阅我们的邮箱