IT之家 09-02
全球首个多模态世界模型:李飞飞创办的World Labs发布Atlas
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 9 月 2 日消息,"AI 教母 " 李飞飞的创企 World Labs 今日发布了 "全球首个多模态世界模型" —— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。

World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。

通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧。

Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。

Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。

具体来看,Atlas 能够执行涵盖世界生成、重建和模拟的广泛任务:

相机控制生成:Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频,输出最长 1 分钟的 1440p 视频

空间重建:Atlas 能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出,优于专门用于三维重建的先进模型。

时空模拟:Atlas 通过输入视频建模空间和时间,重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。

图像生成:Atlas 支持从文本生成图像和 360 度全景,它可以跟随复杂的提示,渲染文本,并生成各种视觉风格。

World Labs 官方表示,部分合作伙伴已获得 Atlas 抢先体验资格,将在未来几周内开放早期访问。

IT 之家附 Atlas 官方演示地址:

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

it之家 机器人 ai 李飞飞 建和
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论