李飞飞:LLM预测下一个词,而我们的模型预测「新视角」——这可能才是通往AGI的路

大自然给了动物眼睛,却没有给树木眼睛。为什么?
这是李飞飞在最新一场访谈里抛出的问题。
她的答案是:因为当你移动时,你就会看到一个新视角。而理解这个新视角,正是智能最根本的能力。
就在World Labs发布「全球首个」多模态世界模型Atlas的第二天,李飞飞拉上另外两位联合创始人——Justin和NeRF之父Ben,做客a16z播客,把Atlas到底是什么、背后的核心技术、以及它意味着什么,彻底讲了个明白。整场对话信息密度极高,但最值得记住的,是那个最有野心的判断:「新视角预测」和「下一个token预测」具有同等地位,它可能是通往AGI的基础原语。
这句话,几乎是在向整个大语言模型范式「宣战」。
01 Atlas到底在做什么?换个位置,继续看
过去几年,我们习惯了两种AI:LLM预测下一个token,视频模型预测下一帧。
Atlas做的是第三件事——预测新视角。
给它几张照片,它要理解这些画面在空间里是什么关系,再告诉你从另一个位置看过去会是什么样。你可以把一个虚拟相机放在时空中的任意位置,Atlas会理解,从那个时间、那个空间位置看过去,世界应该是什么样子。
最出圈的演示是「子弹时间」。看过《黑客帝国》的朋友都记得Neo向后倒下、相机绕他转一整圈的经典镜头。当年为了拍这一幕,剧组把数百台相机围成一圈。而现在用Atlas,只需要三台架在三脚架上的iPhone——拍一个人投篮,或一颗草莓落进牛奶里,然后你就能把时间冻结,让相机在牛奶溅起的瞬间「飞进」场景。
更让人咋舌的是3D采集的降本。以前重建一个空间,需要围着它拍几百甚至几千张照片;Atlas想把这个数字降到几张、几十张。Ben展示了一个案例:只用3到25张站在地面拍的照片,就重建出整个斯坦福主庭院——而且是空中俯瞰视角,那些俯瞰画面全是模型生成的,却又严格遵循重建的规律。
02 一个模型,装下「生成」和「重建」两件吵了半个世纪的事
这场访谈里,李飞飞反复强调了一个她觉得「大家重视还不够」的点:在计算机视觉领域,这是第一次实现像素生成和像素重建的统一。
这个领域已经存在半个多世纪了。李飞飞说,她实在数不清有多少博士论文研究的是重建问题或新视角合成问题。去参加计算机视觉会议,你会看到像素生成的方向、识别的方向、3D重建的方向,各走各的路。
过去,「生成」负责想象不存在的画面,「重建」负责还原真实空间,两拨人研究了几十年。而Atlas用相机位姿把它们接到了一起——它以视角和视角估计为锚点,把重建与生成统一进同一个模型,同时处理文字、图像、视频和3D。
为什么这件事重要?联创Justin解释了一个根本性矛盾:传统重建需要多张图像从多个视角看到同一个3D点才能三角测量,任何没被拍到的像素都会留下一个「洞」。可你永远不可能把所有东西都拍全——哪怕是世界级专家拿单反拍几百个视角,也还是会漏掉麦克风下方、桌子下面、椅子腿之间。
所以模型必须有生成能力:先根据看得见的内容做三角测量,再把那些不可避免地没拍到的部分「想象」出来。生成和重建,本质上是同一件事的两个端点。
03 机器人的瓶颈不是芯片,是数据
Atlas瞄准的,不只是影视、游戏和3D创作。
李飞飞透露,World Labs收购了一家叫SceniX的机器人公司,核心技术是「从现实到仿真,再从仿真到现实」。而Atlas正是这块拼图的重要部分。
她提出了一个和主流叙事不太一样的判断:机器人眼下最大的瓶颈是数据,而非芯片。「有一天,最大的问题也许会是芯片,但现在是数据。因为收集机器人所操作的现实世界数据非常困难。」
而且不只是收集就够了,还有一个关键步骤叫「随机化」——同一个环境里,电缆不能总朝一个方向弯,盒子的大小、颜色、位置都可能不同。Atlas可以把真实环境更快地搬进仿真世界,再通过随机化制造出海量训练场景。
Justin还往前推了一步:训练机器人策略和生成代码、图像有根本区别。机器人不是产出一件静态作品,而是一套要走进世界、采取行动的策略,而世界并不总会按你的预期反应。所以,一旦有了一个「学习出来」的模拟器,它脑子里已经理解了世界会如何响应动作——那么,为什么不能让模拟器本身成为规划器呢?
04 新视角预测,就是演化让动物移动时必须解决的问题
整场访谈的高潮,落在了那个关于「AI完备性」的讨论上。
Justin解释,在经典复杂性理论里,人们相信「下一个token预测」是AI完备的——Ilya举过那个著名例子:让模型读完一整本推理小说,最后一句是「凶手是」,请预测下一个token。任何智能任务都能被转换成这种形式。
但World Labs团队逐渐意识到,生成式新视角预测,同样具有AI完备性。你可以把电影的所有帧给它,然后凶手走出来,让它准确预测走出来的是谁。
李飞飞把视角拉到了演化的高度:新视角预测,恰好就是演化在让动物移动时必须解决的问题。大自然给了动物眼睛,却没有给树木眼睛——因为只有移动的生物,才需要不断理解「换个位置看世界是什么样」。
无论把它叫AI完备,还是智能完备,道理都在这里。因此,我们非常坚定地相信,新视角预测与下一个token预测具有同等地位。
05 总结
这场对话最迷人的地方,在于它提供了一个跳出「token叙事」的全新坐标系。
当所有人都在卷上下文长度、卷参数规模时,李飞飞和她的团队问了一个更根本的问题:智能的起点,到底是语言,还是空间?对一个在物理世界里移动、观察、行动的生物来说,理解「换个角度看世界」,也许比预测「下一个词」更接近智能的本源。
这个判断能不能立住,还要看后续模型。但有一点可以肯定:通往AGI的路,可能不止一条。而World Labs,已经在新修的那条路上,跑出了第一个清晰的脚印。
更多AI资讯,请扫码关注Aiker World社区公众号

评论 (0)
还没有评论
快来发表第一条评论吧
