← AI · 产业与技术目录

AI 下一步,不只是更会说话:李飞飞谈空间智能

SPATIAL INTELLIGENCE / WORLD · ACTION · FEEDBACK

真正的进展,是 AI 能理解行动后果,并在错误之后修正自己。

导读
:视频模型能生成逼真的世界,不等于 AI 已经理解世界。空间智能真正要解决的,是位置、关系、物理、行动与反馈。

过去几年,人工智能最显眼的进步发生在语言里。

模型能阅读、写作、编程、对话,也能调用工具完成越来越长的任务。于是人们很容易形成一种印象:只要语言模型继续变大,通往通用智能的主要道路就已经铺好。

李飞飞在与 Andrew Huberman 的长访谈里,提出了另一条路线。

她真正关心的不是让 AI “长出眼睛”,而是让 AI 从语言和二维像素,进入一个有空间、有物体、有因果、有行动后果的三维世界。

这就是空间智能。

一、AI 的能力边界,首先是数据的边界

李飞飞回顾 ImageNet 时,反复强调一个朴素事实:视觉智能的突破,不只来自更好的算法,也来自世界第一次被大规模整理成机器能够学习的数据。

图片被数字化、标注、分类,并用统一评测衡量之后,计算机视觉才获得了可持续进步的基础。

同样的机制也解释了语言模型为什么发展得特别快。

人类过去几十年在互联网上留下了海量文本:网页、书籍、代码、论坛、论文、问答。语言世界被记录得足够丰富,模型才能从中学习结构、规律与关联。

但现实世界的大量信息没有被这样记录:

  • 手触碰物体时的力度;
  • 物体被遮挡后的状态;
  • 机器人一次失败动作的完整过程;
  • 医疗现场里极少发生的复杂病例;
  • 人与人之间没有说出口的感受;
  • 三维环境中行动造成的连续后果。

因此,今天的 AI 并不是“平均地理解世界”。

它先在那些容易被记录、复制和评分的区域变强。

这是一条比“AI 有没有灵魂”更实用的判断。模型能学到什么,首先取决于什么能够被观察、留下痕迹,并形成反馈。

二、什么是空间智能

空间智能不是识别一张图里有猫、有桌子,也不只是生成一段看起来真实的视频。

它至少包含五种能力:

  1. 知道物体在哪里;
  2. 理解物体之间的空间关系;
  3. 推断被遮挡部分可能是什么;
  4. 预测动作会怎样改变环境;
  5. 根据目标规划下一步行动。

例如,一个真正理解房间的系统,不只要识别桌子,还要知道桌子占据多大空间、抽屉能否打开、杯子是否会被碰倒、机器人从哪里绕过去,以及移动物体后环境会发生什么变化。

这就把问题从“看见”推进到了“模拟与行动”。

三、别把视频生成误当成世界理解

今天的视频模型已经能制造极其逼真的画面。但“看起来像真的”,并不能证明模型拥有可靠的物理世界模型。

最少要区分三层:

第一层:渲染器

生成视觉上合理的图像或视频。目标是让人看起来真实。

第二层:模拟器

维护可计算、可校验的几何与物理状态。物体的尺寸、碰撞、材料、速度和遮挡关系要前后一致。

第三层:规划器

根据当前状态和目标选择行动,并在行动后利用反馈修正计划。

当前最明显的进步主要发生在第一层。第二层正在探索,第三层则还受到数据、硬件、安全和真实部署的多重限制。

因此:

生成一个可浏览的 3D 场景,不等于获得了工程级仿真;生成物理上“看着合理”的视频,也不等于能够训练可靠机器人。

四、空间智能为什么可能成为下一层基础设施

如果空间智能成熟,它的价值不会只存在于娱乐内容。

机器人

机器人需要理解环境、预测动作后果,并在失败后修正。单靠语言指令无法完成这套闭环。

医疗

手术、影像、人体结构和临床操作都具有强空间属性。但医疗数据稀缺、责任重大,因此更可能先出现医生与 AI 协作,而不是自主系统全面替代医生。

工业与设计

工厂、仓库、建筑、产品设计都需要几何、材料和物理约束。空间模型如果能降低仿真和试错成本,就可能改变真实世界的研发流程。

教育

学生未来不只通过文字学习,还可以进入可交互的历史场景、科学实验或空间模型。但工具越强,越需要训练提问、验证和独立判断,而不是把答案外包给系统。

所以,空间智能真正的产业意义是:

把现实世界逐步变成机器能够学习、模拟、验证和行动的环境。

五、李飞飞反复强调的另一条主线:人的主体性

整场访谈里,医疗、教育、机器人和治理看似是不同主题,背后却共享一个价值判断:AI 应该扩大人的能力与选择,而不是替人决定价值和命运。

在医疗里,AI 可以协助医生处理复杂信息,但照护中的责任和信任不能被一句“机器更准”轻易抹掉。

在教育里,全面禁用 AI 不现实,无条件依赖 AI 同样危险。真正需要培养的是提出好问题、核验答案和理解工具边界的能力。

在机器人领域,让机器承担危险、重复的劳动,不等于把关怀、责任与关系全部交给机器。

在治理上,技术未来也不能只由公司、资本和少数专家定义。

这套 human-centered AI 的立场值得保留,但必须注意:

“AI 应该增强人”是一项规范目标,不是对现实结果的预测。

它不能证明岗位替代不会发生,也不能保证商业竞争会自动尊重人的主体性。

六、中文剪辑版里,六处需要降温

这支 19 分钟中文视频是对 2 小时原访谈的二次整理,不是逐字翻译。它抓住了主线,却把若干假说和个人经历写得过于确定。

1. “寒武纪因视觉出现而爆发”

这是有影响力的科学假说,但仍存在争议,不能写成已经证明的单一因果。

2. “视觉皮层启发了神经网络”

方向成立,但神经网络的历史远不止视觉皮层一条路线。过度压缩会把复杂科学史变成英雄叙事。

3. “ImageNet 是现代 AI 的真正起点”

ImageNet 是重要拐点,但 2012 年的突破来自数据、GPU、深度网络与公开评测共同作用。它不是凭空出现的唯一源头。

4. Sora 的时间

OpenAI 在 2024 年 2 月公布 Sora,不是剪辑所说的 2024 年 1 月;面向公众推出则是 2024 年 12 月。

5. “AI 永远无法触及私人记忆与真正同理心”

更稳妥的说法是:当前模型没有可验证的主观体验,也无法直接学习从未被观察的信息。但“当前无法验证”不能推出“永久不可能”。

6. 达芬奇机器人手术的个人经历

达芬奇是由外科医生操控的机器人辅助手术系统,不是自主手术机器人。一次家庭经历不能外推为一般疗效结论。

七、还要看清她的利益位置

李飞飞是 World Labs 的联合创始人兼 CEO。World Labs 正在押注空间智能和世界模型。

因此,“空间智能是下一前沿”同时具有三种性质:

  • 她长期学术路线的延伸;
  • 对纯语言路线的技术判断;
  • 公司融资、招聘与产品推广所需要的叙事。

利益位置不等于观点错误,但它提高了验证要求。

真正值得跟踪的,不是演讲是否动人,而是:

  • 生成世界的尺度、碰撞和动力学是否稳定;
  • 仿真成绩能否预测真实机器人表现;
  • 从真实世界建立模拟环境的成本是否足够低;
  • 是否出现持续付费客户;
  • 独立空间模型会不会被通用多模态模型、游戏引擎或传统仿真平台吸收。

八、我们现在可以下什么判断

高置信度:

  • AI 下一步会更重视环境、空间、行动与反馈;
  • 视频生成与物理世界理解之间仍有明显鸿沟;
  • 机器人受硬件、安全和部署周期约束,不会复制纯软件的迭代速度;
  • 可数字化、可验证的任务会先被 AI 穿透。

中等置信度:

  • 空间智能会成为重要基础能力层;
  • 世界模型会成为机器人训练与仿真的关键组件。

低置信度:

  • World Labs 会成为这一层的平台赢家;
  • 独立空间模型会形成长期利润池;
  • “增强人”会自然成为商业竞争的最终结果。

结语

这场访谈最值得学的,不是“AI 终于长出眼睛”,而是一个更底层的问题:

世界中哪些状态能够被观察、记录、反馈和验证?

语言互联网已经完成了一轮大规模数字化,所以语言模型率先起飞。

空间智能要做的,是把位置、物体、行动与后果也变成可学习的数据结构。

它的潜力很大,难度也远高于生成一段看起来真实的视频。

真正的进展,不是 AI 能画出一个世界,而是它能在那个世界里保持一致、理解后果、采取行动,并在错误之后修正自己。


来源说明:本文对照分析了 YouTube 视频 `Pj7AErvadPA` 的 19:33 中文字幕,以及 Andrew Huberman 频道 2026 年 8 月 10 日发布的 2:08:13 李飞飞完整英文访谈。中文视频属于二次剪辑与转述;涉及李飞飞观点的关键结论以原访谈为主要依据。