SPATIAL INTELLIGENCE / WORLD · ACTION · FEEDBACK
真正的进展,是 AI 能理解行动后果,并在错误之后修正自己。
导读:视频模型能生成逼真的世界,不等于 AI 已经理解世界。空间智能真正要解决的,是位置、关系、物理、行动与反馈。
过去几年,人工智能最显眼的进步发生在语言里。
模型能阅读、写作、编程、对话,也能调用工具完成越来越长的任务。于是人们很容易形成一种印象:只要语言模型继续变大,通往通用智能的主要道路就已经铺好。
李飞飞在与 Andrew Huberman 的长访谈里,提出了另一条路线。
她真正关心的不是让 AI “长出眼睛”,而是让 AI 从语言和二维像素,进入一个有空间、有物体、有因果、有行动后果的三维世界。
这就是空间智能。
一、AI 的能力边界,首先是数据的边界
李飞飞回顾 ImageNet 时,反复强调一个朴素事实:视觉智能的突破,不只来自更好的算法,也来自世界第一次被大规模整理成机器能够学习的数据。
图片被数字化、标注、分类,并用统一评测衡量之后,计算机视觉才获得了可持续进步的基础。
同样的机制也解释了语言模型为什么发展得特别快。
人类过去几十年在互联网上留下了海量文本:网页、书籍、代码、论坛、论文、问答。语言世界被记录得足够丰富,模型才能从中学习结构、规律与关联。
但现实世界的大量信息没有被这样记录:
因此,今天的 AI 并不是“平均地理解世界”。
它先在那些容易被记录、复制和评分的区域变强。
这是一条比“AI 有没有灵魂”更实用的判断。模型能学到什么,首先取决于什么能够被观察、留下痕迹,并形成反馈。
二、什么是空间智能
空间智能不是识别一张图里有猫、有桌子,也不只是生成一段看起来真实的视频。
它至少包含五种能力:
例如,一个真正理解房间的系统,不只要识别桌子,还要知道桌子占据多大空间、抽屉能否打开、杯子是否会被碰倒、机器人从哪里绕过去,以及移动物体后环境会发生什么变化。
这就把问题从“看见”推进到了“模拟与行动”。
三、别把视频生成误当成世界理解
今天的视频模型已经能制造极其逼真的画面。但“看起来像真的”,并不能证明模型拥有可靠的物理世界模型。
最少要区分三层:
第一层:渲染器
生成视觉上合理的图像或视频。目标是让人看起来真实。
第二层:模拟器
维护可计算、可校验的几何与物理状态。物体的尺寸、碰撞、材料、速度和遮挡关系要前后一致。
第三层:规划器
根据当前状态和目标选择行动,并在行动后利用反馈修正计划。
当前最明显的进步主要发生在第一层。第二层正在探索,第三层则还受到数据、硬件、安全和真实部署的多重限制。
因此:
生成一个可浏览的 3D 场景,不等于获得了工程级仿真;生成物理上“看着合理”的视频,也不等于能够训练可靠机器人。
四、空间智能为什么可能成为下一层基础设施
如果空间智能成熟,它的价值不会只存在于娱乐内容。
机器人
机器人需要理解环境、预测动作后果,并在失败后修正。单靠语言指令无法完成这套闭环。
医疗
手术、影像、人体结构和临床操作都具有强空间属性。但医疗数据稀缺、责任重大,因此更可能先出现医生与 AI 协作,而不是自主系统全面替代医生。
工业与设计
工厂、仓库、建筑、产品设计都需要几何、材料和物理约束。空间模型如果能降低仿真和试错成本,就可能改变真实世界的研发流程。
教育
学生未来不只通过文字学习,还可以进入可交互的历史场景、科学实验或空间模型。但工具越强,越需要训练提问、验证和独立判断,而不是把答案外包给系统。
所以,空间智能真正的产业意义是:
把现实世界逐步变成机器能够学习、模拟、验证和行动的环境。
五、李飞飞反复强调的另一条主线:人的主体性
整场访谈里,医疗、教育、机器人和治理看似是不同主题,背后却共享一个价值判断:AI 应该扩大人的能力与选择,而不是替人决定价值和命运。
在医疗里,AI 可以协助医生处理复杂信息,但照护中的责任和信任不能被一句“机器更准”轻易抹掉。
在教育里,全面禁用 AI 不现实,无条件依赖 AI 同样危险。真正需要培养的是提出好问题、核验答案和理解工具边界的能力。
在机器人领域,让机器承担危险、重复的劳动,不等于把关怀、责任与关系全部交给机器。
在治理上,技术未来也不能只由公司、资本和少数专家定义。
这套 human-centered AI 的立场值得保留,但必须注意:
“AI 应该增强人”是一项规范目标,不是对现实结果的预测。
它不能证明岗位替代不会发生,也不能保证商业竞争会自动尊重人的主体性。
六、中文剪辑版里,六处需要降温
这支 19 分钟中文视频是对 2 小时原访谈的二次整理,不是逐字翻译。它抓住了主线,却把若干假说和个人经历写得过于确定。
1. “寒武纪因视觉出现而爆发”
这是有影响力的科学假说,但仍存在争议,不能写成已经证明的单一因果。
2. “视觉皮层启发了神经网络”
方向成立,但神经网络的历史远不止视觉皮层一条路线。过度压缩会把复杂科学史变成英雄叙事。
3. “ImageNet 是现代 AI 的真正起点”
ImageNet 是重要拐点,但 2012 年的突破来自数据、GPU、深度网络与公开评测共同作用。它不是凭空出现的唯一源头。
4. Sora 的时间
OpenAI 在 2024 年 2 月公布 Sora,不是剪辑所说的 2024 年 1 月;面向公众推出则是 2024 年 12 月。
5. “AI 永远无法触及私人记忆与真正同理心”
更稳妥的说法是:当前模型没有可验证的主观体验,也无法直接学习从未被观察的信息。但“当前无法验证”不能推出“永久不可能”。
6. 达芬奇机器人手术的个人经历
达芬奇是由外科医生操控的机器人辅助手术系统,不是自主手术机器人。一次家庭经历不能外推为一般疗效结论。
七、还要看清她的利益位置
李飞飞是 World Labs 的联合创始人兼 CEO。World Labs 正在押注空间智能和世界模型。
因此,“空间智能是下一前沿”同时具有三种性质:
利益位置不等于观点错误,但它提高了验证要求。
真正值得跟踪的,不是演讲是否动人,而是:
- 独立空间模型会不会被通用多模态模型、游戏引擎或传统仿真平台吸收。
八、我们现在可以下什么判断
高置信度:
- 机器人受硬件、安全和部署周期约束,不会复制纯软件的迭代速度;
中等置信度:
低置信度:
结语
这场访谈最值得学的,不是“AI 终于长出眼睛”,而是一个更底层的问题:
世界中哪些状态能够被观察、记录、反馈和验证?
语言互联网已经完成了一轮大规模数字化,所以语言模型率先起飞。
空间智能要做的,是把位置、物体、行动与后果也变成可学习的数据结构。
它的潜力很大,难度也远高于生成一段看起来真实的视频。
真正的进展,不是 AI 能画出一个世界,而是它能在那个世界里保持一致、理解后果、采取行动,并在错误之后修正自己。
来源说明:本文对照分析了 YouTube 视频 `Pj7AErvadPA` 的 19:33 中文字幕,以及 Andrew Huberman 频道 2026 年 8 月 10 日发布的 2:08:13 李飞飞完整英文访谈。中文视频属于二次剪辑与转述;涉及李飞飞观点的关键结论以原访谈为主要依据。