SEMICONDUCTOR / AI INVESTING14 SEP 2026
AI 没有记忆
它记得你,是每次重读一遍
跟 AI 聊到第五十轮,你会发现它开口越来越慢。多数人的解释是"它在想"。真实的原因是:它在重读。
同一套两万多字的规则,模型第一轮读了 54 到 146 秒,第二轮只要 4 到 6 秒。这个差距里藏着大模型最反直觉的一个事实:它没有记忆——以及"记忆"这门生意长在哪里。
ZERO 01 每一轮都从零开始 |
CACHE 02 缓存把54秒变4秒 |
MOAT 03 带不走的对话才是资产 |
SEMICONDUCTOR / 01
一、失忆的顾问
大模型本身,每一轮都是从零开始的。你觉得它"记得刚才聊的",是因为外面的程序每次都把之前的全部对话重新递给它一遍。
一个贴切的比方:一位失忆的顾问。他很聪明,读得飞快,但每次见面,你都得把全部病历重新交到他手上。病历越厚,他开口越慢——第一轮聊三页纸,第五十轮聊三百页。所以长对话变慢不是它"累了",是每一个新问题都背着全部历史重新入场。
这决定了一个成本事实:对话越长,每一句话的成本越高——不是线性升高,是每轮都要为全部历史重新付一遍读取的钱。
SEMICONDUCTOR / 02
二、缓存:把 54 秒变成 4 秒
厂商当然知道这笔账,解法叫缓存:服务端记住上一轮读过的开头,只要这次的开头一模一样,就不必重读。
实测的差距非常直观:给模型两万多字的固定规则,第一轮开口要 54 到 146 秒;第二轮命中缓存,4 到 6 秒。三十倍上下的差距,全部来自"不用重读"。
由此产生一条工程铁律:不变的放前面,变化的放后面。 固定的规则放在开头,新问题和临时材料放在结尾——开头一动,缓存全废,又回到重读。
这就是转向所在:AI 的"记忆"不是它的能力,是外面一层被精心工程出来的结构——重递、截断、缓存、把不变的放前面。它看起来记得你,其实是这层结构在替它记。而凡是被工程出来的东西,就有成本曲线,有成本曲线的地方就有生意。
SEMICONDUCTOR / 03
三、投资上:带不走的对话才是资产
把这层结构放到应用公司的账本上,能看清两件事。
第一,成本端的杠杆在缓存命中率。 云厂商对命中缓存的输入普遍收十分之一量级的价格。同样的产品,把"不变的放前面"做好和做坏,推理账单能差出数倍——这解释了为什么表面相似的 AI 应用,毛利可以差一个档次。看应用公司,值得问它的推理成本占收入比在升还是在降:降,说明这层工程在起作用;升,说明它在替用户的长对话付越来越多的重读钱。
第二,收入端的护城河候选是"带不走的历史"。 本系列第 41 篇说过,会扩散的能力收不到租。模型会扩散,但用户在一个产品里积累的对话、偏好、修正记录不会——换一家,等于把病历全部重写。判据仍是那一个:客户离开时,留下的那叠纸有多厚、重建要多久。对话历史越厚、越被产品有效利用,切换成本越真实;反过来,如果一个 AI 产品每次会话都从零开始,它对用户也就没有积累,收租无从谈起。
SEMICONDUCTOR / 04
四、这个判断什么时候失效
三种情形要重估。一,架构层出现真正的常驻记忆——模型能把新信息写进自身参数而不是靠重读,"失忆的顾问"这个前提就没了,目前这还是研究方向,不是产品现实;二,长上下文的成本降到可以忽略,重读不再是账单上的显著项,缓存工程的毛利差随之收窄;三,你的用途全是单轮任务——翻译、摘要、一次性问答,记忆层根本不参与,本文讨论的成本与护城河都不适用。