← 半导体与AI投资目录

半导体与AI投资 43|AI 没有记忆:它记得你,是每次重读一遍

SEMICONDUCTOR / AI INVESTING14 SEP 2026

AI 没有记忆
它记得你,是每次重读一遍

跟 AI 聊到第五十轮,你会发现它开口越来越慢。多数人的解释是"它在想"。真实的原因是:它在重读。

同一套两万多字的规则,模型第一轮读了 54 到 146 秒,第二轮只要 4 到 6 秒。这个差距里藏着大模型最反直觉的一个事实:它没有记忆——以及"记忆"这门生意长在哪里。

ZERO

01

每一轮都从零开始

CACHE

02

缓存把54秒变4秒

MOAT

03

带不走的对话才是资产

SEMICONDUCTOR / 01

一、失忆的顾问

大模型本身,每一轮都是从零开始的。你觉得它"记得刚才聊的",是因为外面的程序每次都把之前的全部对话重新递给它一遍。

一个贴切的比方:一位失忆的顾问。他很聪明,读得飞快,但每次见面,你都得把全部病历重新交到他手上。病历越厚,他开口越慢——第一轮聊三页纸,第五十轮聊三百页。所以长对话变慢不是它"累了",是每一个新问题都背着全部历史重新入场。

这决定了一个成本事实:对话越长,每一句话的成本越高——不是线性升高,是每轮都要为全部历史重新付一遍读取的钱。

SEMICONDUCTOR / 02

二、缓存:把 54 秒变成 4 秒

厂商当然知道这笔账,解法叫缓存:服务端记住上一轮读过的开头,只要这次的开头一模一样,就不必重读。

实测的差距非常直观:给模型两万多字的固定规则,第一轮开口要 54 到 146 秒;第二轮命中缓存,4 到 6 秒。三十倍上下的差距,全部来自"不用重读"。

由此产生一条工程铁律:不变的放前面,变化的放后面。 固定的规则放在开头,新问题和临时材料放在结尾——开头一动,缓存全废,又回到重读。

这就是转向所在:AI 的"记忆"不是它的能力,是外面一层被精心工程出来的结构——重递、截断、缓存、把不变的放前面。它看起来记得你,其实是这层结构在替它记。而凡是被工程出来的东西,就有成本曲线,有成本曲线的地方就有生意。

SEMICONDUCTOR / 03

三、投资上:带不走的对话才是资产

把这层结构放到应用公司的账本上,能看清两件事。

第一,成本端的杠杆在缓存命中率。 云厂商对命中缓存的输入普遍收十分之一量级的价格。同样的产品,把"不变的放前面"做好和做坏,推理账单能差出数倍——这解释了为什么表面相似的 AI 应用,毛利可以差一个档次。看应用公司,值得问它的推理成本占收入比在升还是在降:降,说明这层工程在起作用;升,说明它在替用户的长对话付越来越多的重读钱。

第二,收入端的护城河候选是"带不走的历史"。 本系列第 41 篇说过,会扩散的能力收不到租。模型会扩散,但用户在一个产品里积累的对话、偏好、修正记录不会——换一家,等于把病历全部重写。判据仍是那一个:客户离开时,留下的那叠纸有多厚、重建要多久。对话历史越厚、越被产品有效利用,切换成本越真实;反过来,如果一个 AI 产品每次会话都从零开始,它对用户也就没有积累,收租无从谈起。

SEMICONDUCTOR / 04

四、这个判断什么时候失效

三种情形要重估。一,架构层出现真正的常驻记忆——模型能把新信息写进自身参数而不是靠重读,"失忆的顾问"这个前提就没了,目前这还是研究方向,不是产品现实;二,长上下文的成本降到可以忽略,重读不再是账单上的显著项,缓存工程的毛利差随之收窄;三,你的用途全是单轮任务——翻译、摘要、一次性问答,记忆层根本不参与,本文讨论的成本与护城河都不适用。

本篇为技术机制与应用层结构分析。文中速度数字来自单一环境、有限次数实测,随模型版本、硬件与服务配置变化,不构成对任何产品的评价结论,不推荐任何标的,不构成投资建议。

阅读依据:首轮 54–146 秒 / 缓存轮 4–6 秒为本地自有环境实测(约两万字固定前缀,小样本);「缓存命中输入约十分之一量级计价」为主要云厂商公开定价的通行量级,未逐家核对最新价目;「不变的放前面」为提示缓存的公开工程惯例。「会扩散的能力收不到租」承接本系列第 39/41 篇。