SEMICONDUCTOR / AI INVESTING14 SEP 2026
想 65 秒和想 16 秒
答案一样
用推理模型,很多人的习惯是把"深度思考"开到最大——反正更聪明,想多点总不亏。这一篇用一组实测说明:亏,而且亏的方式很有规律。
同一道概率题,给一个推理模型三种思考额度:16 秒、25 秒、65 秒——三次答案完全相同。"思考"是按量计费的商品,而卖方有天然的动机让你多买。这一篇讲怎么算这笔账,以及它对判读 AI 公司收入的含义。
SAME 01 三个档位同一个答案 |
COST 02 思考按 token 计费 |
REAL 03 看任务完成量,不看 token 量 |
SEMICONDUCTOR / 01
一、一道题,三种想法
实验很简单。一道经典的概率题(发病率千分之一、检测准确率 99%,阳性后真患病的概率是多少——正确答案约 9%),交给同一个一线开源推理模型,分别给三档思考额度:
—低档:16 秒,思考 212 个 token,草稿只有一行——答对,9.02%—高档:65 秒,1,196 个 token,草稿写了两千多字:认出题型、公式计算、换一种方法验算、自己挑错再修正——答案还是一样
慢四倍,贵五倍,买到的是同一个答案。因为这是道经典题:它的解法在训练数据里出现过千百遍,模型低档凭"直觉"就能对。深思在这里是纯浪费。
深思什么时候兑现?同一批实测里有反例:一道多步估值题,另一个模型想过了头——思考写满一万六千字的额度,答案没写完;而这道题正确的打开方式是中高档一次做对。新问题、多步推演、没见过的情境,才是思考额度的用武之地;而思考也存在"想过头"——额度全花在草稿上,正事没干完。
这就是转向:思考量是成本项,不是质量保证。 "想得多"和"想得对"之间没有稳定的正相关——经典题上是浪费,新题上是必需,过量时反而坏事。会用推理模型的人,不是把档位开满的人,是知道这道题值多少思考的人。
SEMICONDUCTOR / 02
二、卖方的账本:思考按 token 计费
把视角换到卖方,这件事的形状立刻变了。
推理模型的"思考"是按 token 计费的——模型每写一个字的草稿,都是账单上的一行。过去两年,"推理 token 消耗暴涨"是 AI 收入叙事里最亮的曲线之一。但上面的实验提示了这条曲线的成色问题:其中有多少是"必要的思考",有多少是经典题上开满档位的浪费?
买方一旦学会调档——闲聊低档、常规分析中档、只给真正的新问题开高档——平均思考量会被优化下来。这不是假设:调档只是一个参数,学习成本几乎为零,省下的是真金白银。所以把当前的推理 token 增速直接外推成长期需求,有一部分外推的其实是买方暂时还不会算账,而"客户不会算账"从来不是可持续的收入来源。
判读一家靠推理收费的公司,尺子和本系列第 40 篇是同一把:看它披露的是 token 量还是任务完成量。 token 量可以靠客户的浪费堆出来;任务完成量的增长才对应真实需求。两者都涨,是好生意;只有前者涨,要打个问号。
SEMICONDUCTOR / 03
三、这个判断什么时候失效
三种情形下,上面的话要反过来读。一,任务结构真的在变长——多步骤的代理类任务占比上升,每个任务需要的思考链客观变长,那么推理量的增长是真需求,不是浪费;二,计费方式转向按结果收费——按任务成功计价后,"token 幻觉"自动消失,判断对象换成了单位任务的定价能力;三,模型学会了自动调档且调得准——该省的省、该想的想,浪费被卖方自己消灭,此时低效客户带来的超额收入不复存在,但行业的单位成本曲线整体下移,利好的是应用层。