← 半导体与AI投资目录

半导体与AI投资 44|想 65 秒和想 16 秒,答案一样

SEMICONDUCTOR / AI INVESTING14 SEP 2026

想 65 秒和想 16 秒
答案一样

用推理模型,很多人的习惯是把"深度思考"开到最大——反正更聪明,想多点总不亏。这一篇用一组实测说明:亏,而且亏的方式很有规律。

同一道概率题,给一个推理模型三种思考额度:16 秒、25 秒、65 秒——三次答案完全相同。"思考"是按量计费的商品,而卖方有天然的动机让你多买。这一篇讲怎么算这笔账,以及它对判读 AI 公司收入的含义。

SAME

01

三个档位同一个答案

COST

02

思考按 token 计费

REAL

03

看任务完成量,不看 token 量

SEMICONDUCTOR / 01

一、一道题,三种想法

实验很简单。一道经典的概率题(发病率千分之一、检测准确率 99%,阳性后真患病的概率是多少——正确答案约 9%),交给同一个一线开源推理模型,分别给三档思考额度:

—低档:16 秒,思考 212 个 token,草稿只有一行——答对,9.02%
—中档:25 秒,467 个 token——答对
—高档:65 秒,1,196 个 token,草稿写了两千多字:认出题型、公式计算、换一种方法验算、自己挑错再修正——答案还是一样

慢四倍,贵五倍,买到的是同一个答案。因为这是道经典题:它的解法在训练数据里出现过千百遍,模型低档凭"直觉"就能对。深思在这里是纯浪费。

深思什么时候兑现?同一批实测里有反例:一道多步估值题,另一个模型想过了头——思考写满一万六千字的额度,答案没写完;而这道题正确的打开方式是中高档一次做对。新问题、多步推演、没见过的情境,才是思考额度的用武之地;而思考也存在"想过头"——额度全花在草稿上,正事没干完。

这就是转向:思考量是成本项,不是质量保证。 "想得多"和"想得对"之间没有稳定的正相关——经典题上是浪费,新题上是必需,过量时反而坏事。会用推理模型的人,不是把档位开满的人,是知道这道题值多少思考的人。

SEMICONDUCTOR / 02

二、卖方的账本:思考按 token 计费

把视角换到卖方,这件事的形状立刻变了。

推理模型的"思考"是按 token 计费的——模型每写一个字的草稿,都是账单上的一行。过去两年,"推理 token 消耗暴涨"是 AI 收入叙事里最亮的曲线之一。但上面的实验提示了这条曲线的成色问题:其中有多少是"必要的思考",有多少是经典题上开满档位的浪费?

买方一旦学会调档——闲聊低档、常规分析中档、只给真正的新问题开高档——平均思考量会被优化下来。这不是假设:调档只是一个参数,学习成本几乎为零,省下的是真金白银。所以把当前的推理 token 增速直接外推成长期需求,有一部分外推的其实是买方暂时还不会算账,而"客户不会算账"从来不是可持续的收入来源。

判读一家靠推理收费的公司,尺子和本系列第 40 篇是同一把:看它披露的是 token 量还是任务完成量。 token 量可以靠客户的浪费堆出来;任务完成量的增长才对应真实需求。两者都涨,是好生意;只有前者涨,要打个问号。

SEMICONDUCTOR / 03

三、这个判断什么时候失效

三种情形下,上面的话要反过来读。一,任务结构真的在变长——多步骤的代理类任务占比上升,每个任务需要的思考链客观变长,那么推理量的增长是真需求,不是浪费;二,计费方式转向按结果收费——按任务成功计价后,"token 幻觉"自动消失,判断对象换成了单位任务的定价能力;三,模型学会了自动调档且调得准——该省的省、该想的想,浪费被卖方自己消灭,此时低效客户带来的超额收入不复存在,但行业的单位成本曲线整体下移,利好的是应用层。

本篇为使用方法与收入质量分析。文中实验为单一环境、单一题型、有限次数实测,数字随模型与配置变化,不构成对任何产品的评价结论,不推荐任何标的,不构成投资建议。

阅读依据:三档实测(16s/212tok、25s/467tok、65s/1196tok,答案均为约 9%)为本地自有环境、一线开源推理模型(不具名)上的小样本实测;题目为公开教科书贝叶斯题型(发病率 0.1%、准确率 99%);「想过头」反例(1.6 万字思考额度用尽、答案未写完)为同批另一模型实测。「单位成功任务成本」承接本系列第 40 篇。