COGNITION / J-SYSTEM15 SEP 2026
认知①|你缺的不是数据,是约束
一个做了很多年投资的人,大概都有过这种时刻:你看完了所有能找到的资料,读完了研报、年报、访谈、行业数据,然后发现自己还是判断不了。于是你的第一反应几乎必然是——再找一点资料。这个反应看起来无比合理,但它可能正好错在最要紧的地方。
判断之所以难,多数时候不是因为信息不够,而是因为你要在其中做选择的那个空间,大到没有任何数量的信息能填满它。
CURSE 01 维数灾难 |
BASIS 02 换基 |
CONSTRAINT 03 约束 |
这句话的完整版,六十五年前就有人算过账了。
COGNITION / 01
那笔账比你想的狠
1957 年,Richard Bellman 在《Dynamic Programming》里造了一个词:维数灾难(curse of dimensionality)。四年后,他在《Adaptive Control Processes》里再用了它,并且留下那句被引用了半个多世纪的话:
It is the curse of dimensionality, a malediction that has plagued the scientist from earliest days.
(这是维数的诅咒,一道从最早的日子起就困扰着科学家的咒语。)
这个词今天流传得很广,但流传的是一个被削弱过的版本。统计学界后来把它读成「高维空间里数据变稀疏、距离度量失效」——那是真的,但那不是 Bellman 的原意。
Bellman 的原版更狠:不是数据不够,是数据无限你也算不完。
他算的是一笔具体的账。假设一个状态空间有 d 个维度,每个维度切成 N 格,总状态数就是 N^d。一个六自由度的机械臂,位形加上速度是 12 维;每维切 100 格——
总格点数 = 100¹² = 10²⁴。
按每个数 8 字节存,需要 8×10²⁴ 字节。
而人类迄今造出的全部存储加起来,也不到这个数的一亿分之一。
注意这里发生了什么。这不是「算得慢」的问题,是「算不完」的问题,而且两者之间不是程度差别,是种类差别。
多一个不确定的参数,不是多一份工作量,是给指数加一。
COGNITION / 02
所以「圈外」不是斜坡,是断崖
这条账算清楚之后,一件长期说不清的事忽然有了机制。
价值投资里有一条老规矩叫能力圈:圈外的不做。这条规矩通常被当作道德训诫来讲——要谦虚,要承认自己无知,不要碰不懂的东西。听起来很对,但作为一条工作纪律,它含糊得要命:什么叫「懂」?懂到什么程度算在圈内?
维数灾难给了它一个完全不同的解释:
能力圈不是道德上的谦虚,是对维数灾难的工程回应。
跨出能力圈一步,不是难一点——是维度 +1,状态空间乘以 N。
这就解释了一个很多人有过、但说不清的体感:圈外的那种吃力,感觉上不是渐渐变难的,是忽然踩空的。
它本来就是断崖。指数函数没有斜坡。
COGNITION / 03
唯一的出路不是算得更快
Bellman 最值得学的地方,不是他发明了动态规划,而是他发明完之后立刻转身去处理「我这套东西算不出来怎么办」。
在一个追求解析解、最优解、精确解的年代,他选择了绕路。他讨论用多项式近似价值函数——别存每个格点的值,存一组系数;他甚至提出一条在数学上很不体面的建议:
「别追求最优了,追求改进就行。」
这里面藏着一条通则,六十五年没变过:
面对指数爆炸,唯一的出路不是算得更快,是砍维度。
六家公司、少数几个重大决定、只投看得懂的——这些不是三条建议,是同一个动作。
COGNITION / 04
砍维度靠的是约束,不是数据
那么问题就变成了:凭什么砍?砍掉哪些维度是安全的?
2026 年 8 月,Caltech 教授 Anima Anandkumar 在一档播客里把这件事说得很硬。她做的是物理 AI——用 AI 预测天气、模拟流体。她的判断是:语言模型那套「堆数据 + 堆参数」的剧本,在物理世界注定失败。
理由正是 Bellman 那笔账。物理模拟需要的空间分辨率,会把 Transformer 的上下文长度推到荒谬的量级:
If each dimension is even a few hundred grid points... we're talking hundreds of billions to even a trillion context length. So forget ever having a transformer for anything of this scale, all of the world's compute will not be enough.
(哪怕每个维度只有几百个网格点……我们说的就是上千亿甚至一万亿的上下文长度。所以别指望 Transformer 能处理这个尺度的东西,全世界的算力加起来都不够。)
而她的解法,和 Bellman 是同一个:换基。
傅里叶基、球谐基——换基不是压缩数据,是换一个坐标系,让同一个现象的有效维度塌下去。在这个新坐标系里,她可以直接把高频模态整个扔掉,依据是流体力学里的「能量级联」:大尺度结构集中在低频,高频多半是噪声。
那不是妥协,那是把一条物理知识变成了架构约束。
⇒ 于是这一句可以写下来了:
结构先验 = 知道哪些维度可以扔。
而「知道哪些可以扔」,靠的不是看过多少数据,是手里有没有那组约束。
COGNITION / 05
一个数字,把「数据为王」顶翻了
这套路线最有冲击力的证据不在天气,在核聚变。同一档节目里提到:
In fusion, a few thousand samples are enough to predict plasma disruptions, and to do it a million times faster than traditional simulation.
(在核聚变领域,几千个样本就足以预测等离子体破裂,而且比传统模拟快一百万倍。)
几千个样本。
在一个人人都说「数据是新石油」的年代,这个数字近乎冒犯。为什么几千条就够?
因为方程约束了自由度。物理系统被守恒律、对称性、边界条件死死绑着,它能去的地方本来就没几个。约束越强,需要的样本越少。
把这句话反过来读,就是对「数据为王」最硬的一次反驳:
数据量的需求不是问题的固有属性,是你所用表示的属性。
表示错了,再多数据也不够;表示对了,几千条就够。
COGNITION / 06
于是能力圈换了一个定义
现在可以回到开头那个时刻了——你读完了所有资料,还是判断不了。
按旧定义,「能力圈内」意味着你对这个领域知道得更多。按这条新的:
能力圈内 ≠ 你知道得更多。
能力圈内 = 你手上有那门生意的约束方程,所以少量证据就能定位。
圈外的真正含义是:你没有约束方程——于是每个变量都自由,你需要的证据量趋于无穷,所以永远不够。
这解释了一件在旧定义下解释不通的事:为什么在圈外,看再多研报也不管用。
不是研报不够多,不是研报不够好。是你缺的根本不是数据,是那组约束。 而约束不在研报里——研报提供的是观测,约束来自你对这门生意如何运转的理解。
这也解释了为什么圈内的人常常只需要很少的信息就能下判断,在外人看来像是武断。 他不是更大胆,他是在一个维度低得多的空间里做选择。
COGNITION / 07
那么,怎么知道自己有没有那组约束?
这一条必须可操作,否则上面所有的话都只是好听。
测试只有一个:你说不说得出,什么观察会让你承认自己错了。
—手里有约束方程的人说得出:如果毛利率连续两个季度跌破某条线、如果这家公司开始靠降价维持份额、如果客户集中度反向走——我这套论点就作废。他说得出,是因为约束本身划定了边界,而边界自带「越过它就完了」的那条线。—没有约束方程的人说不出。他能说的只有「再观察观察」「再看几个季度的数据」。
⚠️ 说不出证伪条件,通常不是因为谨慎,是因为没有约束。
没有约束就没有边界;没有边界,就没有任何东西能被推翻。
所以「我说不出什么会推翻我」这句话,本身就是最清楚的圈外信号。 它比任何自我评估都准,因为它不依赖你对自己有多诚实。
COGNITION / 08
但这把刀会反过来割人
写到这里必须把反面摆上,否则这篇文章就犯了它自己批评的毛病。
约束比数据更强大,也因此更危险。
物理学的约束经得起检验——守恒律被验证了几百年,你扔掉高频模态是有底气的。而生意上的「约束」,很多只是过去二十年碰巧成立的规律。
—「白酒的提价能力」是约束还是一段特定历史条件下的现象?—「制造业规模优势」——在自动化把劳动力成本挤出成本结构之后,它还是同一条约束吗?
⇒ 于是有了这条更要紧的补充:
数据错了,你得到的是噪音,而噪音会让你不安,不安会让你回头检查。
约束错了,你得到的是一个干净、自洽、高效的错误结论——而且你会觉得自己很敏锐。
Anandkumar 自己也留了这个口子。 有人评论她那条路线时说得很准:神经算子的结构是她选的,选对了是奇迹,选错了就是天花板。
所以完整的纪律是两条,缺一条都不成立:
—别用收集数据去替代寻找约束——那是在指数空间里徒劳地填格子。—定期检验你的约束还成不成立——尤其是那些让你判断得又快又舒服的。
COGNITION / 09
收口:什么样的信息值得占用你
最后回到信息本身。
统计学里有个概念叫充分统计量。抛一枚不公平的硬币一万次,历史有一万条记录;但要判断这枚硬币,你只需要两个数:正面几次、反面几次。其余的九千九百九十八条信息,不是次要信息,是零信息。
这给了「什么信息值得看」一个硬判据:
一条信息值不值得占用你,看它会不会改变你的后验。
不改变的,不是「参考一下」,是零。
而一个人之所以能这样筛选信息,前提恰恰是他有那组约束——约束定义了什么叫「改变后验」。没有约束的人没有后验可言,于是每一条信息看起来都同样重要,于是他只能全都读,于是他永远读不完。
这就是圈外那种「资料越看越多、判断越来越远」的完整机制。
不是你不够努力。是你在用加法,对抗一个指数。