SOLOW / MEASURE07 SEP 2026
微观有效,
宏观为零
第 02 篇我问过一个问题:每 100 美元资本开支,最终能换回什么。当时我给的答案是「目前没有人能给出经得起推敲的回答」。
不是 AI 没用。是绝大多数企业的测量,停在了第一层。
MICRO 01 对照实验 +8.69% |
LEAK 02 价值在组织内渗漏 |
LAYER 03 测量停在第一层 |
这一篇不回答那个问题,但要回答一个更有用的:为什么它这么难回答。
中心判断:
微观层面的效率提升是真实且可测的;宏观层面看不见,不是因为提升是假的,而是因为价值在组织内部渗漏掉了。
而渗漏的直接原因是:绝大多数企业的测量停在"员工用不用",从未推进到"有没有穿透损益表"。
SOLOW / 01
一、微观数据:确实有效
在受控或半受控的环境里,效率提升是能测出来的:
其中最值得单独说的是一项带对照组的实验:某全球咨询机构与代码工具方合作,450 名使用者 对照 200 名不使用者,而且不是发问卷问"你觉得有没有帮助",而是直接读取开发流程遥测数据。
结果:
| 指标 | 变化 |
| 每位开发者的 Pull Request 数 | +8.69% |
| PR 合并率 | +15% |
| 构建成功率 | +84% |
这是我在这一整批材料里见到的唯一一个带对照组、且用遥测而非自述的证据。其他所有漂亮数字,在证据等级上都不如它。
SOLOW / 02
二、宏观:什么都看不见
但把镜头拉远,宏观劳动生产率统计上几乎没有反应。
这不是新现象。1987 年就有经济学家留下过一句名言:"除了在生产力统计数据里,计算机时代无处不在。" 当年个人电脑席卷办公室,此后整整十年,宏观生产率纹丝不动。
那么,省下来的时间去哪了?
一个被反复观察到的解释是:员工用 AI 省下的两小时,并没有变成更多产出,而是被更多冗长会议、对 AI 输出的反复核查、以及跨部门扯皮填满了。
这不是玩笑,它有结构性原因——见下一节。
SOLOW / 03
三、三级测量:渗漏发生在哪里
有一家全球咨询机构的推进方式,无意中给出了一把很好的尺子。它在部署后测的不是一层,是三层:
| 层级 | 问题 | 它的数字 |
| 第一层 | 员工用不用 | 月活 94%、周活 85%、每周至少用三天 63% |
| 第二层 | 员工觉不觉得有价值 | 报告省时间 81%、把省下的时间投入高价值工作 84%、认为质量提高 73% |
| 第三层 | 有没有穿透损益表 | 运营成本 −37%、财务流程周期 −95%、部分流程人工量 −90% |
关键在于:绝大多数企业只做到第一层。
采购调研里的另一条观察印证了这点——企业验证 ROI 时最常用的指标是"员工的采用率、赞许度、活跃度、节省时间程度"。这四个全部属于第一、二层。
于是就出现了这样的局面:企业能证明"员工在用",能证明"员工觉得省时间",但拿不出"公司的成本下降了多少"。
而宏观统计只承认第三层。
微观有效、宏观为零,不是矛盾——是测量断在了中间。
SOLOW / 04
四、为什么断在中间:这是组织问题,不是技术问题
即便是 AI 最核心的推动者,也公开承认了这一点。某前沿实验室的负责人在 2026 年 8 月的一次访谈中说:
「我曾以为,当我们做出 GPT 之后,很快就会爆发剧烈得多的颠覆,软件生意会立刻变成任人争夺的局面。但事实证明,根本没有发生。」
「整个经济系统,有着太庞大的惯性。人们继续做同样的事,继续从同一家公司买东西,继续想用原来的方式使用工具。」
他还举了一个例子:流媒体公司早就推出了 DVD 邮寄到家的服务,但此后好几年,人们还是每到周末就开车去实体店排队租碟。他说这件事一直刻在他脑子里——改变人的行为模式,比技术从业者以为的要难得多。
更诚实的一处:他坦承自己作为 AI 的缔造者,手上有极强的工具,处理邮件时依然在各个应用之间手动复制粘贴。
必须补上他紧接着说的下半句(这半句常被略去):
「我认为这在很多方面其实是好事,它会让这场巨大的转型走得更平滑、更慢。我为此心存感激。」
这不是"我错了,惨了",是"我错了,而且我认为这样更好"。语气差别很大,含义也不同。
SOLOW / 05
五、历史给的类比,以及它的边界
工厂电气化早期,资本家只是把蒸汽机拆下来、换上电动机,生产效率几乎没有变化。真正的爆发要等到几十年后——整座工厂的流水线按照电力的逻辑重新排布之后。
把新技术塞进旧结构,只会得到昂贵的平庸。
这个类比对当下有直接含义:如果价值兑现需要等待组织重构,那么它的时间尺度不是季度,是年甚至十年。
但这个类比有边界,必须说清楚:电力的用途在当时是清楚的(驱动机器),瓶颈只在布局;而现在连"AI 应该被用在哪个环节"本身都还在探索。用一个"用途明确、只差重排"的历史,去类比一个"用途尚在摸索"的现在,会低估不确定性。
SOLOW / 06
六、这个判断可能错在哪
第一,也是最重要的:那三个漂亮案例全部来自供应商发布的材料。
三级 KPI 的数字、扩容案例、对照实验,全部来自工具提供方的官方博客。它们是被挑选出来的标杆客户。我们看不到分母——多少企业试点之后放弃了?没有这个分母,"能穿透到第三层"的实际概率是未知的。
第二,微观数字本身可能被高估。受控实验里的任务通常边界清晰、可验证;而真实工作中大量任务是模糊的、责任分散的。26% 的编码提速,未必等比例迁移到"完成一个功能需求"上。
第三,"渗漏"这个说法本身缺少直接测量。"省下的时间被会议填满"是一个合理的解释,但我没有见到对它的定量研究。它目前是叙事,不是数据。
第四,也可能只是太早。电气化用了几十年。如果现在处在那条曲线的早期,宏观数据本来就该是平的——那么"看不见"不构成"没有"。
SOLOW / 07
七、可以落到行动的两个问题
面对任何一家宣称"AI 带来效率提升"的公司:
—它公布的是第几层的数字?如果只有采用率和满意度,那是第一、二层——它证明了员工在用,没证明公司赚到了。—有没有对照组?没有对照组的"提升 X%",无法区分是 AI 的效果、还是同期其他变化的效果。
第二个问题淘汰掉的材料,会比你预想的多得多。
SOLOW / 08
八、本文的置信度分层
| 层级 | 内容 | 可靠性 |
| 历史事实 | 计算机时代的生产率悖论 | 已发生 |
| 较硬证据 | 450 vs 200 对照实验的遥测数据 | 唯一带对照组,但供应商参与 |
| 事实 | 三级 KPI 的具体数字 | 供应商官方博客,标杆客户 |
| 引述 | 前沿实验室负责人的访谈原话 | 已回一手转录逐句核验 |
| 叙事 | "省下的时间被会议填满" | 合理但缺定量研究 |
| 类比 | 工厂电气化 | 用途明确 vs 用途待探索,边界已注明 |
| 缺失 | 试点后放弃的分母 | 本文最大的证据缺口 |
方法说明:本文讨论效率提升的测量层级问题,不评价任何公司的产品能力,不涉及估值、仓位或买卖判断。所引案例的选择性偏差已在第六节说明。不构成投资建议。