← 半导体与AI投资目录

半导体与AI投资 18|数据必须交出去,才能被处理

DATA / SOVEREIGNTY13 SEP 2026

数据必须交出去,
才能被处理

前面十七篇大多在谈能力、成本与可靠性。这一篇谈一个更靠前、也更硬的约束:这门生意所需要的原料,在法律和主权意义上,未必是它能拿到的。

你可以不把钱交给银行,但你没法不把钱交给银行还让它替你理财。

MECHANISM

01

处理即展开明文

LAW

02

合同挡不住更高位阶

SPLIT

03

压制平均·加固在位

中心判断:

大模型与以往的软件有一个机制上的根本差别:它必须「处理」数据,而处理发生在它内部。

因此「把数据交给它」不是一个可以设计掉的环节,而是这门生意的前提。

一旦最有价值的数据所属的一方意识到这一点,AI 的可用原料会被重新划界——这是一条被普遍低估的、对增长速度的约束。

DATA / 01

一、先把机制讲清楚:它和你熟悉的软件不一样

一个聊天软件的功能是把内容从 A 送到 B。它不需要理解你说了什么,端到端加密之所以可能,正是因为理解不是它的功能

一个云存储的功能是保管。它也不需要理解,所以可以做到「我存着,但我打不开」。

大模型不同。它的功能就是理解。

要让模型总结一份合同、分析一批数据、在一个流程里做决策,它必须在自己内部展开这些内容。你可以加密传输、可以加密存储,但在被处理的那一刻,它必须是明文的

这就得到了第一个结论:

对大模型来说,「我看不到你的数据」和「我能帮你处理数据」在当前架构下不可兼得。

有人会说可以建一个双方共管的数据中心、可以做机密计算、可以做联邦学习。这些方向都真实存在、也都在推进。但它们目前的共同问题是:模型方知道模型内部发生了什么,而对方不知道。 监督一个自己看不懂的过程,本质上是信任,不是验证。

DATA / 02

二、第二个结论:「保证不外泄」这句话的效力,比你以为的低

商业世界解决信任问题的常规工具是合同:我保证不外泄,违约你可以告我。

但合同的效力有边界。 当数据的性质上升到某个层级——涉及关键基础设施、涉及国家安全——约束供应商的就不再只是合同,还有更高位阶的法律。而更高位阶的法律通常要求供应商在特定情形下必须报告

于是出现一个结构性矛盾:

同一家公司,同时承诺了「我不告诉任何人」和「在某些情形下我必须告诉政府」。

这两条不可能同时兑现,而决定哪一条生效的,不是合同。

这不是某一家公司的诚信问题,是它注册在哪、受哪套法律管辖的问题。 换一家公司、换一个国家,矛盾的方向变了,矛盾本身还在。

DATA / 03

三、于是最干净的解法是:让自己拿不到

这里有一个值得研究的产业先例。

消费电子行业里最重视隐私叙事的那家公司,做法不是「我保证不看」,而是在架构上让自己没有能力看:密钥在设备上、服务端只存密文、连它自己也解不开。

这个设计常被当作营销来读。但从公司治理角度看,它是一次取舍:主动放弃一部分能力,换取不被卷入那个两难。

当你有能力拿到,你就必须回答「在什么情况下你会交出去」这个问题。

当你没有能力拿到,这个问题就不存在了。

这是 AI 时代一个会被反复使用的产品设计逻辑,而它对商业模式有直接代价:放弃的是数据带来的产品改进空间。谁愿意付这个代价、谁不愿意,会分化出两类完全不同的公司。

DATA / 04

四、投资含义:一条被低估的增长约束

把上面三节合起来,得到一个对增长速度的判断:

最有价值的那部分数据——高价值工业数据、关键基础设施数据、受监管行业的核心数据——正在变得越来越难以流向通用大模型。

不是因为技术做不到,而是因为数据的所有方开始意识到「处理即拥有」,于是用制度手段划界。

这条约束会以几种形式出现:本地化部署要求、数据不出域要求、对模型供应商注册地的限制、对训练数据来源的审查。每一条都提高交付成本、拉长销售周期、压低毛利。

所以这是一条同时压制收入增速与利润率的约束,而它不会出现在任何一份技术路线图上——技术路线图只回答「能不能做到」,不回答「允许不允许」。

DATA / 05

五、但这条约束是双向的,而第二个方向更值得注意

如果「谁能处理,谁就实际拥有」,那么已经合法处在里面的一方,优势会被放大

已经把系统部署进客户内网、且运行多年的厂商;
已经沉淀了海量第一方数据、且不需要向外索取的平台;
已经通过了最严格审查、拿到了资质的供应商。

新进入者拿不到同等原料。 换句话说——

这条约束压制的是「所有 AI 公司的平均增速」,但它同时加固「已经在里面的那几家」。

这两个效应方向相反,而且落在不同的公司身上。把它们混起来谈,会得出一个既看空又看多、因而什么也没说的结论。 真正要做的是分清:你看的这家公司,是被约束的一方,还是被加固的一方。

DATA / 06

六、这个判断可能错在哪

第一,技术可能绕过去。 机密计算、可信执行环境、同态加密、联邦学习——任何一条走通并被监管接受,第一节的前提就松动了。这是本文最大的不确定性,我无法排除。 我能说的只是:截至目前,它们在大模型推理这个量级上还不实用。

第二,我把「制度性划界」讲得比现实整齐。 现实里更常见的是模糊地带、个案审批、灰色操作。一条趋势不等于一条防线,执行的松紧比条文重要得多,而松紧不可预测。

第三,「让自己拿不到」并非总是可选项。 那家消费电子公司能这么做,是因为它的商业模式本来就不依赖数据变现。对一家靠数据改进模型的公司,同样的取舍等于自断一臂——所以这个先例的可复制性,比它看起来低。

第四,第五节那条「加固在位者」我没有量化。 我不知道这个加固效应有多大、需要多久兑现。它目前是一个方向,不是一个幅度。

DATA / 07

七、可以跟踪的三个信号

合同里是否出现「数据不出域」「模型本地部署」成为标准条款——这是约束从个案变成惯例的标志。
模型供应商的注册地/司法管辖开始进入采购评分表——这意味着技术之外的维度开始定价。
是否出现「厂商主动放弃数据访问权」的产品设计并被客户接受——第三节那条路线是否可复制,答案在这里。

第三个最有信息量:它同时检验了技术可行性与商业可承受性。

DATA / 08

八、本文的置信度分层

层级内容可靠性
技术机制大模型必须在内部展开明文才能处理当前架构下成立
法律结构合同承诺与更高位阶法律义务可能冲突结构性事实,不针对任何司法辖区
产业先例存在「架构上让自己拿不到」的设计取舍公开产品事实
推断最有价值数据流向通用模型会变难本文核心,方向判断
双向性压制平均增速,同时加固在位者逻辑推演,无量化
最大反证隐私计算若走通,前提松动无法排除
 

这一篇没有谈任何一家公司的估值,也不该被读成对谁的看多或看空。 它只想确立一件事:在评估一家 AI 公司的增长曲线时,「它能不能拿到原料」是一个和「它的模型有多强」同等重要、却很少被单独列出的变量。

 
 

方法说明:本文讨论数据可及性对 AI 商业模式的一般性约束,不针对任何特定国家、司法辖区或企业,不涉及任何具体事件。不评价任何公司,不涉及估值、仓位或买卖判断。不构成投资建议。