SEMICONDUCTOR / AI INVESTING14 SEP 2026
排名差 2 分
你的题上差 20 分
要给手头的活挑一个 AI,几乎所有人的第一动作是打开排行榜。这个动作本身没错,错的是把它当成最后一个动作。
两个开源模型在权威排行榜上只差 2 分,在同一套以使用者自己的决策规则打分的题上差了 20 分。排行榜发的是入场券;能不能上岗,只有你自己的题量得出来。
ENTRY 01 排行榜只发入场券 |
POSITION 02 岗位考核看具体分布 |
COST 03 真尺子是单位成功任务成本 |
SEMICONDUCTOR / 01
一次真实的选型
最近我们在一台大内存工作站上做了一轮本地模型选型,三个候选都是当前一线的开源模型。第三方综合评分:44.8、41.8、39.8——后两名只差 2 分,按排行榜的逻辑,选哪个都行。
然后我们换了一把尺子:一套自己出的题,评分标准不是「答得漂不漂亮」,而是使用者本人事先写下的决策规则——该算的数字算对没有、该说明的缺口说明没有、最后的决定权有没有交还给提问的人。同一批题、同一套系统提示、每题跑三遍。
结果:排行榜上差 2 分的那两个模型,在判断类题目上一个 88 分、一个 68 分(满分 110);排行榜第一的那个,拿了 100。
差距不是均匀分布的。常识题三个模型几乎看不出区别;拉开差距的全是判断题。垫底那个模型的失分方式很有代表性:篇幅最长、密度最低、多处数字没有依据,并且在一道题里悄悄替提问者做了「现在不做」的决定——这些恰好都是通用排行榜不扣分的地方。
这就是转向所在:排行榜量的是平均考生面对平均任务的表现;你的工作不是平均任务。 入学考试考的是通用能力,岗位考核考的是这份具体的活。两个分数之间没有换算公式,只能重新考一遍。
SEMICONDUCTOR / 02
自己的题该怎么出
出题比想象中难,难在防作弊——不是防模型,是防自己。几条我们实际用到的规矩:
按岗位给分,不给总分。 把题分成基础门槛、粗活、辅助判断、决策边界几级。一个模型完全可以「粗活能干、判断不能碰」,总分会把这种最有用的信息抹平。
机器能核对的,不让评委判。 字数、章节、计算题,用程序算标准答案。评委(往往也是个模型)只判必须由判断力判的部分,而且要先用同一批样卷校准松紧,再盲评——评委看不到答卷来自哪个模型。
防泄漏。 给模型看的材料里不能藏着事后结论,否则照抄就能满分,量出来的是抄写能力。
同题跑三次,一次越界就不算过。 偶尔守住不算守住——这条对「会不会替你做决定」这类边界题尤其重要。
每一版题库,换一个不同出身的评审交叉过一遍。 出题人自己带着盲区,而且自检发现不了。我们的一批题里出过一个真实事故:一处字数的标准答案,把「正文字数」给成了「整个文件的字数」,差 3.3%——这道题考别人数数,自己的答案先错了。这个错不是自查出来的(自查的人正是犯错的人),是换了一个不同出身的模型逐题复审才挑出来的,同一轮复审一共挑出三处。同一个模型审自己参与过的题,等于让被告当法官。
最好的题来自真实使用。 每次真实决策留下记录:当时的事实、选项、用了什么框架、事后对错。去掉结论,就是下一批考题。买来的题库测的是别人的岗位。
SEMICONDUCTOR / 03
投资上的同一把尺子
看 AI 公司的发布会跑分,判读方式完全一样:跑分领先是入场券,不是收入的理由。客户续费看的是模型在客户自己的题上的分数,而那个分数,发布会不会替你考。
买方真正的尺子是「单位成功任务成本」:把一件事真正办成,平均要花多少钱。跑分涨、这个数字不动,叙事就只是叙事。评估一个 AI 标的时,值得问一句:它的收入建立在哪种分数上——排行榜的,还是客户题库的?前者会随下一次发榜而流动,后者才留得住。
SEMICONDUCTOR / 04
这个判断什么时候失效
三种情形下,上面的话不成立:一,你的用途本来就是平均任务(写邮件、翻译、摘要),那么排行榜和你的体验基本一致,自建题库是浪费;二,你的题库泄漏了答案或样本太少,量出来的分数比排行榜更不可信;三,各家分数在你的题上本来就拉不开,那说明这个岗位已经商品化,该比的是价格,不是能力。