← 半导体与AI投资目录

半导体与AI投资 40|排名差 2 分,你的题上差 20 分

SEMICONDUCTOR / AI INVESTING14 SEP 2026

排名差 2 分
你的题上差 20 分

要给手头的活挑一个 AI,几乎所有人的第一动作是打开排行榜。这个动作本身没错,错的是把它当成最后一个动作。

两个开源模型在权威排行榜上只差 2 分,在同一套以使用者自己的决策规则打分的题上差了 20 分。排行榜发的是入场券;能不能上岗,只有你自己的题量得出来。

ENTRY

01

排行榜只发入场券

POSITION

02

岗位考核看具体分布

COST

03

真尺子是单位成功任务成本

SEMICONDUCTOR / 01

一次真实的选型

最近我们在一台大内存工作站上做了一轮本地模型选型,三个候选都是当前一线的开源模型。第三方综合评分:44.8、41.8、39.8——后两名只差 2 分,按排行榜的逻辑,选哪个都行。

然后我们换了一把尺子:一套自己出的题,评分标准不是「答得漂不漂亮」,而是使用者本人事先写下的决策规则——该算的数字算对没有、该说明的缺口说明没有、最后的决定权有没有交还给提问的人。同一批题、同一套系统提示、每题跑三遍。

结果:排行榜上差 2 分的那两个模型,在判断类题目上一个 88 分、一个 68 分(满分 110);排行榜第一的那个,拿了 100。

差距不是均匀分布的。常识题三个模型几乎看不出区别;拉开差距的全是判断题。垫底那个模型的失分方式很有代表性:篇幅最长、密度最低、多处数字没有依据,并且在一道题里悄悄替提问者做了「现在不做」的决定——这些恰好都是通用排行榜不扣分的地方。

这就是转向所在:排行榜量的是平均考生面对平均任务的表现;你的工作不是平均任务。 入学考试考的是通用能力,岗位考核考的是这份具体的活。两个分数之间没有换算公式,只能重新考一遍。

SEMICONDUCTOR / 02

自己的题该怎么出

出题比想象中难,难在防作弊——不是防模型,是防自己。几条我们实际用到的规矩:

按岗位给分,不给总分。 把题分成基础门槛、粗活、辅助判断、决策边界几级。一个模型完全可以「粗活能干、判断不能碰」,总分会把这种最有用的信息抹平。

机器能核对的,不让评委判。 字数、章节、计算题,用程序算标准答案。评委(往往也是个模型)只判必须由判断力判的部分,而且要先用同一批样卷校准松紧,再盲评——评委看不到答卷来自哪个模型。

防泄漏。 给模型看的材料里不能藏着事后结论,否则照抄就能满分,量出来的是抄写能力。

同题跑三次,一次越界就不算过。 偶尔守住不算守住——这条对「会不会替你做决定」这类边界题尤其重要。

每一版题库,换一个不同出身的评审交叉过一遍。 出题人自己带着盲区,而且自检发现不了。我们的一批题里出过一个真实事故:一处字数的标准答案,把「正文字数」给成了「整个文件的字数」,差 3.3%——这道题考别人数数,自己的答案先错了。这个错不是自查出来的(自查的人正是犯错的人),是换了一个不同出身的模型逐题复审才挑出来的,同一轮复审一共挑出三处。同一个模型审自己参与过的题,等于让被告当法官。

最好的题来自真实使用。 每次真实决策留下记录:当时的事实、选项、用了什么框架、事后对错。去掉结论,就是下一批考题。买来的题库测的是别人的岗位。

SEMICONDUCTOR / 03

投资上的同一把尺子

看 AI 公司的发布会跑分,判读方式完全一样:跑分领先是入场券,不是收入的理由。客户续费看的是模型在客户自己的题上的分数,而那个分数,发布会不会替你考。

买方真正的尺子是「单位成功任务成本」:把一件事真正办成,平均要花多少钱。跑分涨、这个数字不动,叙事就只是叙事。评估一个 AI 标的时,值得问一句:它的收入建立在哪种分数上——排行榜的,还是客户题库的?前者会随下一次发榜而流动,后者才留得住。

SEMICONDUCTOR / 04

这个判断什么时候失效

三种情形下,上面的话不成立:一,你的用途本来就是平均任务(写邮件、翻译、摘要),那么排行榜和你的体验基本一致,自建题库是浪费;二,你的题库泄漏了答案或样本太少,量出来的分数比排行榜更不可信;三,各家分数在你的题上本来就拉不开,那说明这个岗位已经商品化,该比的是价格,不是能力。

本篇为模型选型方法与行业观察。文中测试数字来自单一环境、有限题量的实测,仅代表当时的模型版本与配置,不构成对任何产品的评价结论,不推荐任何标的,不构成投资建议。

阅读依据:三模型对照为本地工作站自有环境实测(第三方综合评分 44.8/41.8/39.8 为公开排行榜口径;判断题 100/88/68、满分 110 为自建题库口径,同题三跑、评委盲评),小样本、未经第三方复现。自建题库五条规矩为实际操作经验总结。「单位成功任务成本」为本系列沿用的买方尺子,非任何机构指标。题库交叉复审事故(字数标准答案偏差 3.3%、同轮挑出三处)为自有题库迭代过程中的实际记录。