MODEL / SYSTEM31 AUG 2026AI真正的竞争单位,不再只是模型
阅读抓手:模型提供智能,Context 提供现场,Tools 提供行动,Harness 提供秩序,推理预算提供资源,验证器负责判断真假,强化学习数据把真实经验重新变成能力。
强 AI 不是一个更聪明的大脑,而是一套能够持续工作、行动、验收并从经验中改进的系统。
我们习惯用一个模型的名字理解 AI:Claude、GPT、DeepSeek,或者某个更强的新版本。
但进入真实工作以后,模型只是系统的一部分。
一个模型即使很聪明,如果看不到正确材料、不能调用工具、不会保存进度、没有验收机制,也可能把任务做得又快又错。反过来,一个设计合理的工作系统,可以让模型持续行动、看到反馈、纠正错误,并在成本可控的前提下完成任务。
所以,今天真正需要理解的,不是七个孤立名词,而是一条完整能力链:
模型 + Context + Tools + Harness + 推理预算 + 验证器,构成运行系统;强化学习数据则把运行经验送回训练系统。
模型负责理解语言、调用知识、推理、规划和生成。它像一个通用大脑,决定系统大致能理解多复杂的问题。
但模型单独存在时,通常只能“回答”。它未必知道最新资料,也不能自动打开文件、查数据库、修改代码或确认结果已经生效。
因此,模型能力决定上限,却不等于任务完成能力。
会想,不等于做成。模型越强,这个差别反而越容易被忽略。
Context 是模型在当前时刻能够看见的全部材料。它不只是聊天记录,还包括系统规则、用户任务、文件内容、搜索结果、工具返回、任务进度和过去的关键决策。
Context 太少,模型缺背景;Context 太多,重点会被冲淡,信息也可能互相冲突。
好的 Context 工程不是把所有资料一次塞进去,而是为当前步骤提供“最小充分信息”:够模型作出正确决定,又不让无关内容消耗注意力。
这也解释了为什么长任务需要目录、进度文件和阶段性摘要。不是模型记性差,而是任何工作系统都需要管理工作记忆。
Tools 让模型能够影响外部世界,例如搜索网页、读取文件、执行代码、查询数据库、操作浏览器、生成图片、发送消息或写入公众号草稿。
模型决定下一步可能做什么,工具负责真正执行。
工具能力越大,风险也越大。一个能写文件、调用 API 或控制账号的 Agent,必须明确:它能读什么、能写什么、哪些动作需要审批、失败怎样返回,以及如何证明动作真实发生。
许多所谓“模型不会用工具”,本质上是工具职责重叠、参数含糊或错误语义不可靠。
Harness 可以理解为 AI 的运行框架。它负责接收任务、装配 Context、让模型选择工具、保存状态、处理反馈、控制权限、调用验证器,并决定何时继续或停止。
如果模型是员工的大脑,Tools 是电脑和设备,Context 是桌面上的材料,那么 Harness 就是项目流程、工作制度和项目经理。
Claude Code、Codex、DeepSeek Harness 都在解决这一层的问题:怎样让模型不只回答一次,而是在环境里持续工作。
Harness 本身不会让模型基础智力突然提高,却会显著改变真实任务成功率。聪明模型放进混乱流程,仍会反复乱跑;合理 Harness 能让模型看到结果、保留进度、纠正错误并完成验收。
推理预算决定系统愿意为当前任务投入多少计算:思考多少 Token、调用多少次工具、重试多少轮、运行多长时间、是否启用子 Agent,以及选择快模型还是强模型。
并非所有任务都值得开到最高档。改一个错别字,不需要最强模型思考十分钟;复杂研究则可能需要多轮搜索、分工、计算与复核。
好的系统会动态判断:继续计算带来的预期收益,是否高于新增成本和延迟。
所以,推理预算不是“越多越好”,而是一种任务经济学。
验证器负责回答最容易被忽略的问题:任务真的完成了吗?
它可以是单元测试、编译器、数学答案检查器、数据库约束、文件哈希、网页回读、财报原文、人工审核,或者另一个专门负责审查的模型。
验证器有两个位置。
在运行时,它决定任务是否通过、是否需要重试;在训练时,它把成功与失败转成奖励信号,帮助模型学习什么行动更有效。
没有验证器,Agent 很容易把“看起来像完成”误当成“真的完成”。
强化学习数据不是普通文章,而是关于“做一件事时,什么行动有效、什么行动失败”的经验。
一条有价值的任务轨迹,可能包括:理解任务、制定计划、调用工具、遭遇失败、读取反馈、修改行动,直到验证器确认成功。
例如编程 Agent 的轨迹不是一段“如何修复程序”的说明,而是:读代码、找错文件、修改、测试失败、读报错、再次修改、测试通过。
真正稀缺的不是轨迹数量,而是这些轨迹是否来自真实任务、结果能否验证、失败原因能否定位,以及数据是否可以合法、稳定地回流训练。
以“分析一家公司的财报”为例:
模型理解研究问题并制定计划;Context 提供财报、历史判断与研究框架;Tools 下载财报、提取表格、计算指标;Harness 安排读取、分析、交叉核验和写报告;推理预算决定投入多少搜索与复核;验证器检查数字、公式、出处和文件是否真实完成;成功与失败的轨迹再形成强化学习数据。
完整循环是:
任务 → 模型决策 → 工具行动 → 环境反馈 → 验证 → 纠错 → 完成 → 经验回流训练。
未来模型会继续变强,价格也可能继续下降。但企业和个人真正愿意付费的,不只是“模型会不会回答”,而是它能否进入真实工作流,以合理成本持续行动,并交付可验证结果。
这也是为什么只比较模型跑分会越来越不够。真正的竞争单位,正在从单一模型迁移到完整工作系统。
模型提供潜在智能,工作系统负责把潜在智能变成真实生产力。
以后看到一个 AI 产品,可以依次问七个问题:模型会不会想?Context 是否充分?Tools 能做什么?Harness 怎样组织任务?预算如何分配?结果由谁验证?经验能否回流改进?
能把这七个问题回答清楚,才算真正看懂一个 Agent 系统。