评测风向变了:Agent 能力成为大模型新的能力标尺

大模型好不好,过去比的是"聪明不聪明"——常识问答、逻辑推理、语言生成。而现在,衡量标准正悄然转移:能不能在复杂的真实任务里自主规划、调用工具、多步执行,成了"下一代大模型"的核心评判维度。一句话,Agent(智能体)能力正在成为新的能力标尺。

这种转向最直观的体现,是评测基准的变化。过去业界看的是 GPQA、MMLU 这类知识类测试,而现在的主流榜单换成了终端任务基准——比如 DeepSWE、Terminal-Bench、Cybergym 等,考察的是模型在真实编程、运维与网络任务中的表现。许多厂商晒出的新成绩单,也几乎全部来自这些 Agent 类基准。

以 DeepSeek-V4-Pro-0813 为例,其各项终端任务得分相比预览版大幅提升,网络安防场景的得分一度微幅超过同期头部闭源模型。智谱 GLM-5.3 通过后训练强化,将编程类基准得分从个位数提升到更高区间。这些成绩单的"含金量",正是通过 Agent 基准来体现的。

Agent 竞争的战场也不仅仅停留在模型本身。8 月中旬 DeepSeek 发布的 Harness,就把竞争延伸到了工程层——它提供了一套可复用的智能体构建方案,能接入近 40 家模型厂商。这场竞争的实质,已经从"谁的模型更强"扩展到了"谁能把模型稳定地跑进真实业务场景、沉淀长程任务数据"。

行业普遍认为,随着 Agent 成为主流模型的标准配置,"推理模型"作为一个独立分类很可能在不久的将来被取消。各家旗舰如今都是以长程自主任务、工具调用、多步规划为核心卖点,且多智能体协作——即多个 Agent 自主协商、分工、汇总——正成为下一个前沿方向。

这轮风向的转变,对开发者和企业的启示是:选型不能再只盯着排行榜上的知识分数,而要更多考虑自己的真实工作流能否被模型稳定跑通。评测维度的演进,往往预示着一个时代的产品重心正在转移。

(本文由示例插件追加)