出品 | 网易智能
作者 | 小扣
(相关资料图)
编辑 | 王凤枝
把最新模型换进旧工作流,表现反而退步了。
9月21日,SpaceXAI发布Grok 4.7。新模型已经进入xAI API、Grok Build和Cursor,并开始向GitHub Copilot用户开放。它支持50万token上下文窗口,可处理文本和图像,并提供从low到xhigh四档推理强度。
安全公司XBOW在50项漏洞测试中发现,Grok 4.7的早期候选版接进原有框架时略逊于4.6;换到基于Grok Build的系统,结果才反转。
两套工具得出了相反结果,差别不只在模型够不够聪明,还在Agent怎样保存上下文、调用工具,以及失败后如何重试。Grok 4.7偏爱短步骤、频繁获取反馈,Grok Build恰好顺着这种方式设计。
这次进步,要和Agent工具一起看
按SpaceXAI的说法,Grok 4.7采用了更大的基础模型,强化学习时间更长,训练任务也更偏向需要数小时才能完成的问题。公司还加强了模型检查自身工作和管理长上下文的能力。
Artificial Analysis分别以xhigh档和high档测试Grok 4.7与4.6,两代分数不作直接比较。单看4.7,它的综合指数为46分,在模拟律师、金融分析师等专业人士完成长时间工作的AA-Briefcase中为1657 Elo。
更能直接比较的是代码Agent测试。Grok 4.7与Grok Build组合后的指数为56分,比同样使用Grok Build和xhigh档的4.6高9分。三项子测试全部上升,其中Terminal-Bench从18%升至33%。这项测试看的,是模型能不能在终端里连续操作,把问题一步步解决掉。
图:代码Agent指数,同用Grok Build及xhigh档,4.7为56分,4.6为47分。
图:三项子测试均有提升;图中成绩均为模型与对应Agent工具的组合表现。
这9分是Grok 4.7和Grok Build共同取得的。现有公开数据还不能拆清,多少来自模型本身,多少来自它与框架的配合。
运行时,Grok 4.7负责判断下一步怎么走,Grok Build负责保存上下文、调用终端和其他工具,并在失败后安排重试。对需要连续操作的代码任务,这些环节都会影响最终结果。
离开Grok Build,4.7未必更强
离开Grok Build,结果就变了。XBOW拿到Grok 4.7的早期版本后,把它接进原有的漏洞利用框架,运行50项测试,每项重复10次。在固定迭代次数下,4.7略逊于4.6;不少任务需要多跑几轮才能得到相同结果,token效率也没有明显优势。
XBOW发现,4.7喜欢发出简短的终端命令,每走一步就拿回结果,再决定下一步;它不太愿意一次写出同时完成多项操作的长脚本。Grok Build适合这种短而连续的动作,XBOW原有的框架和这种工作方式不够合拍。
换成基于Grok Build的系统,结果随即反转。等权平均后,使用4.6时,这套系统一次典型运行找到42项真实问题;换成4.7后,数量增至68项。
图:旧框架中的完成率与迭代次数、Token用量:4.7并未全面优于4.6。
图:等权平均后的真实问题数:Build系统中,4.6为42项,4.7为68项;下方另列误报率。
42项到68项的反转,说明Grok Build并非可有可无。眼下,Grok 4.7正在进入更多第三方Agent工具。GitHub Copilot正向个人和企业用户逐步开放,企业管理员可以单独决定是否启用。
图:GitHub官方发布图展示了Copilot中的Grok 4.7模型选项。
用户在Cursor和GitHub Copilot中选中Grok 4.7后,模型会进入各自的Agent流程。Grok Build上的提升能不能带过去,要看这些工具怎样管理上下文、调用工具和处理失败。
单价没涨,一项任务可能更贵
Grok 4.7延续了上一代的标准API价格。单次请求的输入不满20万token时,每百万输入、缓存输入和输出token分别收费2美元、0.5美元和6美元;达到20万token后,三项价格分别升至4美元、1美元和12美元。第三方渠道Vercel AI Gateway也已接入,并为4.7提供截至9月27日的限时六折调用价。
单价没变,完成一项任务的费用却可能拉开。Artificial Analysis记录到,4.7的xhigh档平均每项任务输出约8.1万token,4.6同档约为3.8万。该机构还测得,4.7在长提示下每秒大约输出188个token,Intelligence Index中的单项任务平均用时约7.1分钟。公开页面没有进一步拆分模型生成与工具执行各用了多少时间。
图:每项任务平均输出:4.7约8.1万token,4.6约3.8万token,两者均为xhigh档。
输出token只是账单的一部分。XBOW的测试显示,4.7每轮输出更短,却有时需要更多轮交互;多轮任务还可能反复带上部分上下文。框架能否命中缓存、单次输入会不会越过20万token的价格门槛,都会改变费用。现有公开测试没有披露输入token总量和缓存命中情况,因此还不能把成本增加全部归因于输出变多。
一名Cursor Ultra用户连续两天运行同一项任务,4.6和4.7都使用xhigh档,并关闭Fast模式。按套餐额度下降速度估算,4.7的消耗约为4.6的2.5倍。这2.5倍只是Cursor套餐中一个项目的额度变化,不能直接换算成xAI API费用。但4.7消耗更快,与Artificial Analysis测到的输出token增加方向一致。
更多token也可能换来更少的返工。另一名开发者用相同提示词,让4.6和4.7制作同一个加密应用网站。两版初稿都不理想,但他认为4.7的3D视觉效果更好、生成也更快。他估计,4.7继续修改一两轮便可能接近目标,4.6还需要三四轮。这些后续修改并没有实际跑完,因此只能说明潜在收益,还不能证明省下的人工足以抵消额外消耗。