昊梵体育网

Grok 4.6追平GPT旗舰,长程Agent输出价仅五分之一

干这行久了,最怕听两句话:一句是"这模型参数大,肯定强",一句是"贵的总没错"。8月12日,马斯克旗下的SpaceXAI
干这行久了,最怕听两句话:一句是"这模型参数大,肯定强",一句是"贵的总没错"。8月12日,马斯克旗下的SpaceXAI(原xAI)把新一代旗舰Grok 4.6摆上了桌,综合跑分跟OpenAI的GPT-5.6 Sol打平,API输出价却只有对方的五分之一。这件事值得掰开聊聊,因为它是2026年年中这波大模型竞争的一个样本——能力趋同之后,价格和长程Agent成了新的分水岭。
先说个反常识的。Grok 4.6这次没换底座,跟前代4.5同一套架构,靠的是后训练把长程执行能力顶上去。有人一听"没换底座"就撇嘴,觉得是挤牙膏。但换个角度看,2026年这个节点,前沿模型的增益大头已经从"堆参数"转到了"练后训练",DeepSeek V4-Pro走的就是同一条路。参数规模不再是唯一答案,能不能跑长活、把任务闭环做完,才值钱。
先说它最狠的地方:长程Agent,能自己测试自己改
Grok 4.6这次把主攻方向压在长时间运行的AI代理上,官方原话是强化"long-running agents"。说白了,就是让它干那些一跑就是几十分钟甚至更久的活:持续做研究、拆代码库、搭应用,中间自己跑测试、读报错、回头修,而不是你问一句它答一句。我同事拿它跑一个多模块重构的活,最直观的感受是它中途不丢上下文——50万token的窗口摆在那,装得下一个中型项目的骨架。对天天跟长任务搏斗的人来说,这种"能自己收尾"的稳定感,比跑分上的零点几要实在得多。

跑分:追平,但不是全面碾压
先看硬指标。在Artificial Analysis Intelligence Index上,Grok 4.6拿到61分,跟GPT-5.6 Sol并列。在GDPVal-AA v2这项偏真实经济价值的专业工作评测里,它拿下1753 Elo,反超GPT-5.6 Sol的1728和Claude Fable 5的1741。这个信号挺关键——它说明Grok 4.6强的不是刷题,是贴近真实商业场景的干活能力。当然话也要说全,Agent、编程、知识工作几项它进了第一梯队,但并没有每项都领先,别指望它处处压人一头。

四档推理强度,把选择权还给你
这次新增了xhigh档,加上low、medium、high,一共四档推理强度,默认high。日常够用就默认跑;要啃硬骨头就上xhigh,多花点token换更稳的推理;图快就降档。这件事看着小,其实是把成本控制权交回到开发者手里。老手都懂,同一个模型,档位选错,月底账单能差出好几倍。我见过不少团队,模型没选错,档位用错了,白烧的token比省下的时间还贵。

短板也说清楚,别只听夸
它不完美。上下文还是50万token,跟前代一样没涨;多模态只支持文本和图像输入、只输出文本,做不了图像生成;参数量官方也没公开。还有一点,马斯克已经预告Grok 4.7三四周后要上2.1万亿参数的新底座,所以4.6多少带点过渡版本的味道。冲着"这代稳不稳定"纠结的,可以再等等;急着用、要省钱的,它现在就够使。

算笔账:便宜不是嘴上说说
价格是Grok 4.6真正的杀招。API输入每百万token 2美元、输出6美元,缓存输入0.3美元。按今天(2026年8月17日)1美元约6.73元人民币算,输入约13.5元、输出约40.4元。对比同梯队:GPT-5.6 Sol输入5美元(约33.7元)、输出30美元(约201.9元);Claude Opus 5输入5美元(约33.7元)、输出25美元(约168.3元)。也就是说,输入便宜约六成,输出直接是GPT-5.6 Sol的五分之一、Claude Opus 5的约四分之一。有媒体算过,它单任务成本已经跟国产的Kimi K3打平。对预算敏感、又天天跑长任务的团队,这个价差月底会在账单上体现得明明白白。

生态接得也快,Copilot和Cursor都上了
8月14日Grok 4.6进了GitHub Copilot,Cursor、Grok Build同步支持,上线首周还给2倍包含用量。一个模型强不强,看它能不能无缝钻进你现有的工作流,而不是逼你换个新平台重新适应。这一点Grok 4.6做得利索,也让"追平旗舰"这件事落到了能立刻上手的地方。

如果你是天天跑Agent、写代码、做知识研究的开发者,预算又卡得紧,Grok 4.6值得放进候选名单——它把"追平旗舰"和"便宜五分之四"这两件通常矛盾的事凑到了一起。如果你更看重图像生成,或者不想沾上"过渡版本"的不确定性,那可以等Grok 4.7。选模型说到底,是选一个能跟你的账单和任务长期相处的东西。