先说个反常识的。Grok 4.6这次没换底座,跟前代4.5同一套架构,靠的是后训练把长程执行能力顶上去。有人一听"没换底座"就撇嘴,觉得是挤牙膏。但换个角度看,2026年这个节点,前沿模型的增益大头已经从"堆参数"转到了"练后训练",DeepSeek V4-Pro走的就是同一条路。参数规模不再是唯一答案,能不能跑长活、把任务闭环做完,才值钱。
先说它最狠的地方:长程Agent,能自己测试自己改
Grok 4.6这次把主攻方向压在长时间运行的AI代理上,官方原话是强化"long-running agents"。说白了,就是让它干那些一跑就是几十分钟甚至更久的活:持续做研究、拆代码库、搭应用,中间自己跑测试、读报错、回头修,而不是你问一句它答一句。我同事拿它跑一个多模块重构的活,最直观的感受是它中途不丢上下文——50万token的窗口摆在那,装得下一个中型项目的骨架。对天天跟长任务搏斗的人来说,这种"能自己收尾"的稳定感,比跑分上的零点几要实在得多。

先看硬指标。在Artificial Analysis Intelligence Index上,Grok 4.6拿到61分,跟GPT-5.6 Sol并列。在GDPVal-AA v2这项偏真实经济价值的专业工作评测里,它拿下1753 Elo,反超GPT-5.6 Sol的1728和Claude Fable 5的1741。这个信号挺关键——它说明Grok 4.6强的不是刷题,是贴近真实商业场景的干活能力。当然话也要说全,Agent、编程、知识工作几项它进了第一梯队,但并没有每项都领先,别指望它处处压人一头。

这次新增了xhigh档,加上low、medium、high,一共四档推理强度,默认high。日常够用就默认跑;要啃硬骨头就上xhigh,多花点token换更稳的推理;图快就降档。这件事看着小,其实是把成本控制权交回到开发者手里。老手都懂,同一个模型,档位选错,月底账单能差出好几倍。我见过不少团队,模型没选错,档位用错了,白烧的token比省下的时间还贵。

它不完美。上下文还是50万token,跟前代一样没涨;多模态只支持文本和图像输入、只输出文本,做不了图像生成;参数量官方也没公开。还有一点,马斯克已经预告Grok 4.7三四周后要上2.1万亿参数的新底座,所以4.6多少带点过渡版本的味道。冲着"这代稳不稳定"纠结的,可以再等等;急着用、要省钱的,它现在就够使。

价格是Grok 4.6真正的杀招。API输入每百万token 2美元、输出6美元,缓存输入0.3美元。按今天(2026年8月17日)1美元约6.73元人民币算,输入约13.5元、输出约40.4元。对比同梯队:GPT-5.6 Sol输入5美元(约33.7元)、输出30美元(约201.9元);Claude Opus 5输入5美元(约33.7元)、输出25美元(约168.3元)。也就是说,输入便宜约六成,输出直接是GPT-5.6 Sol的五分之一、Claude Opus 5的约四分之一。有媒体算过,它单任务成本已经跟国产的Kimi K3打平。对预算敏感、又天天跑长任务的团队,这个价差月底会在账单上体现得明明白白。

8月14日Grok 4.6进了GitHub Copilot,Cursor、Grok Build同步支持,上线首周还给2倍包含用量。一个模型强不强,看它能不能无缝钻进你现有的工作流,而不是逼你换个新平台重新适应。这一点Grok 4.6做得利索,也让"追平旗舰"这件事落到了能立刻上手的地方。
