Grok 4.6 评测:$2 起步的长时任务智能体,性价比杀穿前沿模型

0 评论 609 浏览 0 收藏 16 分钟

让模型自己跑完一个多步任务,而不是每步都停下来等你确认,这是今年大模型最卷的方向。Grok 4.6 就是冲着这个来的。它在上一代基础上补了一轮长时智能体训练,综合智能指数追平了 OpenAI 的旗舰,输出价却只要对手的零头。长任务、改代码、把想法做成能跑的应用,它比前代强了不止一档。值不值得把活儿交给它,上手试过才知道。

它是什么来头

Grok 4.6 是 SpaceXAI(前身 xAI)在 2026 年 8 月 12 日发布的最新大模型。一句话定位:面向长时运行智能体的专用模型。它不是那种你问一句答一句的聊天模型,而是能接住一个模糊需求,自己调研、分析、改代码、把想法做成可运行应用的那种。

背景信息值得说一下。xAI 今年 6 月被 SpaceX 收购后完成品牌重塑,更名 SpaceXAI,同月还创下了纳斯达克 IPO 纪录。Grok 4.6 距离上一代 Grok 4.5 只隔了一个月,迭代节奏非常快。

跟传统对话模型比,Grok 4.6 的重点不在单轮答得多漂亮,而在多步任务能坚持跑完。官方给出的卖点就三个词:长时智能体、交互式、视觉工作。换句话说,它拼的是”把事做完”而不是”把话说漂亮”。

官网:https://grok.com/| 文档:https://docs.x.ai/developers/models/grok-4.6

到底强在哪

聊完来头,最想搞清楚的是它跟上一代比,到底把哪些短板补上了。

核心变化集中在”长任务”这件事上。官方说 Grok 4.6 做了一轮更长的增量训练,还用 Grok 4.5 重新生成了监督微调轨迹,再叠加面向智能体的强化学习。落到体验上,就是它能在一个任务里坚持更多步骤,还开始出现自我校验行为:先检查自己的产出,再往下走。

几个关键能力拆开看:

  • 长时智能体:能接住一个模糊需求,自己调研陌生领域、搭应用结构、实现核心交互,再根据多轮反馈持续迭代
  • 编码工程:在 DeepSWE v1.1 上从 54% 跳到 65.9%,CursorBench 从 66.7% 升到 69.9%,跨代码库改动的能力明显增强
  • 知识工作:GDPVal-AA v2 拿到 1753 分,是当前榜单里数一数二的水平
  • 视觉与交互项目:第一遍就能立起应用的视觉语言和结构,比 Grok 4.5 强很多,适合从想法直接起一个能看的原型

值得一提的是它配套的 Grok Bot 产品。这是 8 月 11 日刚放出的早期测试版,定位”AI 队友”:每个 Bot 拥有自己的云电脑,能登录你的工具、跨应用独立干活,只在需要审批时才回来找你。

怎么用

聊完功能,实际用起来顺不顺才是关键。

Grok 4.6 没有独立的客户端,它是通过 API 和各种开发平台触达的。模型 ID 就是 grok-4.6。最省事的路子是直接用 Cursor 或 Grok Build,官方给首发第一周加了 2 倍用量额度。

走 API 的话,接入方式跟其他模型没区别。配好 key,把 model 参数填成 grok-4.6 就能调。输入支持文本和图片,输出是纯文本。50 万 token 的上下文窗口,够塞进一个中型代码库或者一本长文档。

第一次试长任务的感受是,它确实比上一代”坐得住”。给一个模糊的产品点子,它能自己查资料、定结构、写第一版,中间不会频繁停下来问你要不要继续。缺点是视觉类产出偶尔偏保守,得再推一把才有惊喜。

在 Cursor 里切到 Grok 4.6 几乎零成本,模型下拉框里直接选。我拿一个多文件的旧项目试了试,让它跨三个文件加一个功能,它把改动、自检、再修正串了起来,来回七八轮没跑偏。倒是长上下文超 20 万 token 后费率翻倍这点,第一次用容易忽略。

这样用效率翻倍

很多人不知道它有些用法能把长任务的价值榨得更干净:

  • 长上下文计价:提示词超过 20 万 token 后费率会上调,所以尽量把稳定前缀做缓存,缓存输入只要 $0.50 每百万
  • 拿缓存换成本:长任务里大量重复的系统提示词,用缓存能省下不少输入开销
  • 分步留痕:让它自我校验时,明确要求”每完成一步先复述结果再继续”,能把它的自检行为逼出来
  • 搭配 Cursor 白嫖额度:首发第一周 Cursor 和 Grok Build 有 2 倍用量,适合这个窗口期密集试跑

横向对比

大模型赛道现在一天一个版本,绕不开的对手就那几个。直接上数据:

维度 Grok 4.6 GPT-5.6 Sol Max Claude Fable 5 Max
核心定位 长时智能体+视觉 复杂专业工作旗舰 长时自主智能体
输入价(/百万) $2 $5 $10
输出价(/百万) $6 $30 $50
上下文窗口 500K 1.1M 1M
AA 智能指数 61 61 62

价格上的差距一目了然:Grok 4.6 的输出价只有 GPT-5.6 Sol Max 的五分之一,Claude Fable 5 Max 的约八分之一。智能指数上三者几乎打平,都在 61 到 62 之间。

但要看清一个短板:纯编码深度上它还不是最强。DeepSWE v1.1 它拿 65.9%,GPT-5.6 Sol Max 是 73%,Fable 5 Max 是 70%。如果只看最难的代码改动,那两位老大哥还压它一头。它的优势在价格和长任务的稳定性,不在单项峰值。

还有个不能忽略的存在是 DeepSeek V4 Pro,输入价只要 $0.435、输出 $0.87,比 Grok 4.6 又便宜一个数量级。不过它走开源路线,长时智能体的稳定性跟闭源前沿模型还有差距,追求极致性价比的可以自己压测对比。

真实用户怎么说

这模型发布才一天,成规模的用户口碑还没沉淀出来,但早期信号已经能看出两极。

积极的一面:Cognition(Devin 的母公司)已经把 Grok 4.6 接进了 Devin,还公开认可它是知识工作领域”第二好的模型”,仅次于 Claude。早期在 Code Arena 上的 web 开发测试里,它也稳稳排在 GPT-5.6 Sol 和 Claude Fable 附近。

质疑的一面集中在 Grok Bot 上。部分 X 用户觉得演示效果有挑选过的成分,担心真实场景没这么顺。还有人对”让 AI 登录你的账号干活”这件事本身有顾虑,怕的是权限给出去就收不回来。

多维评分

把前面聊的落成分数,这模型到底几斤几两。

维度 权重 星级 一句话解读
功能完整性 20% ⭐⭐⭐⭐☆ 智能体、编码、视觉都覆盖,单项不封顶
易用性 15% ⭐⭐⭐⭐⭐ API 即插即用,Cursor 一键接入
性能表现 15% ⭐⭐⭐⭐☆ AA 指数追平 GPT-5.6,DeepSWE 略落后
AI 能力 15% ⭐⭐⭐⭐☆ 长任务自检强,视觉产出偏保守
价格合理性 10% ⭐⭐⭐⭐⭐ $2/$6,前沿模型里的价格屠夫
生态集成 10% ⭐⭐⭐⭐☆ Cursor、OpenRouter、Devin 等都已接入
文档与支持 10% ⭐⭐⭐⭐☆ model card 和定价文档齐全
更新频率 5% ⭐⭐⭐⭐⭐ 一个月迭代一代,4.7 已在路上

综合评分:8.3 / 10

优点和槽点

优势

  • 价格碾压:$2/$6 的定价不到 GPT-5.6 Sol Max 的一半,长任务跑量成本优势巨大
  • 长任务稳定性:自我校验和多步坚持能力比 Grok 4.5 有质的提升
  • 生态到位:发布当天就进了 Cursor、OpenRouter、Vercel、Cloudflare、Devin 一堆平台

不足

  • 纯编码峰值不够:DeepSWE 落后 GPT-5.6 Sol Max 和 Fable 5 Max 一档
  • 视觉产出偏保守:交互项目第一版常需再推一把才出彩
  • 版本寿命短:一个月一更,4.7 已在训练,刚适配完可能又要换

适合谁用

聊完分数和价格,再看你到底属不属于它的目标用户。

  • 跑长任务的开发者:需要模型自己调研、改多文件代码、迭代多轮的场景,价格优势最大
  • 预算敏感团队:想把前沿模型用在量大但单价敏感的工作流上,它是最划算的选择
  • 做原型验证的人:从想法快速起一个能看能跑的视觉原型,第一遍结构就能用
  • 不太适合的人:只追最强编码峰值、愿意为单项能力付高价的重度用户,GPT-5.6 Sol Max 或 Fable 5 Max 更合适

多少钱

截至 2026 年 8 月官网显示,Grok 4.6 采用纯 API 按量计费,没有订阅档。

计费项 短上下文(<200K) 长上下文(200K-500K)
输入 $2 / 百万 token $4 / 百万 token
输出 $6 / 百万 token $12 / 百万 token
缓存输入 $0.50 / 百万 $1.00 / 百万

另外还有个高速版(fast variant),价格是标准版的两倍,适合对延迟敏感的场景。首发第一周,Cursor 和 Grok Build 有 2 倍用量额度,是白嫖试跑的好窗口。

这个定价放在前沿模型里属于中档偏下,输出价只有 GPT-5.6 Sol Max 的五分之一。长任务最烧的就是输出 token,所以跑智能体工作流时它的成本优势会被进一步放大。

拿真实场景算笔账:跑一轮 AA-Briefcase 级别的长时知识工作,Grok 4.6 平均约 53 轮交互、5 亿输入 token,而 Claude Opus 5 Max 要约 103 轮、20 亿 token。单就这条工作流,前者的 token 成本能压到后者的四分之一左右。

常见问题

正文没讲透的,这里挑几个最常被问的一次说清。

Q1:Grok 4.6 多少钱?

A1:输入 $2、输出 $6 每百万 token。 这是 2026 年 8 月官网标准版短上下文定价,长上下文翻倍,高速版再翻一倍。


Q2:支持中文吗?

A2:支持,但中文长任务体验略弱于英文。 模型是多语言的,不过训练数据和基准都偏英文,中文复杂任务建议先小规模验证。


Q3:上下文窗口多大?

A3:50 万 token。 支持文本和图片输入,输出为纯文本,没有硬性输出 token 上限。


Q4:在哪里能用 Grok 4.6?

A4:Cursor、Grok Build、xAI API、OpenRouter、Vercel、Cloudflare、OpenCode、Devin 均已上线。 普通用户最省事的路子是 Cursor 或 Grok Build。


Q5:和 Grok 4.5 比提升多少?

A5:AA 智能指数从 56 提到 61,DeepSWE 从 54% 跳到 65.9%。 长任务稳定性和自我校验是提升最明显的两块。


Q6:能商用吗?版权归谁?

A6:API 输出可商用,具体条款以官方服务协议为准。 企业大规模部署建议先过一遍合规和 SLA 条款。


Q7:适合做什么,不适合做什么?

A7:适合长时智能体和跑量任务,不适合追最强编码峰值。 要单项最硬的能力,GPT-5.6 Sol Max 和 Fable 5 Max 仍压它一头。


Q8:Grok 4.7 什么时候来?

A8:官方透露 3 到 4 周后,已在训练。 据马斯克在 X 上的说法,4.7 比 4.6 强不少,正在补 SpaceX 数据。


Q9:Grok Bot 和 Grok 4.6 什么关系?

A9:Grok Bot 是跑在 Grok 4.6 上的智能体产品。 它是独立的 AI 队友产品,自带云电脑,目前随 SuperGrok Heavy、Cursor Ultra 等订阅开放测试。


Q10:有免费额度吗?

A10:首发第一周 Cursor 和 Grok Build 有 2 倍用量额度。 这是限时促销,不是长期免费额度,过了窗口期按正常 API 计费。


结论

Grok 4.6 是 2026 年性价比最高的长任务大模型,没有之一。它没有在单个基准上封神,却用不到对手一半的价格,把长时智能体能力拉到了第一梯队,这才是它真正值钱的地方。

如果你的痛点是”让模型自己把活干完、别总来烦我”,它值得立刻上手试,尤其是首发这一周的 2 倍额度窗口。但如果你的场景是”只追最强编码峰值、钱不是问题”,那 GPT-5.6 Sol Max 或 Fable 5 Max 依然是更硬的选择。

一句话:量大、任务长、在意成本,选 Grok 4.6;要单项极限,往上加钱。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!