刚刚,Grok 4.6 发布!性能追平 GPT-5.6 Sol,马斯克这次支棱起来了
(来源:AI信息Gap)
马斯克的 SpaceXAI,支棱起来了。
Grok 4.6,几小时前刚刚发布,纸面性能几乎追平 GPT-5.6 Sol,价格只有 Sol 的三分之一。
划重点,Cursor 和 Grok Build 用户这周 Grok 4.6 额度翻倍。
SpaceXAI 7 月 8 日才发布 Grok 4.5,一个月多点,4.6 又来了。不得不说,老马的钞能力再加上 Cursor 的数据,有点东西。

Grok 4.6 模型综合智能指数 61 分,和 GPT-5.6 Sol 打平,而 Anthropic 的 Claude Fable 5 只领先 1 分(62),相比上一代 Grok 4.5(56)一口气狂涨 5 分。
这个榜单来自第三方独立评测机构 Artificial Analysis,Grok 4.6 目前和 GPT-5.6 Sol 并列第三,Kimi K3(60)第四名。

开头提到 Grok 4.6 是纸面战神,来带你们看看它的基准测试成绩。
已公布的 10 项评测里,Grok 4.6 拿了 3 个单项第一,分别是 GDPVal-AA 1753 分(Claude Fable 5 是 1741),AA-Briefcase 1577 分(这项测的是长时间的智能体知识任务,比如调研、写报告、分析数据),法律评测 Harvey LAB 15.8%。
Harvey LAB,Grok 4.6 尤其猛。Harvey 是一家做法律 AI 的公司,这个评测专门测试模型处理法律文书和合同分析的能力。Grok 4.6 15.8%,GPT-5.6 Sol 仅得 2.5%,相差六倍多。
编程 DeepSWE 和 Terminal-Bench Grok 4.6 还差一截,分别得分 65.9% 和 26%,GPT-5.6 Sol 是 73% 和 34.6%。

除去性能,最有看点的必须是 Grok 4.6 的价格了。
Grok 4.6 API 每百万输入 tokens 2 美元,每百万输出 tokens 6 美元,这个定价放在顶级模型里属于白菜价了。甚至比源神 Kimi K3 的价格还要低不少。
作为对比,Claude Opus 5 输入 5 美元、输出 25 美元;GPT-5.6 Sol 输入 5 美元、输出 30 美元;Claude Fable 5 更贵,输入 10 美元、输出 50 美元。最贵的比 Grok 4.6 贵了八倍。
Cursor CEO Michael Truell 给 Grok 4.6 这样定调,「Opus 级别的智商,但成本极低,速度极快。」Artificial Analysis 的实际测算也印证了这一点,Grok 4.6 完成一个任务平均花费 0.84 美元,和 Kimi K3 持平,但智能指数更高。

马斯克转发了投资人 Gavin Baker 的对比图,自豪地称赞 Grok 4.6 又一次站在了帕累托前沿。
帕累托前沿:在性能和成本两个维度上,找不到比它更优的选择了。要么比它差,要么比它贵,不存在又便宜又强的替代品。

那么,Grok 4.6 怎么用?
最简单的方法,打开 Cursor,在模型列表里切换到 Grok 4.6,今天已经上线了。

SpaceXAI 自家的编程 Agent Grok Build 也同步支持了 Grok 4.6。Grok Build 是一个在终端里运行的 AI 编程工具,代码在本地运行不上传服务器,支持多个智能体并行处理任务,可以简单理解为马斯克版本的 Claude Code 或 Codex。
遗憾的是,不论是 Cursor 还是 Grok 订阅,额度都有点捉襟见肘。

这个 100 美元/月的新订阅目前还只是占位符,点进去还是 300 美元/月的 SuperGrok Heavy。
Grok 4.6 的 API 也已经开放,合作伙伴包括 OpenRouter、Vercel 和 Cloudflare。还有一个快速版本,价格翻倍(每百万 tokens 输入 4 美元,输出 12 美元),响应速度更快。

Grok 4.6 目前有一个首周活动。从今天开始一周内,在 Cursor 和 Grok Build 里使用 Grok 4.6,额度翻倍。

Grok 4.6 的参数量和 Grok 4.5 一样,都是 1.5 万亿,提升全靠模型训练方法的改进。SpaceXAI 用 Grok 4.5 重新生成了训练数据,再加上覆盖编程、网页开发、CAD 等领域的智能体强化学习,训练用的是英伟达 GB300 NVL72,上下文窗口保持 50 万 tokens 不变。
Grok 4.6 处理复杂任务时会自己回头检查,完成验证再继续。
在 Artificial Analysis 测试的 AA-Briefcase 知识工作任务中,Grok 4.6 平均 53 轮对话就能完成,Claude Opus 5 要 103 轮,输入 tokens 用量 5 亿 vs 20 亿。
网友热评,「SpaceXAI 想让模型一次性把活儿干完,调研、写代码、调用工具,不用你盯着,它自己交付。」
同一天,DeepSeek 也迎来了更新。V4-Pro 正式版上线,增强了智能体能力,DeepSWE 评测成绩超过 Claude Opus 4.8。
据说,2.1 万亿参数的 Grok 4.7 也已经在路上了。
相关推荐
刚刚,Grok 4.6 发布!性能追平 GPT-5.6 Sol,马斯克这次支棱起来了
GPT-5.6上线,马斯克奥尔特曼又掐起来了
全球AI巨头集体调头:大模型的价格战结束了
刚刚,ChatGPT免费版史诗升级!GPT-5.6可以无限白嫖了
GPT-5.6刚发布,OpenAI安全主管就跑路了??
AI开始给自己写代码了,GPT-5.6重写内核,服务成本直降20%
OpenAI公布GPT-5.6自进化秘籍!翁荔被曝回归
马斯克发布Grok 4.5:对标Opus级,Token效率翻倍成本大降
马斯克宣布将开源Grok 2模型
K3发布48小时,服务器满载、英伟达暴跌、Anthropic连夜改订阅
网址: 刚刚,Grok 4.6 发布!性能追平 GPT-5.6 Sol,马斯克这次支棱起来了 https://www.xishuta.cn/newsview152495.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
