Grok 4.7 vs Claude Fable 5
还没有 4.7 计分板
搜索需求是真的,4.7 赢 Fable 5 的表是假的。本页吃这个词,展示 4.6 代理数据,并标明哪些仍是传闻。
站得住的计分板
尚无同源对比
xAI 没有公布 Grok 4.7 基准。任何「4.7 击败 Fable 5」都是猜测。
活代理:4.6 vs Fable 5
Grok 4.6 官方表:AA 智指 61 vs Fable 5 Max 62。
DeepSWE v1.1
Grok 4.6 65.9% vs Fable 5 Max 70%。编码仍略偏 Fable。
4.7 的卖点
Musk:2.1T,除略慢外强于 4.6,token 更省。不是模型卡。
为什么对上这个搜索
Fable 5 是 Anthropic 高端叙事。Grok 4.6 的 AA 只低一分。人们默认 4.7 更大预训练会追平或翻盘。在权重和评测出来前,诚实的页就是追踪 + 4.6 代理表。
圈子在吵什么
一派认为 2.1T 加 SpaceX 数据会在长程 agent 上越过 Fable。另一派指出 4.6 的 DeepSWE 和 TB v3.0 仍落后,小幅预训练未必翻编码。两边都没有 4.7 数字。
这个词的时间线
4.6 与 4.7 一起预告;4.7 被说成 2.1T。
Grok 4.6 带着对 Fable 5 Max 的公开表发布——今天唯一公平的数。
仍无 4.7 卡。这个 URL 是给搜索的,不是假评测。
已知 vs 未知
已知(表里只用这些)
由于 4.7 尚未发布,这里用 Grok 4.6 作代理,数据取自 4.6 官方发布表(对 Fable 5 Max):Artificial Analysis 指数 61 对 62;GDPVal-AA 1753 对 1741;CursorBench 69.9% 对 70.5%;DeepSWE 65.9% 对 70%;FrontierCode 61.3% 对 63.6%;Terminal-Bench v3.0 26% 对 34.1%。这里的 TB 是 v3.0,与 DeepSeek 系列使用的 TB 2.1 不是同一量表。
未知(4.7 那一行先空着)
Grok 4.7 的价格、上下文、AA、DeepSWE,以及任何对 Fable 5 的对位。那些数字一出现就把本页改成真对比。
4.7 出来前怎么选
现在就要 Fable 级判断
留在 Claude Fable 5 / Opus 5。活表上编码仍略偏 Fable。
现在就要更便宜的邻近前沿
Grok 一边请用已上线的 4.6($2/$6),不是 4.7。
4.7 真发了怎么改
本页目前用 Grok 4.6 的真实数据作代理行。等 xAI 发布 4.7 的官方模型卡与评测后,代理行会替换成 4.7 的官方数字,Fable 5 Max 与 w/ fallback 的标注保持不变。在那之前,4.6 的分数不会被写在 4.7 的标题下。
在 QCode 上
Grok 4.7 尚未发布。QCode 目前也没有接入 Grok 系列,但 /models 目录里列有 claude-fable-5,可以直接使用本页对比中的 Claude 一方。
Grok 4.7 vs Fable 5 常见问题
Grok 4.7 赢了 Fable 5 吗?
没人知道。截至 2026-08-14,Grok 4.7 没有公开基准。
那为什么做这页?
精确搜索词已经在涨。诚实追踪比迟到的评测更能占位——前提是拒绝假分数。
最接近的真对比是什么?
Grok 4.6 vs Fable 5 Max 的官方表。编码多数行 Fable 略高;AA 是 62 vs 61。
2.1T 就会自动赢 Fable 5?
参数量不是基准。4.6 已经说明价格和回合效率可以跟 AA 的一分同样重要。
该为 4.7 推迟 Fable 5 的项目吗?
不建议。用 Claude Fable 5 或 Grok 4.6 先把东西交付出去。等 4.7 有了官方模型卡和同源评测,再决定要不要复测迁移。
TB v3.0 和 TB 2.1 能一列吗?
不能。Grok 官方发布表用的是 Terminal-Bench v3.0,DeepSeek 的表用的是 2.1,两者不是同一量表,放进同一列会得出错误结论。
来源
来源:x.ai/news/grok-4-6 的官方评测表;2026 年 7 月媒体报道转述的创始人发言;Anthropic 官方定价页的 Claude Fable 5 价格。截至 2026-08-14,Grok 4.7 尚无官方模型卡或基准成绩。
相关阅读
与 SpaceXAI、Anthropic 无隶属。不声称任何 Grok 4.7 分数。