9 月 21 日,xAI(SpaceXAI)正式发布 Grok 4.7,这是继 8 月 12 日 Grok 4.6 之后的新一代旗舰模型,官方定位为「面向编程、智能体任务与知识工作的前沿模型」。最引人注目的不是它的能力有多强,而是它的定价——每百万 Token 输入 2 美元、输出 6 美元,与上一代持平,却只有 GPT-5.6 Sol(4/20 美元)和 Claude Fable 5.1(10/50 美元)的一个零头。用一句话概括:xAI 想用「前沿性能 + 白菜价」的组合拳,正面抢编程与知识工作这块最肥的市场。
核心能力:专攻「耗时数小时」的硬任务
Grok 4.7 最大的变化,不在参数量(官方未公布具体规模,业界估计约 2.1 万亿参数,较 Grok 4.6 提升约 40%),而在训练方式。xAI 这次换用了更大的基座模型,并进行了更长的强化学习(RL)训练,训练数据特意向「需要数小时才能完成」的难题倾斜。
这带来三个直接能力提升:
- 自我验证能力更强:模型更擅长检查自己的输出,减少「看似正确实则错误」的幻觉,这对长时间编程任务尤其关键。
- 长上下文管理更稳:配合 50 万 Token 上下文窗口,在超长文档、大型代码库中能保持前后一致。
- 原生理解 Grok Bot harness:xAI 专门训练了它对自家智能体框架的理解,对话任务和通用知识工作的表现更好,生成文档和 PPT 的能力也明显提升。
基准成绩:逼近前沿,但并非全面碾压
xAI 官方给出了 Grok 4.7 与 Grok 4.6、GPT-5.6 Sol、Claude Fable 5.1 的对比表。结论是「逼近前沿、各有胜负」,而非单方面碾压:
- 长时间编程任务:46.3%(Grok 4.6 为 40.4%、GPT-5.6 Sol 为 41.7%、Fable 5.1 为 51.8%)——相较上代大幅进步,但仍落后 Fable 5.1。
- Terminal-Bench 4.0(多小时代理终端操作):38.0%,几乎翻倍于 Grok 4.6 的 20.3%,是这代提升最猛的一项。
- 工程评测 DE:71.0%,超过 Grok 4.6(65.2%),接近 GPT-5.6 Sol(72.7%)。
- Harvey 法律智能体基准:19.6%,大幅领先 Fable 5.1(6.7%)和 GPT-5.6 Sol(2.5%),是它最亮眼的单项。
- 临床推理 HealthBench:56.7%,落后于 Fable 5.1(62.1%)和 GPT-5.6 Sol(60.5%)。
此外,xAI 宣称 Grok 4.7 配备了全新的安全护栏栈:在 LatchBio 生物安全基准上得分 62.4%(领先),在自家 HackerBench v0.3 上仅放行 3.3% 的危险双用途提示,同时很少误拦正当的安全研究。安全与合规是其相较上一代强调最多的一点。
使用体验与局限
上手路径很顺:Grok 4.7 已接入 Cursor、Grok Build(x.ai/build,可免费体验)、Grok API,以及各类第三方编程 harness 和模型路由(OpenRouter 等)。如果追求速度,xAI 还提供一个「快速变体」,输出速度翻倍、价格也翻倍(4/12 美元)。
需要泼的冷水也有:中文能力仍是一块短板。Grok 系列历来以英文和 STEM 任务见长,中文生成质量与国产模型(GLM、Kimi、DeepSeek)有明显差距;其次,它在部分综合基准(长时间编程、临床推理)上仍不是第一名,如果你追求「绝对最强」而非「性价比最高」,Fable 5.1 或 GPT-5.6 Sol 仍更胜一筹。
Grok 4.7 与其他同类模型横向对比
| 模型 | 上下文 | 定价($/M Token) | 核心定位 | 本站评分 |
|---|---|---|---|---|
| Grok 4.7 | 500K | 2 / 6 | 编程 + 知识工作 | 8.7 |
| Claude Fable 5.1 | — | 10 / 50 | 企业 Agent | 8.9 |
| Gemini 3.8 Live | — | — | 实时语音 | 8.5 |
| GLM 5.3 FlashX | — | — | 高速多模态 | 8.6 |
| Kimi K3 | — | — | 国产推理 | 8.5 |
放在坐标系里看,Grok 4.7 处在一个很讨巧的位置:能力逼近第一梯队,价格却只有对手的几分之一。对「用得起、够强、能跑长时间任务」的程序员和知识工作者来说,它可能是目前性价比最均衡的选择之一。
综合评分
| 维度 | 评分 | 评价 |
|---|---|---|
| 功能完整度 | 8.8 / 10 | 编程/智能体/知识工作全能,多模态偏弱 |
| 易用性 | 8.6 / 10 | Cursor、Grok Build、API 多入口,上手快 |
| 性价比 | 9.0 / 10 | 2/6 美元定价远低于同级对手 |
| 中文支持 | 7.8 / 10 | 英文见长,中文弱于国产模型 |
| 输出质量 | 8.7 / 10 | 前沿水准,部分基准非第一 |
综合评分:8.7 / 10
常见问题(FAQ)
Grok 4.7 免费吗?
在 Grok Build(x.ai/build)里可以免费体验 Grok 4.7;通过 Cursor、Grok API 或 OpenRouter 调用则需要付费,API 定价为每百万 Token 输入 2 美元、输出 6 美元。
Grok 4.7 的上下文窗口有多大?
官方标注为 50 万 Token 上下文窗口,足以一次性处理超长文档或大型代码库。
Grok 4.7 和 GPT-5.6 Sol、Claude Fable 5.1 哪个好?
各有胜负:Grok 4.7 在 Terminal-Bench 和法律智能体上领先,价格最便宜;GPT-5.6 Sol 和 Fable 5.1 在长时间编程、临床推理等综合任务上更强。追求性价比选 Grok 4.7,追求绝对最强选后两者。
Grok 4.7 支持中文吗?效果如何?
支持中文,但中文生成质量与 GLM、Kimi、DeepSeek 等国产模型存在差距,英文和 STEM 任务才是它的强项。
想发现更多好用的 AI 工具?查看我们的 AI 模型库 与 工具对比引擎,或继续阅读:Claude Fable 5.1 评测 · GLM 5.3 FlashX 评测 · 全部评测。

Pingback: 特斯拉上线 Grok Bot:xAI 智能体开进汽车,每月 300 美元 – AI Dash