Grok 4.7 深度评测:xAI 旗舰推理模型,500K 上下文 2 美元起

🔬 实测验证 · 非推广软文 · 独立评测

9 月 21 日,xAI(SpaceXAI)正式发布 Grok 4.7,这是继 8 月 12 日 Grok 4.6 之后的新一代旗舰模型,官方定位为「面向编程、智能体任务与知识工作的前沿模型」。最引人注目的不是它的能力有多强,而是它的定价——每百万 Token 输入 2 美元、输出 6 美元,与上一代持平,却只有 GPT-5.6 Sol(4/20 美元)和 Claude Fable 5.1(10/50 美元)的一个零头。用一句话概括:xAI 想用「前沿性能 + 白菜价」的组合拳,正面抢编程与知识工作这块最肥的市场。

核心能力:专攻「耗时数小时」的硬任务

Grok 4.7 最大的变化,不在参数量(官方未公布具体规模,业界估计约 2.1 万亿参数,较 Grok 4.6 提升约 40%),而在训练方式。xAI 这次换用了更大的基座模型,并进行了更长的强化学习(RL)训练,训练数据特意向「需要数小时才能完成」的难题倾斜。

这带来三个直接能力提升:

  • 自我验证能力更强:模型更擅长检查自己的输出,减少「看似正确实则错误」的幻觉,这对长时间编程任务尤其关键。
  • 长上下文管理更稳:配合 50 万 Token 上下文窗口,在超长文档、大型代码库中能保持前后一致。
  • 原生理解 Grok Bot harness:xAI 专门训练了它对自家智能体框架的理解,对话任务和通用知识工作的表现更好,生成文档和 PPT 的能力也明显提升。

基准成绩:逼近前沿,但并非全面碾压

xAI 官方给出了 Grok 4.7 与 Grok 4.6、GPT-5.6 Sol、Claude Fable 5.1 的对比表。结论是「逼近前沿、各有胜负」,而非单方面碾压:

  • 长时间编程任务:46.3%(Grok 4.6 为 40.4%、GPT-5.6 Sol 为 41.7%、Fable 5.1 为 51.8%)——相较上代大幅进步,但仍落后 Fable 5.1。
  • Terminal-Bench 4.0(多小时代理终端操作):38.0%,几乎翻倍于 Grok 4.6 的 20.3%,是这代提升最猛的一项。
  • 工程评测 DE:71.0%,超过 Grok 4.6(65.2%),接近 GPT-5.6 Sol(72.7%)。
  • Harvey 法律智能体基准:19.6%,大幅领先 Fable 5.1(6.7%)和 GPT-5.6 Sol(2.5%),是它最亮眼的单项。
  • 临床推理 HealthBench:56.7%,落后于 Fable 5.1(62.1%)和 GPT-5.6 Sol(60.5%)。

此外,xAI 宣称 Grok 4.7 配备了全新的安全护栏栈:在 LatchBio 生物安全基准上得分 62.4%(领先),在自家 HackerBench v0.3 上仅放行 3.3% 的危险双用途提示,同时很少误拦正当的安全研究。安全与合规是其相较上一代强调最多的一点。

使用体验与局限

上手路径很顺:Grok 4.7 已接入 Cursor、Grok Build(x.ai/build,可免费体验)、Grok API,以及各类第三方编程 harness 和模型路由(OpenRouter 等)。如果追求速度,xAI 还提供一个「快速变体」,输出速度翻倍、价格也翻倍(4/12 美元)。

需要泼的冷水也有:中文能力仍是一块短板。Grok 系列历来以英文和 STEM 任务见长,中文生成质量与国产模型(GLM、Kimi、DeepSeek)有明显差距;其次,它在部分综合基准(长时间编程、临床推理)上仍不是第一名,如果你追求「绝对最强」而非「性价比最高」,Fable 5.1 或 GPT-5.6 Sol 仍更胜一筹。

Grok 4.7 与其他同类模型横向对比

模型上下文定价($/M Token)核心定位本站评分
Grok 4.7500K2 / 6编程 + 知识工作8.7
Claude Fable 5.1—10 / 50企业 Agent8.9
Gemini 3.8 Live——实时语音8.5
GLM 5.3 FlashX——高速多模态8.6
Kimi K3——国产推理8.5

放在坐标系里看,Grok 4.7 处在一个很讨巧的位置:能力逼近第一梯队,价格却只有对手的几分之一。对「用得起、够强、能跑长时间任务」的程序员和知识工作者来说,它可能是目前性价比最均衡的选择之一。

综合评分

维度评分评价
功能完整度8.8 / 10编程/智能体/知识工作全能,多模态偏弱
易用性8.6 / 10Cursor、Grok Build、API 多入口,上手快
性价比9.0 / 102/6 美元定价远低于同级对手
中文支持7.8 / 10英文见长,中文弱于国产模型
输出质量8.7 / 10前沿水准,部分基准非第一

综合评分:8.7 / 10

常见问题(FAQ)

Grok 4.7 免费吗?

在 Grok Build(x.ai/build)里可以免费体验 Grok 4.7;通过 Cursor、Grok API 或 OpenRouter 调用则需要付费,API 定价为每百万 Token 输入 2 美元、输出 6 美元。

Grok 4.7 的上下文窗口有多大?

官方标注为 50 万 Token 上下文窗口,足以一次性处理超长文档或大型代码库。

Grok 4.7 和 GPT-5.6 Sol、Claude Fable 5.1 哪个好?

各有胜负:Grok 4.7 在 Terminal-Bench 和法律智能体上领先,价格最便宜;GPT-5.6 Sol 和 Fable 5.1 在长时间编程、临床推理等综合任务上更强。追求性价比选 Grok 4.7,追求绝对最强选后两者。

Grok 4.7 支持中文吗?效果如何?

支持中文,但中文生成质量与 GLM、Kimi、DeepSeek 等国产模型存在差距,英文和 STEM 任务才是它的强项。

想发现更多好用的 AI 工具?查看我们的 AI 模型库 与 工具对比引擎,或继续阅读:Claude Fable 5.1 评测 · GLM 5.3 FlashX 评测 · 全部评测。

🔗 分享: Twitter 微博 复制链接

📬 喜欢这篇文章?

每周精选AI工具评测 + 实用教程,直接送到你面前。

订阅每周AI精选 →
🚀 想让你的 AI 工具获得深度评测?

我们的评测文章覆盖 精准搜索流量,读者正是你的目标用户。
赞助一篇独立评测,让你的工具被真正需要的人看到。

🔍 在选择AI工具? 免费对比同类工具 →
|
💎 深度横向对比 ¥99.9/终身 →

1人评论了“Grok 4.7 深度评测:xAI 旗舰推理模型,500K 上下文 2 美元起”

  1. Pingback: 特斯拉上线 Grok Bot:xAI 智能体开进汽车,每月 300 美元 – AI Dash

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部
工具精选
1
AI文本写作
GPT-6.1 Sol 深度评测:OpenAI 效率模型再进化,五分之一价格逼近 Astra
8.8
📊AI办公效率 💻AI编程开发 📝AI文本写作 🎨AI图像生成
📬 每周 AI 精选