英伟达发布开源大模型Nemotron 3 Super›

Grok 4.5 发布:不拼榜单拼价格,这场性价比战怎么打给开发者看

Grok · Grok4.5阅读时间:7 分钟发表时间:2026.07.09
Grok 4.5 发布:不拼榜单拼价格,这场性价比战怎么打给开发者看

Grok 4.5 发布:不拼榜单拼价格,这场性价比战怎么打给开发者看

本站为独立第三方技术服务平台,提供多模型 API 聚合接入服务,与 Anthropic、OpenAI、Google、xAI 等模型提供商无任何关联、授权或合作关系。

核心要点

  • SpaceXAI 于 2026-07-08 发布 Grok 4.5,自述是「首个专为编程与 Agent 训练」的模型,并与 Cursor 联合训练、发布当天进入 Cursor 全部套餐。
  • 它没有在榜单上登顶——厂商自报的编程基准是混合结果:SWE-Bench Pro 落后于 Opus 4.8 和 Fable,SWE Marathon pass@1 又略微领先。
  • 真正的差异化是价格与速度:据媒体报道标准版输入约 2 美元、输出约 6 美元 / 百万 token(价格以 xAI 官网为准)。
  • 对开发者的现实意义不是「换不换最强」,而是「成本敏感的长跑型 Agent 任务,值不值得拉它进来 A/B」。

详细解读

先看清:它不是「最强」,是「够强且便宜」

新模型一出,大家习惯先翻榜单看它有没有把别人摁在地上。这次翻完你可能会有点困惑——因为它并没有。

把厂商自己放出来的编程基准摆一起:SWE-Bench Pro 上 Grok 4.5 报 64.7%,落后于 Opus 4.8(max)的 69.2% 和 Fable(max)的 80.4%;但换到 SWE Marathon 的 pass@1,它又以 29.0% 反超(Opus 4.8 max 26.0%、Fable max 24.0%)。一句话:有的题赢、有的题输,混在第一梯队但没冒尖。

而且这些数字全是厂商自测,截至发稿(2026-07-09)没有独立第三方复现。所以「Opus-class 但更快更便宜」这类说法,当厂商开场白听就好,别当结论记。

真正的杀招:价格 + 分发管道

如果故事只停在基准,它顶多算「又一个还行的编程模型」。它的两个真招在别处。

一是价格。 多家媒体报道其标准版定价为输入约 2 美元、输出约 6 美元 / 百万 token,另有一档更快的「极速版」约 4 / 18 美元(数据来自二手报道,具体以 xAI 官网公布为准)。在「性能没拉开、价格明显更低」的组合下,一个天天跑 Agent、动辄几十步工具调用的团队,单价便宜一截,比基准高两个点实在得多。

二是分发。 它和 Cursor 联合训练,发布当天直接进 Cursor 全部套餐。Cursor 过去的立身之本是「中立路由」——Claude、GPT、Gemini 随你挑;现在一个模型厂商把这条对所有人一视同仁的管道变成了自己的主场。对开发者是「打开 Cursor 就能试」,对市场则是把「用户就在我的 IDE 里」直接变现。

参数与部署(均为厂商说法,待核验)

厂商侧还放出了几个数字:上下文号称 50 万 token、V9 基座约 1.5 万亿参数、数万张 GB300 训练。可用渠道包括 Grok Build、Cursor 全套餐与官方控制台,欧盟据称要等到 7 月中旬。这些均为厂商自述或媒体转述,接入前建议以官方文档为准。

对开发者意味着什么

抛开「谁最强」的口水,Grok 4.5 其实是一道选型算术题,答案分三种人:

  • 在 Cursor 里写代码、任务偏长跑、对成本敏感:值得认真做 A/B。便宜、快、上下文大,正好卡在痛点上——但别信它的基准,信你自己流水线上跑出来的结果。
  • 追求单项最强、要把每个 benchmark 压到天花板:它现在不是你的菜,法律金融那些「第一」是官方自报,独立评测未出。
  • 在欧盟:暂时得等。

它把竞争从「谁分数高」挪到了「谁更便宜、谁离用户更近」。这对追顶配的人没吸引力,但对每天要为 token 账单心疼一下的人,值得花半天在真实任务上跑一遍再决定。

在 Code0 上如何做这场 A/B

上面反复说「别信基准,跑自己的活」。问题是:要在同一套代码里横向比 Grok 4.5、Opus 4.8、Fable、GPT,通常得申请好几个 Key、对接好几套 SDK。

Code0 是一个多模型聚合网关——一个 Key 接入 300+ 主流模型,且兼容 OpenAI SDK。你只需改一行 base_url,然后循环里换 model 字段,就能把几家模型拉到同一条流水线上,用同一批任务、同一套评分跑 A/B:

from openai import OpenAI

client = OpenAI(
    base_url="https://hk.code0.ai/v1",
    api_key="sk-你的Key",  # 在 console.code0.ai 获取
)

# 同一个任务,横向比几家模型——真正的选型该这么做
task = "把这段 Python 重构成异步版本,并解释每处改动。\n\n<贴你的真实代码>"

for model in ["grok-4-5", "claude-opus-4-8", "claude-fable-5", "gpt-5.4"]:
    resp = client.chat.completions.create(
        model=model,  # 具体模型 ID 以控制台为准
        messages=[{"role": "user", "content": task}],
    )
    print(f"===== {model} =====")
    print(resp.choices[0].message.content, "\n")

代码一行不用改,只在列表里加减模型名,就能把「哪家在我的任务上更划算」这件事,从看厂商 PPT 变成看自己的实测输出。Code0 按量即用、失败不计费,各模型的可用性与计价以 https://console.code0.ai 控制台为准。

总结

Grok 4.5 的意义不在于它有多强,而在于它把战场推向了性价比。对开发者来说,最理性的应对不是急着站队「最强」或「最便宜」,而是把候选模型放进同一条真实流水线里跑一遍——而这,恰好是一个 Key 通多模的场景该干的事。