英伟达发布开源大模型Nemotron 3 Super

DeepSeek 峰谷调价 + OpenCode Go 额度收缩:这笔账该重算了

DeepSeek · OpenCode · 成本优化阅读时间:6 分钟发表时间:2026.08.20
DeepSeek 峰谷调价 + OpenCode Go 额度收缩:这笔账该重算了

DeepSeek 峰谷调价 + OpenCode Go 额度收缩:这笔账该重算了

本站为独立第三方技术服务平台,提供多模型 API 聚合接入服务,与 Anthropic、OpenAI、Google 等模型提供商无任何关联、授权或合作关系。

核心要点

  • DeepSeek 于 8 月 13 日晚发布调价公告,新价格自 2026 年 8 月 17 日 00:00(北京时间)起生效,同时启用峰谷定价:高峰时段为 9:00–12:00、14:00–18:00,空闲时段价格为高峰的一半。
  • 按公开公告,DeepSeek-V4 Pro 高峰时段为 0.3 / 9 / 27 元每百万 Token(缓存命中输入 / 缓存未命中输入 / 输出),V4 Flash 高峰为 0.10 / 3 / 9 元;空闲时段各减半。
  • 涨幅最猛的是缓存命中输入——原来靠"缓存极便宜"摊薄成本的架构,收益被明显削弱。
  • 几乎同一时间,OpenCode Go 套餐下调了 DeepSeek V4 Flash 的额度折算(社区反馈从 60 美元档降至 15 美元档,此前的双倍活动结束),具体以其文档与控制台为准。
  • 对开发者的实际结论只有一句:Agent / 批量场景的单位成本模型需要重新建一遍,不必恐慌切换,但也别再用旧算法估算下个月账单。

详细解读

一、峰谷定价不是"打折的反面",是结构变了

DeepSeek 过去一年的定价节奏,是从 2025 年 2 月的夜间错峰优惠,走到 2026 年 5 月把 V4 Pro 的深度折扣长期化,再到这次全系列正式版落地峰谷定价。

真正值得注意的不是"贵了多少倍"这个头条数字,而是三类 Token 的比例被重排了:缓存输入 : 输入 : 输出 大致拉到了 1 : 30 : 90。

这意味着两类项目受影响完全不同:

  • 长上下文 + 高缓存命中的 Agent 项目:以前把巨大的系统提示词和代码库上下文塞进缓存,边际成本近乎忽略。现在缓存命中输入的涨幅是全场最大的,这套架构的性价比明显回落。
  • 短请求、输出为主的对话类项目:输出价上调同样直接,但总量小的话,绝对值增加有限。

有开发者按 Agentic Coding 的典型 Token 结构折算,平均每百万 Token 的综合价格 Pro 约涨到原来的 3 倍出头、Flash 约 2 倍多,叠加高峰时段还要再翻一番。这个量级足以改变一个产品的毛利模型。

二、套餐制额度的定义权,不在你手上

OpenCode Go 的额度是按"美元价值"定义的:给你一个额度池,能跑多少次请求取决于模型单价。模型单价一变,同样的额度对应的请求数就跟着变——这次 V4 Flash 的调整正是这个机制的自然结果,而不是什么突发操作。

但对使用者来说,体感是实打实的:按社区折算,同一份订阅能跑的 V4 Flash 请求数缩水了近九成,此前趁双倍活动排的批量任务计划基本要重排。

这里有个更普适的教训:任何"按套餐买额度"的模式,额度与单价的换算关系都由服务方定义,且会随上游价格调整。它不一定是坏事——量大且稳定的人依然能吃到规模红利——但它不适合作为唯一的成本底座,尤其当你的用量是波动的、或者你根本用不满。

对开发者意味着什么

几条可以马上做的事:

1. 先算账,再谈换不换。 把过去 30 天的调用日志拉出来,按"缓存命中输入 / 未命中输入 / 输出"三类分别统计 Token 量,再套新价格表算一遍。很多人凭感觉觉得"涨了 3 倍",实际因为输出占比低,可能只涨了不到一倍;也有人相反。

2. 把能错峰的任务挪走。 数据清洗、批量打标、离线评测、文档摘要这类不看实时性的任务,排到空闲时段跑,直接省一半。给任务队列加个"仅在空闲窗口出队"的开关,成本不高。

3. 重新评估缓存策略。 缓存依然有用,只是不再"几乎免费"。检查一下有没有为了命中缓存而刻意塞进去的冗余上下文——以前无所谓,现在是真金白银。

4. 别把宝押在单一模型或单一计费模式上。 这次的连锁反应说明得很清楚:上游一动价,下游所有按其单价折算额度的套餐都会跟着动。让业务能在多个模型之间平滑切换,本身就是一种成本对冲。

在 Code0 上如何做多模型分流

Code0 是多模型聚合 API 网关——一个 Key 接入 300+ 主流模型,覆盖 Claude、GPT、Gemini、DeepSeek、Kimi、Qwen、Grok 等,兼容 OpenAI SDK,切换模型只改 model 字段,业务代码零改造。

对上面第 4 条的落地方式,通常是这样:把任务按"难度 / 时延要求"分档,贵模型只用在真正需要的环节。

from openai import OpenAI

client = OpenAI(
    base_url="https://hk.code0.ai/v1",
    api_key="sk-你的Key",  # 在 console.code0.ai 获取
)

# 按任务难度分档路由:改 model 字段即可,其余代码不动
ROUTE = {
    "轻量": "deepseek-v4-flash",   # 分类、抽取、格式化
    "常规": "claude-sonnet-4-6",   # 日常对话、代码补全
    "硬活": "claude-opus-4-8",     # 复杂推理、长链路 Agent
}

def ask(level: str, prompt: str) -> str:
    resp = client.chat.completions.create(
        model=ROUTE[level],
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

print(ask("轻量", "把这段日志里的错误码提取成 JSON"))
print(ask("硬活", "分析这个模块的并发缺陷并给出修复方案"))

换成 gpt-5.4gemini-3-pro 也是同一行改动。想跑 A/B 对照,把同一个 prompt 发给两个 model 比一比即可,不用维护两套 SDK、两套鉴权。

Code0 采用按量即用、失败不计费的计费方式,不需要预先购买套餐额度,也就不存在"额度换算比例被调整"这类问题;各模型的具体计费以 console.code0.ai 控制台展示为准。实际降本效果因业务的 Token 结构而异,建议先用真实流量小规模跑一周对比。

总结

这次调价和额度调整放在一起看,信号是一致的:国内大模型行业正在从激进的价格战,回到更贴近算力成本的定价框架。低价不会永远是默认选项,这对整个生态未必是坏事,但确实意味着"随便调、不算账"的窗口期过去了。

短期该做的是错峰 + 重算缓存收益;中期该做的,是让自己的系统不被任何单一模型、单一计费模式绑死。