这次到底发生了什么
2026 年 4 月 25 日,DeepSeek 官方宣布,DeepSeek-V4-Pro API 在 2026 年 5 月 5 日 15:59 UTC 前限时 75% OFF。如果只是一次促销,这条消息未必值得单独写;更关键的是,官方把降价、1M context,以及 Claude Code、OpenCode、OpenClaw 的接入更新放在了同一条信息里。
这说明它在面向的,不只是普通聊天用户,而是已经在做 coding agent、长工作区、长链路工具调用的开发者和团队。官方给出的接入要求也很具体:Claude Code 需要把模型设为 deepseek-v4-pro[1m] 才能启用 1M context,OpenCode 需要升级到 v1.14.24+,OpenClaw 需要升级到 v2026.4.24+。
另一条来自第三方的推文进一步给出了一组更敏感的数据:在 1M context 下,V4-Pro 的每 token 计算量据称只有 DeepSeek-V3.2 的 27%,KV cache 只有其 10%。这不是官方技术文档,因此还需要谨慎对待,但它至少解释了为什么这次讨论会迅速从“模型能力”转向“部署经济性”。
为什么这次值得关心
长上下文过去一直有一个现实问题:不是不能做,而是太贵,贵到很多团队只能在 demo 或少量高价值任务里使用。真正卡住 agent 普及的,往往不是模型会不会读 100 万上下文,而是你能不能承担长期运行、并发承载、上下文驻留和显存占用的账。
如果上述第三方数据接近事实,影响会集中在几个非常具体的地方:
- 同样的 GPU 资源上,能承载更多并发用户
- 更长上下文不再只存在于“理论支持”,而可能进入默认配置
- 持久工作区、长会话 coding、跨多步工具调用的产品形态更容易成立
- serving 成本下降后,团队更有可能把长时 agent 从试验品推进到正式功能
真正重要的点不是“便宜了”,而是“长上下文 agent 到底跑不跑得起”第一次被推进了采购和架构决策层。对做基础设施的人,这和一次常规模型升级不是一回事。
真正该怎么判断
这里最容易出现的误解,是把“75% 折扣”直接等同于“已经是同类最优解”。现有材料还不能支持这个结论。
原因有三个:
- 输入材料没有给出折扣前后绝对价格,无法直接和其他模型横向比较
27%计算量与10%KV cache 来自第三方推文,不是当前材料里的官方文档- 现有信息没有覆盖质量、延迟、稳定性、失败率这些真正影响生产迁移的指标
所以更稳妥的判断是:这次事件把“长上下文是否值得大规模上生产”从抽象讨论变成了可测试的问题,但还没有把答案一次性给完。
哪些人该立刻试,哪些人不用急
我更建议三类团队优先做小规模验证:
- 做 agent infra 的团队,尤其是已经在算 GPU 并发和显存账的人
- 做长工作区产品的团队,比如长会话编程、持续研究、复杂项目协作
- 需要长链路工具调用的团队,因为上下文驻留成本会直接影响可用性
相反,如果你的场景主要是短对话问答、轻量生成、偶发工具调用,这次消息未必会立刻改变你的产品结构。你当然能从降价中受益,但这不是最值得你关心的核心变量。
我建议怎么应对
不要先问“要不要全面切模型”,先问“我们的成本真正花在哪里”。一个比较务实的验证框架是:
1. 选 2 到 3 个确实依赖长上下文的任务,而不是拿短问答做测试。 2. 同时记录任务完成率、平均延迟、上下文命中率、失败重试率和总成本。 3. 单独观察长会话后段质量是否下降,因为很多 agent 问题不是出在第一步,而是出在第十步之后。 4. 把“能开 1M context”和“应该默认开 1M context”分开判断。
这次消息最值得认真看的地方,不是一次促销,而是它让长上下文第一次更像一笔能被精算、能被 rollout、也能被复盘的生产投资。对真正做 agent 的团队来说,这比任何一句“模型更强了”都更重要。 #DeepSeek #长上下文 #AIAgent #模型定价 #AI基础设施
