DeepSeek 把模型打成电费,OpenAI 把模型做成操作系统

AI115 次阅读约 8 分钟

图像

今天这两条消息放在一起看,比单独吹 DeepSeek 更有意思:

  • DeepSeek V4-Flash 正式版上线;
  • OpenAI 把 GPT-5.6 Luna 的价格直接砍了 80%。

第一反应当然是:又一轮价格战来了。

但我看完后的判断是:

DeepSeek 正在把大模型打成“电费”,OpenAI 则在把大模型做成“操作系统”。

两家都在降成本,但走的不是同一条路。

先纠正一个容易传错的信息

DeepSeek 公布的 V4-Flash 价格确实很夸张:

每百万 Tokens DeepSeek V4-Flash 深蓝 V4-Flash GPT-5.6 Luna GPT-5.6 月神
普通输入 $0.14 $0.20
缓存输入 $0.0028 $0.02
输出 $0.28 $1.20

普通输入,两家的差距已经没有想象中那么大。

真正拉开距离的是缓存和输出:

  • Luna 的缓存输入价格约为 V4-Flash 的 7.1 倍;
  • Luna 的输出价格约为 V4-Flash 的 4.3 倍。

还有一点需要注意:DeepSeek 官方写的是即将采用峰谷定价,具体生效时间另行通知。也就是说,峰时翻倍这件事已经公布,但并不是现在已经正式执行。

图像

DeepSeek 这次最狠的,不只是便宜

以前很多人提 DeepSeek,第一句话就是“性价比高”。

但 V4-Flash 这次更关键的变化,是它开始主动进入 Agent 和开发工具链:

  • 100 万上下文;
  • 最高 38.4 万 Tokens 输出;
  • 支持思考与非思考模式;
  • 支持工具调用;
  • 支持 Responses API;
  • 对 Codex、Claude Code、OpenClaw 等 Agent 工具做适配。对 Codex、Claude Code、OpenClaw 等代理工具进行适配工作。

这意味着它不再只适合“聊天、翻译、写文章”。

它开始适合承担大量真正会消耗 Token 的后台工作:

客服、翻译、资料整理、代码测试、知识库问答、批量生成、多 Agent 通信。

这些任务未必需要最聪明的模型,但每天可能调用几万次。

到了这个量级,模型每百万 Tokens 差几毛钱,最后差的就不是几毛钱,而是一个产品到底能不能赚钱。

OpenAI 为什么还值得用?

看到 DeepSeek 的价格后,很容易得出一个过于简单的结论:

既然更便宜,那就全部换成 DeepSeek。

我不认同。

OpenAI 的优势从来不只是“模型分数高一点”,而是它已经把网页搜索、文件搜索、图像理解、代码执行、Computer Use、MCP 和 Responses API 做成了一套完整的工作环境。

举个最实际的例子。

一个 Agent 需要完成下面这件事:

  1. 读取客户上传的图片;
  2. 查询网页;
  3. 分析 PDF;
  4. 调用内部系统;
  5. 在网页中执行操作;
  6. 最后返回结构化结果。

只比较 Token 价格,DeepSeek 更便宜。

但把开发、调试、工具接入、失败重试和后期维护都算进去,OpenAI 未必更贵。

模型单价不是系统总成本。

这个区别非常重要。

DeepSeek 更像便宜、强劲的发动机; OpenAI 更像发动机、变速箱、导航和控制系统已经装在了一起。

所以,到底该用谁?

我的答案不是二选一。

这些任务,我会优先给 DeepSeek

  • 翻译、摘要、分类、改写;
  • 商品资料和内容批量生成;
  • 企业知识库问答;
  • 长文本和长代码输出;
  • 高频客服;
  • Agent 的初步判断和中间步骤;
  • 大规模测试、评测和回放。

这些任务共同的特点是:

调用量大、失败成本不高、对价格敏感。

这些任务,我会优先给 OpenAI

  • 图片、截图和复杂文件理解;
  • 网页搜索与实时信息获取;
  • 需要连续调用多个工具的 Agent;
  • Computer Use;
  • 涉及订单、客户和数据写入的关键操作;
  • 需要快速上线、不想自己搭一整套工具链的项目。

这些任务共同的特点是:

调用量未必最大,但工程复杂度和失败成本更高。

真正该做的,是模型路由

未来靠谱的 AI 产品,不会在代码里写死一个模型。

而是让系统先判断任务:

  • 简单还是复杂?
  • 是否需要看图?
  • 是否需要联网?
  • 是否需要操作工具?
  • 输出会不会很长?
  • 做错了代价有多大?

然后再决定调用谁。

图像

一个比较现实的结构可能是:

  • 70%—80% 的高频基础任务:DeepSeek V4-Flash;
  • 15%—25% 的复杂工具任务:GPT-5.6 Luna 或 Terra;
  • 极少数高难度、失败代价高的任务:旗舰模型。

这才是今天两条新闻放在一起后,最值得关注的变化。

不是 DeepSeek 打败 OpenAI,也不是 OpenAI 被迫降价。

而是大模型正在迅速变成一种可以按任务调度的基础资源。

以后真正拉开差距的,不是你押中了哪家公司。

而是你能不能回答三个问题:

  1. 哪些任务根本不需要最强模型?
  2. 哪些任务不能只图便宜?
  3. 怎样让系统自动做出这个选择?

最后一句

今天真正赢的,不是某一家模型。

是那些开始把模型当成成本、工具和资源来管理的人。

模型越来越便宜,选错模型却仍然很贵。

官方资料

数据截至 2026 年 7 月 31 日。

继续阅读

基于全文检索与主题相似度