
作者 | 荣智慧
编辑 | 向现
唯物的中国芯片产业深度观察
今日起,深度求索的新价格机制正式生效。最新旗舰模型Deepseek-V4-Pro,高峰时段百万词元(token)输出价格从6元涨至27元,涨幅高达350%。
过去,因为定价低,深度求索的DeepSeek大模型人送外号“性价比之王”,如今价格“暴涨”,创始人梁文锋在用户社区里的“风评”一下子从“梁圣”被玩梗成“梁子”。
涨价的不只深度求索一家。近期,中国大模型涨价成为一股潮流,月之暗面的Kimi、智谱AI的GLM以及腾讯云的混元等,均上调了服务价格。

Deepseek-V4 API新定价
据摩根士丹利8月研报,中国大模型平均API输入和输出价格,较去年分别上涨约48%和80%。
网友们的“灵魂拷问”随之来临:为什么国产大模型纷纷涨价?DeepSeek大幅涨价后,谁才是大模型性价比之王?它的Harness到底有多好用?
01
集体涨价
以低价著称的深度求索都涨价了,其他国产大模型也“见机行事”。
月之暗面的Kimi K3,开启最高算力档位时,API输出价格上调至100元/百万词元,比起上一代旗舰模型K2.6的22.4元,涨幅高达3.5倍以上。智谱AI今年三次上调价格,GLM-5的API价格,平均涨幅达83%。
腾讯云的混元2.0模型,输入与输出计费上涨超5倍,最高单项接口涨幅高达463%。阿里云的Qwen3-Max,商用闭源端价格维持在输入12元/百万词元、输出36元/百万词元区间,但AI算力卡的价格上调了5%至34%。百度的文心一言ERNIE5.1输入8元/百万词元、输出24元/百万词元,企业定制版接近以上价格的2倍。

千问的Token Plan个人版订阅价格
中国大模型的集体涨价,受技术演变、健康商业化和供应链情况等因素的共同影响。
今年智能体(Agent)特别火爆,代码托管的场景也在拓展,之前简单的“一问一答”已经不够用了。一问一答只需要几十词元,但一个“懂事”的智能体执行如编写软件、自动化数据分析等复杂任务时,需要反复调用API,词元的吞吐量呈几何数级增长。
像DeepSeek的Flash模型,单周调用量最高达7.22万亿词元,占全球份额的58%,如此庞大的调用量超过了它的算力承载极限。为了防止服务器崩溃,保障核心企业用户的服务,厂商不得不通过峰谷定价或者涨价的方式——经济杠杆分流算力的压力。
2024年至2025年,各大厂商为了抢占市场份额,掀起了残酷的价格战,API价格甚至到了“买一送一”或“几分钱一百万词元”的“大甩卖”地步。这种地板价只适合短期“促销”,毕竟算力是要花钱的,每一张GPU的租金、电费、运维人员的工资都是刚性支出。

图源:Unsplash
随着市场格局初定,投资人和大公司对大模型创业公司、业务部门的考核也变了,不再过度关注“调用量”和“注册数”,转为看营收和造血能力。
另外,中国大模型企业也有“一分钱一分货”的底气。DeepSeek-V4-Pro、Kimi K3、GLM-5在专业领域的逻辑推理、代码生成能力上,都不比美国一线模型差,即使涨了价,比起美国模型还是便宜不少的。
还有一个因素常常被忽视,即英伟达高端算力芯片紧缺,国内企业获取的渠道受极大限制,市面上存量的高端显卡,租金价格越来越高。虽然很多大模型厂商大规模转向华为昇腾等国产AI芯片,但一方面产能不足,僧多粥少,一方面国产芯片在前期的生态适配、算力集群联合调试以及算力利用率优化上,都需要大量的研发人力和时间成本。这些前期的投入,最后都得传导在价格上。
02
省钱密码
大模型的账面单价,确实是涨了,但这只是大模型在一问一答、没有上下文时的价格。缓存命中率才决定了当模型处理连续对话或长文本时,消费者要花多少钱。
如果缓存命中率高,就算账面单价上涨,最后的账单可能反而更便宜。
缓存命中(Cache Hit),相当于大模型有了一定时间的记忆力。如果历史记录没变,模型直接从内存里读取上一次算好的结果,不需要重新计算。只要在模型记忆“尚存”的时间内提问,价格都会优惠,厂商一般会给出原价的1%—10%,因为模型还记着你的问题,省算力。
以DeepSeek-V4-Pro的高峰期价格为例,假设你要写一个项目,提示词约15万—20万字,达10万个词元,你要在模型的辅助下进行3轮对话,每轮提问都用1000词元,它回答也用1000词元。

DeepSeek价格
已知,DeepSeek-V4-Pro的缓存未命中价格为9元/百万词元,缓存命中价格0.3元/百万词元,输出价格27元/百万词元,那么,可能出现两种极端情况。
第一种极端情况,缓存命中率为0%,因为你频繁改动代码、架构乱七八糟、说话前言不搭后语,每一轮对话,模型都没法复用之前的缓存,必须全额计算那10万词元,那么,3轮对话下来,总花费为2.835元。
第二种极端情况,缓存命中率100%,你的代码框架和历史背景都没怎么变,表达条理也清晰,每一轮只有你新提问的1000词元作为新输入,那么,3轮对话下来,总花费为1.077元。
同一个模型、同样的项目,缓存低命中的价格,竟然是缓存高命中的价格的2.6倍。
这也是为什么说看“账面单价”不准。如果模型的缓存机制触发非常灵敏,在多轮对话后,它能帮你省不少钱;反之,一个模型标价便宜,但不支持缓存,或者多轮对话一长就无法命中,它的“滚雪球式扣费”搞不好让你破产。

《三体》剧照
在实际开发中,“看标价不如看缓存机制”已经成为业界共识。客观来看,国产大模型在缓存命中率的实现方式上,基本分为三个梯队。
第一梯队的月之暗面、深度求索、阶跃星辰,都在底层架构上针对键值缓存(KV Cache)做了深度自研,是行业内缓存命中率最高、计费策略最透明的厂商。
Kimi K3的非缓存输入要20元/百万词元,缓存命中后只需要2元/百万词元,相当于打1折。DeepSeek-V4-Pro依靠自研的前缀缓存技术,缓存命中率逼近90%—98%。尽管8月17日起价格上浮,但缓存未命中(9元)和缓存命中(0.3元)之间依然有30倍差距。StepFun的客观命中率为86%—92%,命中缓存的价格相当于原价的2折。
第二梯队的智谱AI、MiniMax、火山引擎,缓存命中率约在70%—85%之间。第三梯队的零一万物、腾讯云、百川智能,缓存命中率在50%—80%之间。阿里、百度未公开这方面的数据。
综合来看,只要开发者的提示词工程做得好,DeepSeek依然是压低成本的神器。
03
模型商品化
DeepSeek的新模型V4-Pro的上线、API价格上调,和Harness开源式开放,是同时发生的。Harness的上线,才是深度求索商业化的真正触角。
在美国AI界已经出现这样的共识,2026年是“模型商品化”之年。美国开发者判断,模型决定了能力的下限,而Harness决定了产品的上限。
深度求索的内部流传一个公式,Model+Harness=Agent。意思是说,模型是发动机,Harness是方向盘、变速箱、刹车。没有Harness,模型就是个裸API。有了Harness,模型才能变成真正能干活的智能体。
Harness相当于一套动力传导设施。模型吐出指令后,Harness会在一个沙箱里执行代码、读取文件、运行测试;如果报错,Harness还能把报错信息传回模型让它自我修正,直到活干完。

DeepSeek Harness首页
有意思的是,深度求索设计Harness的核心在于“一切皆插件”,彻底去中心化。在Harness的世界里,没有任何东西是硬编码绑定的,全部都可以热插拔:大模型是插件,文件读写、网络搜索是插件、智能体的思考循环和任务调度机制是插件,连它的Web UI界面也是个插件。
这种可组合性,让使用者像玩乐高积木一样,无需修改框架核心代码,就能在配置层随意定制和替换“干活的人”。
DeepSeek Harness的开源,在美国开发者已经习惯Claude Code和Open Code的市场上扔下了一颗“开源”和“极致低成本”的炸弹,让全球的开发者都能低成本部署自己的全自动AI员工。
有美国社区实测发现,DeepSeek-V4-Flash模型配合DeepSeek Harness的“极简模式(Minimal Mode)”,在Agent基准测试上逼近行业顶尖水平,但成本便宜了50到90倍。
因此,深度求索的涨价,与Harness的开源,是一种协同打法。

DeepSeek Harness首页
通过开源Harness,深度求索引导全球开发者去构建高价值的自主编程智能体,虽然智能体运行会消耗大量词元,但由于使用DeepSeek Harness调度,极大触发前缀缓存,把缓存命中率拉到90%以上,这样一来,开发者就可以享受三十分之一的价格,在事实上抵消了涨价带来的冲击。
说来说去,“玩家”越专业就越省钱,就像30多年前有高手用一个游戏币就能在游戏厅玩一天。
难道我们普通人就要当冤大头吗?也不一定。可以首先减少一个最普遍的错误:在一个对话框里从早聊到晚,什么话题都往里塞。省钱操作是,给每个话题开个新窗口,至少省一半冤枉钱。
还有另一个方法,咱看时间。根据深度求索的“峰谷分时定价”机制,午饭时间和晚饭后时间最划算,直接5折起,把想和AI聊的话,都放到那个时间段。
文中首图为新华社记者 黄宗治 摄
值班主编 | 张来
排版 | 菲菲