就在刚刚,DeepSeek放出Flash系列新的定价通知。
9月10日中午12点起:每百万Token,空闲时段缓存命中输入0.02元、未命中输入1元、输出4元;高峰翻倍,对应0.04元、2元和8元。
高峰限定工作日周一到周五的9-12点、14-18点,其余时间全部算空闲。
峰谷计费此前已经存在。
据官方现行价目表,Flash及Flash视觉实验模型的空闲价格分别为0.05元、1.5元和4.5元。
新旧对照,三项降幅分别为60%、33.33%和11.11%。
按这一规则计算,一周168小时,高峰35小时,空闲133小时,占约79.17%。
同样的Token组合,从高峰挪到空闲,费用理论上可以减半。
当然,只是理论上。

从商业逻辑看,这是一种需求侧管理。
算力基础设施需要投入,设备也会随时间折旧。
如果任务都挤在白天,平台就要为峰值准备容量,其余时间却可能利用不足。
通过价差把可延迟任务搬走,有助于提高设备利用率,摊薄单位服务成本。
所以,降价不意味着平台少赚。
可以通过时间上的调度,让现有设备干得更满。
关键要看增加了多少调用、填补了多少闲置,以及新增任务带来的边际成本。
更鸡贼的是缓存。
DeepSeek官方文档说明,上下文缓存默认开启,后续请求完整匹配已经保存的缓存前缀单元时,可以复用对应内容;模型输出仍需重新计算生成。
开发者把固定规则、重复文档和稳定上下文组织好,就可能减少重复处理。
按新价,缓存命中输入只需未命中输入价格的2%,输出单价则是缓存命中输入的200倍。
这种价差会直接影响应用设计。
举个例子:一次任务累计输入100万Token,其中80%命中缓存,另外输出20万Token,全部在空闲时段运行。
旧价费用为0.8×0.05+0.2×1.5+0.2×4.5=1.24元;新价为0.8×0.02+0.2×1+0.2×4=1.016元,下降约18.1%。
这跟理论值相差甚远。
为什么?
因为输入优惠得再多,输出费用依然是大头。
少说废话,真的能省钱。
这对应用公司的意义,可能比一次促销更长远。
免责声明:所有平台仅提供服务对接功能,资讯信息、数据资料来源于第三方,其中发布的文章、视频、数据仅代表内容发布者个人的观点,并不代表泡财经平台的观点,不构成任何投资建议,仅供参考,用户需独立做出投资决策,自行承担因信赖或使用第三方信息而导致的任何损失。投资有风险,入市需谨慎。

迁址公告
古东管家APP
关于我们
请先登录后发表评论