刚刚,DeepSeek公布了Flash系列的新定价方案。从9月10日中午12点开始,计费规则如下:在非高峰时段,每百万Token的输入成本为0.02元(命中缓存时)和1元(未命中),输出成本为4元;在高峰时段,上述价格均翻倍。高峰期仅限于周一至周五的上午9点到12点以及下午2点到6点,其余时间均视为空闲。
对比官方现行的价格表,Flash和Flash视觉实验模型在空闲时段的输入价格分别为0.05元、1.5元,输出价格为4.5元。此次调整后,三项费用的降幅分别达到了60%、33.33%和11.11%。
根据一周168小时的时长计算,高峰时段仅占35小时,其余133小时均为空闲时段,占比高达79.17%。这意味着,如果将原本发生在高峰期的任务调度至空闲时段,理论上费用可节省约50%。
当然,这只是理论上的理想状态。从商业逻辑来看,这是一种典型的需求侧管理策略。算力基础设施投入巨大,且设备存在折旧成本。如果所有任务都集中在白天,平台必须为峰值预留充足的算力,而其他时间则可能面临利用率不足的问题。通过价格差异引导可延迟的任务转移到非高峰期,有助于提高设备的整体利用率,从而分摊单位服务成本。因此,降价并不等同于平台收益减少。相反,通过时间调度让现有设备更饱满地运转,关键在于看新增了多少调用、填补了多少闲置算力,以及这些新增任务带来的边际成本。
更值得注意的是缓存机制。根据DeepSeek官方文档,上下文缓存默认开启。当后续请求完整匹配已保存的缓存前缀时,可以直接复用对应内容,但模型输出仍需重新计算。按照新定价,缓存命中的输入价格仅为未命中输入价格的2%,而输出单价则是缓存输入价格的200倍。这种巨大的价差将直接影响应用的设计策略。
以一个具体场景为例:假设一次任务累计输入100万Token,其中80%命中缓存,剩余20万Token为输出,且均在空闲时段运行。旧价总费用为0.8乘以0.05加上0.2乘以1.5加上0.2乘以4.5,总计1.24元;新价总费用为0.8乘以0.02加上0.2乘以1加上0.2乘以4,总计1.016元,降幅约为18.1%。这远低于之前提到的50%理论降幅。为什么差距这么大?因为尽管输入端的优惠力度很大,但输出费用依然占据了总成本的绝大部分。简而言之,这确实能帮用户省钱。这对应用公司的实际意义,或许比一次短期的促销活动更为深远。
