8月12日晚,DeepSeek正式发布了旗舰级模型V4 Pro,版本号标注为DeepSeek-V4-Pro-0813。该产品具备100万令牌的上下文窗口及38.4万令牌的最大输出长度。默认情况下,模型采用深度思考模式;同时,为了满足对延迟敏感的调用需求,还提供了一个非思考模式的端点。对于大型代码库、海量文档语料库以及多步骤代理运行而言,100万输入与38.4万输出的组合意味着单次调用即可摄取和生成比前代多得多的内容。
在功能集成上,DeepSeek-V4 Pro 赋予了开发者当前代理开发的主流期望:支持结构化JSON输出、工具调用、Responses API以及与Anthropic API的兼容性。此外,还测试版支持对话前缀延续和FIM(填充中间标记)补全,但需注意FIM功能仅限非思考模式。底层架构上,该服务同时提供OpenAI和Anthropic兼容接口,使得已经在使用任一标准的团队无需重新配置技术栈即可轻松切换。
定价策略上,DeepSeek展现了明确的分层设计。缓存命中费用方面,Pro为每百万代币0.025元,Flash为0.02元;而在缓存未命中时,输入成本分别为3元和1元,输出成本分别为6元和2元。这意味着Pro在未命中缓存场景下的综合成本约为Flash的三倍。并发限制也进一步强化了这一差异:Flash支持2500个并发请求,而Pro的上限仅为500个。这种配置清晰地界定了产品定位:Flash侧重于高频、高吞吐且对成本敏感的流量;Pro则将资源集中于复杂的推理任务、长上下文编码及代理工作流,这些场景下能获得显著的性能提升。尽管如此,Pro的绝对定价在当前前沿模型中依然处于合理区间,既弥补了近期成本上涨的影响,又低于大多数海外竞争对手。
随着DeepSeek-V4-Pro-0813的推出,V4系列实际上构建了双轨制架构:Flash层负责低成本与高并发扩展,而Pro层则专注于高规格的编码与代理应用场景。
