DeepSeek 向新发布的 Flash 提出了一个颇具深意的问题:能否取代 Pro?随着 V4.1 Flash 内测开启,新模型结构、原生多模态及更快的速度成为卖点。但配套问卷中,DeepSeek 直接发问:“你觉得这个模型能全面取代线上的 DeepSeek V4 Pro 吗?”这无疑是一记“打脸”。DeepSeek 正在测试 Flash 在效果上是否能超越 Pro,从而将更廉价、更适合大规模调用的模型推向主流。Pro 与 Flash 之间本就存在显著的价格差——目前高峰时段,Flash 每百万输出 Token 收 9 元,Pro 则收 27 元。然而就在不久前,DeepSeek 在开放平台宣布下调 Flash 系列价格:9 月 10 日中午起,空闲时段每百万 Token 的缓存命中输入降至 0.02 元,未命中输入降至 1 元,输出降至 4 元;高峰价格仍为空闲时段的两倍。三项降幅分别达到 60%、约 33% 和约 11%。新 Flash 尚在测试能否接替 Pro,Flash 系列的使用门槛已先行降低。开发者可选择偶尔使用 Pro 以获得更佳结果,但在日常使用中,那些“可用可不用的”环节,Flash 的必要性便凸显出来。DeepSeek 旨在让新版本兼具两者的长处:Flash 快,Pro 强,而 V4.1 Flash 则要做到又快又强。

### 一、“智能密度”开始重要

R1 在 2025 年初走红时,其吸引力在于这种高水平推理终于变得容易获得。DeepSeek 同时开放了模型权重,将 R1 纳入官网、App 和 API,普通用户只需开启“深度思考”即可使用,开发者甚至能利用其输出蒸馏模型。高水平推理不再局限于少数实验室,它已进入聊天窗口,也融入了其他公司的产品开发。2025 年 5 月,DeepSeek 更新 R1 时,将“思考更深”作为最重要的进步。在 AIME 2025 测试中,旧版 R1 平均每题使用约 1.2 万个 Token,新版增至 2.3 万;准确率也从 70% 提升至 87.5%。此次更新虽让 R1 答得更准,但平均每题的推理消耗也接近翻倍。这套逻辑有理可循:面对没有现成答案的难题,模型需尝试方法、检查步骤、发现错误后重新计算。只要结果值得,额外的等待便可以被接受。但在 2025 年 12 月发布的 V3.2 报告中,DeepSeek 对自己提出了另一项要求:提高推理链的“智能密度”。原因很明确:为了达到 Gemini 3.0 Pro 等模型的输出质量,通常需要生成更长的推理过程。输出的等待时间变得至关重要,这既体现在速度上,也体现在每次的费用里。这一问题在大小模型的分工中会更加突出。V4 早期模型卡提到,Flash 在给予更多思考预算后能获得接近 Pro 的推理表现,但在知识和最复杂的 Agent 工作流上仍落后。小模型每一步计算更便宜,却可能需要更多步才能得到大模型的结果。开发者最终能省下的单价优势有多少,取决于任务究竟怎样完成。因此,Flash 要替代 Pro,需要同时改善能力和效率。更快生成冗长的推理能减少一部分等待;更早找到有效方法则可能省去后续计算。这对经常使用 AI 的人来说同样重要。学界已开始将用户等待时间纳入优化目标。EMNLP 2025 的一项研究指出,计算量最优的测试时扩展方案并不一定带来最低延迟;研究者需重新安排并行计算和推测解码,才能在限定时间内取得更好结果。DeepSeek 也已在改造生成速度。团队在 7 月公开的 DSpark 论文中报告,在 V4-Flash 线上用户流量下,相比 MTP-1 基线、保持相同吞吐水平时,单用户生成速度提升了 60% 至 85%。团队处理的是推测解码中的验证浪费,让用户更快拿到输出,同时顾及整套服务能承接的请求量。这对提供 API 的 DeepSeek 至关重要。请求更快结束,只有在没有严重牺牲总体服务能力时,才容易有效。开发者需要等待更短,DeepSeek 则需要让同一批计算资源更有效地服务用户。“能否解决问题”和“用户是否愿意等待解决问题”,开始成为两道不同的考题。它们也对应两种市场。研究人员可以为难题投入大量计算,日常使用的助手则必须不断响应新请求。前一种能力向前推进之后,厂商还得把它做成后一种服务,才有机会获得更大规模的使用。DeepSeek 在报告中提出的智能密度,最终会在这里接受检验:原先需要昂贵模型、长时间计算才能完成的任务,能否逐渐变成普通调用。

### 二、Agent 完成工作需算成本

内测当天,LINUX DO 用户“觉浅”恰好有一个停机维护页面要做,于是将新 Flash 接入编程工具。模型的表现让他惊喜:它读到了项目规范中一条早已弃用却未删的决策记录要求,还认真列出了文档维护、代码提交和审查安排。页面生成后,他提出风格不要与原项目割裂,模型又找出了仓库已有的插画进行修改。他对模型的执行能力很满意,但觉得贵:做完这个维护页面,花了 15.5 元。这也是 Agent 和普通聊天不同的地方。用户只交代一项工作,模型却可能在后台运行很多轮:先读项目规范,再查文件、改代码,拿到工具返回的结果后继续检查。每轮调用都可能产生新的输入和输出费用。模型单价低,不代表整项工作一定便宜。要让 Agent 用起来划算,除了降低模型单价,还得检查这些调用有没有必要。有些步骤需要模型判断,有些只是按既定规则读取、筛选和整理材料。如果后者也要一步步交回模型,就会增加调用和等待,中间结果还会不断占用上下文。DeepSeek 开源的 Harness,就能参与安排这套执行流程。DeepSeek 官网用“Agent = Model + Harness”解释两者的关系:模型负责判断,Harness 提供工具、管理会话和运行环境,让模型的决定变成实际操作。其中的 PTC 模式,允许模型一次写出一段程序,把多步工具操作串起来。例如,模型需要从一批文件里找出符合条件的内容,可以让程序批量读取、完成筛选,再把相关结果交回来。模型不必读完每份文件后都重新决定下一步,也不必接收全部原始内容。这样有望省下的是完成任务过程中的反复调用与无用输入。DeepSeek 在 PTC 的官方设计记录中,也将这两类开销列为需要解决的问题。对开发者来说,最终要比较的是同样一项工作能否做好,以及做完之后的总账单。这里有机会省下模型不必反复参与的过程。对于已知处理方式的材料,程序可以执行完整流程,模型再针对留下的信息作判断。DeepSeek 对重复计算的处理,也能往前追溯。V3.2 报告曾指出,在连续工具交互中丢弃已有推理,会迫使模型重新分析整个问题。因此,团队调整了上下文管理,让此前的推理能够在这一过程中保留。从模型如何思考,到工具如何执行,效率损失已经不能只在模型参数里寻找。Harness 还记录提示、工具调用及结果,让开发者能够回看任务,检查重复处理和执行失败发生在哪里。8 月 10 的一项官方开发记录显示,DeepSeek 修正了极简模式的工具与提示词配置,让它使用与强化学习运行环境一致的持久 Bash,以保留连续操作的工作状态。这种细节解释了模型公司为何还要做执行框架。模型学会了如何使用工具,实际运行时也得有合适的工具和环境。DeepSeek 将其中一套明确的运行方式开放出来,应用开发者就多了一个可以直接采用、检查和修改的参照。这些改进逐渐汇到同一项工作中:服务端加速生成,模型减少重复推理,执行框架减少不必要的调用。过去是用户盯着 AI 想,现在还得让 AI 持续工作而不把费用和等待放大。

### 三、日常模型往上走,旗舰就得解决更难的问题

DeepSeek 并不是唯一一家重新安排高端能力的模型公司。7 月 24 日,Anthropic 发布 Opus 5,主打以 Fable 5 一半的价格提供接近其前沿水平的能力,并将其设为 Claude Max 的默认模型。Anthropic 甚至直接用“每项任务的成本”来介绍 Fable。在官方 CursorBench 3.2 测试中,最大思考强度下的 Opus 5 接近 Fable 5 的最高成绩,任务成本约为一半。Cursor 联合创始人 Sualeh Asif 在同一份发布材料中,将其概括为以 Opus 的速度和成本,提供接近 Fable 的智能。这与 DeepSeek 的方向无限相似:一旦高端能力可以更便宜地提供,原来的价格分层就需要重新校准。Fable 和 Astra 的定位,可以为下一代 Pro 提供一个参照。Anthropic 把 Fable 放在耗时数小时、跨越多个应用,乃至持续多日的编程任务中;OpenAI 则将 GPT-6 Astra 定位于最困难的端到端工作,覆盖复杂推理、编程、研究和文档制作。这类旗舰模型争取的是用户愿意交出更多时间和预算的复杂工作。用户给出目标,模型需要自行拆解任务、调用工具、检查结果,并在遇到问题后继续推进。它的价值,要由最终完成的工作来证明。高端型号需要承担更完整的责任。用户交给它一个任务,期待拿回能够检查、能够使用的结果。模型要能保持方向、使用工具,在失败后继续推进,而不是每过几步就要求用户接管。从这里看未来的 DeepSeek Pro,一个合理的猜想是:如果 Flash 真能承担现在 Pro 的大量工作,下一代 Pro 就可以把更多计算投入更困难、更长的任务,争取 Astra、Fable 所代表的产品位置。要是需要足够时间思考,得出的结果就要足够优秀。这也解释了为什么原生多模态和 Harness 会变得重要。一个需要独立完成工作的模型,迟早要读到图表、看到页面,判断自己做出的界面是否符合要求。只会处理文本、只能给出建议,会限制它能够接手的工作。早在 4 月发布 V4 预览版时,DeepSeek 就明确提到针对 Claude Code、OpenClaw、OpenCode、CodeBuddy 等 Agent 产品进行适配,展示的成果中包括生成的 PPT 页面。模型已经在进入具体工具中的代码与文档工作。现在,新 Flash 在更新结构和多模态能力,Harness 在调整执行方式。把这些动作放在一起,DeepSeek 要提高的效率,已经覆盖从一次推理到一项任务的过程。对 DeepSeek 来说,提高效率有两种回报。减少完成任务所需的计算,可以降低成本;在相同等待时间里完成更多有效推理,则有机会解决更难的问题。后者会让“深度思考”继续向前,前者则决定这些进步能走进多少人的日常。V4.1 Flash 目前仍是中间版本,全面替代 Pro、推理链变短和下一代 Pro 的定位,都还需要后续结果验证。本文引用的 DSpark 提速属于此前 V4 服务的测试,不能直接算作此次更新的成绩。不过,下一轮竞争要回答的问题已经变了。Flash 要让更多这样的工作变得划算。Pro 要找到更多值得等待的工作。

最新快讯

2026年09月09日

09:03
午后创新药板块强势拉升,截至收盘,主要指数全线飘红。其中,恒生港股通创新药指数上涨0.3%,中证港股通医药卫生综合指数上涨0.8%,中证创新药产业指数上涨0.9%,中证生物科技主题指数上涨1.4%,沪深300医药卫生指数上涨0.5%。 消息面上,行业利好频现。先声再明与罗氏签署SIM0660全球独家授权协议,交易金额高达15.3亿美元;百济神州上半年业绩亮眼...
09:03
据鼓狮财经9月9日报道,国内商品期货市场开盘表现分化。其中,甲醇涨幅显著,超过5%;原油上涨超3%;集运欧线和对二甲苯涨幅均逾2%;氧化铝、烧碱、焦煤、PVC、液化气及苯乙烯涨幅均在1%以上。下跌方面,钯跌幅超过3%;碳酸锂、沪金及沪银跌幅均超过1%。
09:03
当地时间8日,美军南方司令部宣布,西半球联合特遣部队当天在东太平洋拦截了一艘涉嫌为非法海上贩毒活动提供支持的“浮动加油站”。经情报核实,该船只与厄瓜多尔“洛斯·乔内罗斯”贩毒恐怖组织有关联。目前,船上人员已被移交给厄瓜多尔当局。在完成清查并让船员下船后,美军已将该船击沉。
09:03
美国调整对加拿大部分产品关税适用范围 当地时间9月8日,美国总统特朗普签署公告,宣布调整对加拿大部分产品征收50%额外从价关税的适用范围,相关调整将于9月15日起生效。根据最新公告,美国将对部分加拿大产品适用50%的额外从价关税,同时取消部分加拿大产品此前适用的50%额外关税。具体涉及的产品以公告所附清单为准。新的关税适用范围将于美国东部时间9月15日凌晨0...
08:21
2026中国国际光电博览会(CIOE)将于9月9日至11日在深圳国际会展中心拉开帷幕。作为行业盛会,本届展会将汇聚多家产业链龙头企业,集中展示1.6T高速可插拔光模块、CPO/NPO共封装光学、MPO高速光纤连接器等前沿产品与技术方案。 国联民生证券研究指出,从参展企业披露的进展来看,1.6T光模块正逐步进入规模上量阶段,而3.2T及更高阶产品则陆续推进送样...
08:21
韩国近期在全球率先吹响了“AI公共事业化”的号角。根据韩国科信部公布的“全民AI”方案,该国计划向5100万公民提供免费、不限量的生成式AI服务,明确承诺“免收订阅费、不设Token使用上限”。资金来源方面,直接接入挂号就医、公租房申请和报税系统,运营成本由财政预算直接兜底。在执行进度上,已从口号落实到了具体选人干活:8月28日,SK电讯、Kakao和KT牵...
08:21
Anthropic 内部拥有一支约 20 人的团队,成功孵化了 Claude Code、MCP 以及 Claude Design 等产品。然而,在联合创始人兼实验室负责人 Ben Mann 看来,这支团队的绝大多数尝试,原本就应当允许失败。据 Business Insider 报道,Anthropic 的 Labs 团队以大约两周为一个周期审视产品原型,决定...
08:21
2026年的AI安全,正处于一个极为微妙的十字路口。一方面,企业迫切希望将AI智能体放权,深入核心业务以实现爆发式增长;另一方面,传统的安全体系在面对这些动态、长程决策的数字员工时却显得力不从心。 今年4月,汽车租赁软件公司PocketOS遭遇了一起极具代表性的事故。当时,一名工程师让Cursor里的编码智能体处理测试环境中的常规问题。智能体在遇到凭据不匹配...
08:21
当地时间9月8日,Meta正式发布了其首款个人智能体Muse。该智能体具备主动辅助用户实现目标及提供建议的能力。目前,Muse已在美国开启服务,支持iOS、Android及muse.ai平台,并计划近期适配AI眼镜。此外,Meta还透露将在今年晚些时候推出Muse Confidential VM,届时用户个人数据及与Muse的对话内容将完全由用户持有的密钥进...