7月19日,Qwen团队毫无预热地抛出了一枚重磅炸弹:Qwen 3.8即将发布,并将开放权重。根据官方披露,这一代模型的总参数规模达到了2.4万亿。更引人注目的是,Qwen将其定位为与一线闭源旗舰正面竞争的对手,并宣称其能力仅次于“Fable 5”。与此同时,Qwen3.8-Max-Preview已率先登陆Token Plan、Qoder和QoderWork,开发者无需等待完整权重发布,即可提前试用。这无疑是一份相当激进的宣言。过去一年,前沿模型的竞争焦点已从单纯的榜单分数比拼,转向了更为复杂的综合较量:模型能否稳定调用工具、理解真实网页与复杂状态、在长任务中保持约束,以及能否直接交付可运行的软件和媒体文件。单纯看参数规模,已难以判断一个模型的真实能力。因此,本文不打算复述官方发布文案,也不打算仅用几道数学题来为它排座次。我们要回答的是一个更朴素的问题:Qwen 3.8 Max Preview 现在究竟能否完成真实、复杂且可验收的工作?在进入实测之前,我们将先拆解这次发布中已确认的事实、待验证的承诺,以及这2.4万亿参数背后的实际意义。

首先,将事实与口号剥离。截至目前,Qwen官方确认的核心信息并不多:2.4T总参数规模;qwen3.8-max-preview已进入Token Plan、Qoder与QoderWork;后续将开放权重,但发布日期、许可证和最低部署要求均未公布;官方宣称提升方向聚焦于Coding与Cowork,覆盖全栈开发、数据分析和Office工作流等复杂长程任务。这足以说明,Qwen 3.8是一款规模极大、推理预算极高、面向Agent场景设计的模型。但Qwen尚未公开完整模型卡、技术报告或统一评测表。为了穿透宣传滤镜,我们选择沿用测试K3时的同一套题目来检验它。逻辑非常简单:两者参数规模接近,且都将自己定位为顶级闭源模型的挑战者。在此前对K3的评测中,我们设计了一套覆盖复杂软件工程、长程工具调用、多模态状态理解和最终产物交付的测试集。现在,同一套题目被原封不动地搬到了Qwen 3.8面前,约束条件、任务边界和评判标准完全一致。Qwen 3.8能否在统一条件下稳定完成复杂软件工程任务?能否在长时间工具调用后依然死守最初的约束?能否准确理解网页、截图、表格和文件之间的状态演变?又能否最终交付一个真正可以跑通、打开和检查的实体产物?这些问题的答案,远比再看一份厂商自测榜单更有价值。

第一题看似是一道常规的前端题,实则同时考察了视觉识别、页面拆解和工程交付。我们向模型上传了一张2000×1091的NASA Webb Images页面截图,仅发送了一句话:“你是一个资深的前端开发工程师。请仔细观察这张科普网站的截图,并将其转化为单文件的HTML代码。”没有告诉它页面名称,没有提供素材地址,也没有补充技术栈、响应式或“像素级复刻”之类的要求。模型必须自行识别截图中的信息层级,并决定如何在一个HTML文件里重新实现。Qwen 3.8 Max Preview顺利交付了一个可以直接打开的index.html。页面不是把原截图塞进``里冒充复现,而是使用独立的HTML、CSS、SVG和Canvas重新搭建。从结果来看,它准确识别出了NASA页面最关键的四层结构:顶部黑色全局导航、深灰色Webb二级导航、左文右栏的主体内容,以及底部横向天文图像。Webb Images标题、整段介绍文字、两组共八个图片分类也全部保留,没有出现常见的错字、改写或凭空编造。尤其是双层导航,模型不仅识别出了Explore、搜索框、NASA标志、News & Events、Multimedia和NASA+ LIVE,也完整还原了第二层的Webb、News、Overview、Science、Observatory、Multimedia、Team和More。对一项只有截图输入的任务而言,这说明它的视觉文字提取和页面语义拆分都很稳。页面中的NASA标志没有调用外部图片,而是用SVG重新绘制;底部天文图也没有依赖网络资源,而是用Canvas生成星空、星系核心和散落星体。这个选择让文件在断网环境下仍然能够完整显示,也说明模型确实理解了“单文件交付”的工程含义。但它还没有达到像素级视觉复刻。模型知道页面由什么组成,却没有准确估计这些元素在目标分辨率中的绝对尺度;它完成了最显眼的桌面首屏,却没有继续检查窄屏和可访问性。这使Case 1的结论非常明确:Qwen 3.8 Max Preview已经具备扎实的视觉到代码能力,第一版就能做到八成完成度,但距离闭源旗舰所追求的精细设计还原与产品级收尾,仍有一段肉眼可见的距离。

第二题要求模型根据28条多模型API运行记录、一份AstraOps品牌规范和一个SVG标志,实现一个单文件、完全离线的运营驾驶舱。题目不只要求页面好看,还明确规定了五项核心指标的统计口径、四类数据图表、三级筛选联动、异常检测规则、明细表排序和成本情景模拟器。Qwen 3.8 Max Preview最终交付了一个1203行的单文件HTML。所有数据、样式、SVG图表和交互逻辑都内嵌在文件中,没有使用React、第三方图表库、CDN或网络请求。我们直接调用其内嵌计算逻辑对原始数据进行校验,默认视图的五项结果与标准答案完全一致。页面完整实现了题目要求的四类图表:每日模型请求量使用堆叠柱状图,成功率使用多折线图并绘制97%警戒线,成本—质量关系使用气泡散点图,请求量占比则使用环形图。这些图表全部由原生SVG生成。柱体、折线节点、气泡和环形扇区都来自当前筛选后的数据,并提供模型颜色、坐标、数值标签和悬停提示。散点图中的横坐标确实按“总成本÷总请求量×1000”计算,纵坐标则是请求量加权质量分,气泡半径与请求量关联;并不是在一个固定坐标上摆四个装饰圆点。Case 2是Qwen 3.8 Max Preview第一次真正让人感到超出预期的地方。面对一份带有明确业务口径的结构化需求,它没有把主要精力浪费在华丽装饰上,而是先建立统一的数据状态,再让指标、图表、异常和模拟器共同消费这份状态。除了时间筛选窗口的一个边界问题,首轮交付已经接近可以进入代码评审的内部工具原型。

第三题把难度再次提高。这一次,模型需要根据一个24×16的建筑网格和一份仿真规则,构建包含12名人员、4扇防火门、2个出口和1个烟雾源的交互式疏散沙盘。人员速度不同,出口容量不同,烟雾会按固定周期扩散,D4会在12秒时自动关闭。系统还必须处理寻路、碰撞等待、出口排队、烟雾暴露、受困与恢复路径。这类题非常适合识别模型是否在演戏。一个页面可以用CSS动画让小圆点看起来在移动,也可以预先写死12条轨迹,但只要用户提前关门或切换播放速度,伪仿真就会立刻露馅。Qwen 3.8 Max Preview交付的是一个724行单文件HTML。源码中没有写死轨迹,也没有使用随机移动,而是建立了网格、门、人员、烟雾、出口和计划事件的独立状态,并以0.5秒为固定逻辑步长逐步推进。我们首先在初始门状态下调用页面自己的A*寻路逻辑,检查12名人员到最近出口的路径长度。十二个结果与验收基准完全一致。这意味着墙体展开、门格位置、两个出口坐标和四方向移动规则都没有解释错误。路径搜索使用普通格代价1、烟雾格代价8,并以到两个出口的最小曼哈顿距离作为启发函数。每个逻辑步都会根据当前门状态和烟雾区域重新规划,而不是在开始时生成一条永不改变的路线。Case 3的意义在于要求Qwen同时维护空间、时间、人员、烟雾、门和出口六类相互影响的状态,而模型在首轮交付中通过了最关键的数值基准和事件边界。相比Case 1的视觉复刻,这更接近大模型在真实工程中的价值:它未必把每个细节都做到产品级,却能够从一份自然语言规则出发,建立一个可运行、可解释、还能被严格验证的系统。

第四题要求模型从零实现一个真正可玩的3×3×3网页魔方:不仅要有26个立体块体和分层旋转动画,还要正确维护六面转动、算法队列、撤销重做、25步确定性打乱、逆序复原以及供隐藏测试调用的cubeTestAPI。从运行记录来看,Qwen 3.8 Max Preview对任务难点理解得相当深入。它主动检查了动画速度、prefers-reduced-motion、applyAlgorithm()的默认参数、非法算法的原子拒绝、打乱种子的确定性、撤销重做历史以及animate:false下的Promise语义。它甚至已经开始考虑如何提取魔方引擎脚本并运行契约测试,说明其设计思路并没有停留在画一个“看起来像魔方”的界面。但这一次,过程没有转化成结果。在完成HTML写入和正式测试之前,任务出现Internal error: terminated bug。

第五题要求模型根据两条异常事件和一组恢复数据,直接生成一支可以播放的MP4。这一次Qwen成功完成了最终交付。生成的astraops-incident-review.mp4为1920×1080、30fps、15秒,共450帧,采用H.264编码和16:9画幅。视频没有使用真人、机房或无关素材,而是以AstraOps的深色网格、数据卡片、折线和流动节点构成完整的动态图形叙事。五个关键时间点全部出现了规定内容:片头展示AstraOps标志和“AI服务异常复盘”;Kestrel-R1阶段准确呈现4200ms、95.50%、+49.35%和“严重”;Nova-Pro阶段呈现3350ms、97.00%、+27.66%和“警告”,没有把恰好97%错写成低于阈值;恢复阶段则正确展示2448→2006ms、-18.05%、98.07→98.69%和+0.61个百分点。结尾以“让每一次异常都可解释”和Detect · Explain · Recover完成收束。视频并非四张静态页面的简单硬切。异常阶段的延迟折线会随时间上升,恢复阶段的延迟与成功率曲线分别向改善方向运动,卡片、节点和数据线承担了镜头衔接。所有文字和数字都是程序化绘制,因此停留期间没有生成式视频常见的跳字、融化和标志变形。主要问题出在对比度。片头日期、部分指标卡、恢复阶段的旧值以及结尾英文使用了较低透明度,在深色背景上显得过暗。Case 5证明Qwen 3.8 Max Preview的交付边界并不局限于网页和代码。它能够读取结构化事件,组织时间轴,再通过程序化渲染输出符合规格的最终媒体文件。虽然视觉精修还没有达到专业动效团队的水平,但从一份JSON到一支可直接播放的复盘视频,这已经是一个完整而有效的生产闭环。

成功交付的四项任务表明Qwen 3.8 Max Preview能够理解视觉输入,建立数据产品,维护复杂仿真状态,并把结构化信息转化为最终媒体文件。尤其是Case 2和Case 3,模型不仅做出了正确的界面,还通过了加权指标、时间边界、路径规划和烟雾扩散等确定性校验。这类能力比一张公开榜单更接近开发者真正需要的生产力。它最突出的优势,是对复杂需求的结构化拆解能力。面对长提示词时,Qwen通常能够识别哪些内容属于数据层、状态层、表现层和测试契约,并将它们组织到同一个交付物中。Case 2的统一筛选状态、Case 3的固定时间步与动态重规划、Case 5的数据驱动时间轴,都体现了这一点。它的第二个优势,是首轮交付的完整度。除Case 4外,其余任务都不是代码片段或半成品说明,而是可以直接打开、运行或播放的文件。模型也表现出较强的离线工程意识:使用原生SVG、Canvas、CSS和本地编码链路完成任务,没有依赖外部框架掩盖实现难度。但短板同样明确。第一是视觉精修。Qwen能判断页面由哪些元素构成,却不总能准确估计绝对尺度、留白和信息对比度。Case 1的整体缩小和Case 5的暗色文字都属于同一种问题:结构正确,最后一轮设计校准不足。第二是边界收尾。Case 2的时间筛选会丢失成本环比基线,Case 3的复杂占位依赖存在理论风险,Canvas人员选择也没有完整的键盘通道。这些问题不会破坏默认演示,却可能在真实用户和复杂输入下出现。第三,也是最重要的一点,是长任务稳定性。Case 4中,模型已经分析到API默认值、算法原子性、动画Promise和隐藏契约测试,却在交付前因内部错误终止。对于开发者而言,一次没有落盘的中断足以抵消大量高质量推理。模型能力的上限已经进入前沿第一梯队,优秀案例甚至接近可投入代码评审的水平;但视觉精修、极端边界和长任务成功率,仍然决定了它距离最可靠的旗舰模型还有多远。至于2.4万亿参数的开放权重版本能否保持同样能力、推理成本是否可控、社区能否真正部署,以及这次中断是偶发事件还是稳定性信号,都需要等权重、技术报告和更多独立复测出现后才能回答。但有一点已经可以确认:Qwen 3.8 Max Preview不是只靠参数规模制造声量。至少在这组测试中,它确实交出了几份足以让闭源旗舰认真对待的作品。

最新快讯

2026年07月22日

21:52
7月22日,据鼓狮财经报道,东北制药(000597.SZ)发布公告称,公司已正式收到国家药品监督管理局核准签发的《化学原料药上市申请批准通知书》,获批生产玛巴洛沙韦原料药。该药品为抗流感病毒药物,主要适用于成人和儿童流感患者。此次获批将有助于丰富公司产品管线,增强市场竞争力,但具体投产销售时间及实际销售情况仍存在不确定性。
21:52
鼓狮财经7月22日讯,长江证券(000783.SZ)发布公告,董事长刘正斌提议使用公司自有资金,通过集中竞价交易方式回购股份。本次回购金额不低于1亿元,不超过2亿元。回购资金将主要用于实施员工持股计划、股权激励,或用于维护公司价值及股东权益。
21:51
7月21日至22日,国务院国资委举办中央企业负责人研讨班。会议强调,要高质量实施新一轮国资国企改革方案,推动改革工作向纵深发展。 在改革重点上,会议提出明确要求:在主业管理方面,需进一步优化企业功能分类;在重组整合方面,要确保新组建企业起步即加速。在深化公司治理方面,要加强党委(党组)前置研究的实质把关,差异化完善二、三级子企业董事会建设;同时要强化经理层成...
21:51
今日,多家A股公司密集披露2026年半年报及业绩预告,业绩表现亮眼。其中,益生股份净利暴增近49倍,联讯仪器、南网数字净利最高预增均超9倍,中微半导净利增逾九成,贝达药业、奥浦迈等公司亦有预增公告。 以下是详细情况: 益生股份:上半年净利同比增4897% 公司公告称,2026年上半年实现营业收入16.97亿元,同比增长28.44%;归属于上市公司股东的净利润...
21:15
鼓狮财经7月22日讯,好上好(001298.SZ)发布公告称,公司于7月22日收到深交所上市审核中心出具的审核中心意见告知函。深交所审核确认,公司符合发行条件、上市条件及信息披露要求。目前,公司后续将向证监会履行注册程序。值得注意的是,该事项尚需获得证监会的同意注册,最终结果仍存在不确定性。
21:15
据鼓狮财经7月22日报道,保加利亚议会当日通过表决,批准美军在2026年7月24日至10月1日期间,于贝兹梅尔空军基地驻扎。具体部署内容包括最多8架美国空军KC-135空中加油机及其机组人员、最多250名配备个人武器的士兵,以及相关机场设备。 7月21日,保加利亚外交部证实已收到伊朗驻保加利亚大使馆发出的外交照会,内容涉及美军可能在该基地部署加油机一事。对此...
21:15
据刚果(金)卫生部7月22日发布的消息,该国埃博拉疫情累计死亡病例已达999例。本轮疫情由本迪布焦型埃博拉病毒引发,截至目前,刚果(金)与乌干达两国累计报告的死亡病例已超过1000例。 根据刚果(金)卫生部截至7月20日的统计,该国共报告确诊病例2473例,死亡999例。同期,乌干达卫生部数据显示,该国累计确诊病例为20例,其中2例死亡。 目前,刚果(金)共...
21:15
过去两年,人们热议AI时代需要什么样的人才,却鲜有人深究:AI时代到底需要什么样的教育?这个问题无人敢轻易作答,但硅谷的科技与金融精英们,早已用真金白银投出了答案。这两年,硅谷悄然兴起一股反常趋势:一群最信奉科技的人,正砸下数十万美元,将孩子送入一种“非典型”的新式学校。它们有一个共同的名字——替代教育。 这些所谓的替代教育,学费高昂得令人咋舌。今年秋天,曼...
21:15
2026世界人工智能大会的整体基调相较往年显得更为务实。本届大会以“智能伙伴 共创未来”为主题,在百余场论坛与活动中,超过10%的场次聚焦于智能体领域,大会遴选的十款“镇馆之宝”中亦有四款为智能体相关产品。作为行业发展的风向标,WAIC释放出新的信号:当前AI产业正告别参数与算力至上的“上半场”,全面驶入智能体落地、服务实体产业的“下半场”。 第一,产业技术...
20:44
7月22日,速达股份发布公告称,公司董事会秘书兼财务总监谢立智基于对公司未来发展前景的坚定信心及对公司价值的认可,决定提前终止原定的减持计划。谢立智同时承诺,自公告披露之日起六个月内,不再减持其持有的公司股份。截至公告披露日,谢立智在此次减持计划执行期间未进行任何减持操作,其持股数量及比例均保持不变。
20:44
据鼓狮财经7月22日报道,杭氧股份发布公告称,董事长郑伟提议在符合相关法律法规及《公司章程》规定的利润分配政策前提下,以2026年度中期分红股权登记日的总股本为基数,实施2026年度中期利润分配,且分配金额不低于公司2026年半年度归属于上市公司股东净利润的30%。
20:44
据鼓狮财经7月22日消息,永和股份(605020.SH)发布公告,宣布已取得中国工商银行衢州分行出具的股票回购专项贷款承诺函。根据该函件,银行承诺提供不超过2.7亿元的贷款,贷款期限为3年,资金将专项用于公司股份回购。 此前,永和股份已制定股份回购计划,拟动用资金1.5亿元至3亿元,用于实施注销减资及员工持股计划。