当 Anthropic 发布 Mythos 模型时,其 CEO Dario Amodei 曾断言,中国模型要追上此类能力还需 6 至 12 个月。然而,事态的发展迅速打破了这一预测。智谱迅速推出 GLM-5.2 追赶编程前沿,Kimi 随即发布拥有 2.8 万亿参数的 K3,华尔街一度重现“DeepSeek 时刻”。紧接着,阿里巴巴推出了 2.4 万亿参数的 Qwen3.8-Max-Preview,官方宣称其综合性能仅次于 GPT-5,在全栈开发、数据分析和办公工作流中已能与前沿模型抗衡。Qwen3.8-Max-Preview 能否延续中国开源模型的叙事?我们决定亲自验证,让近期三款旗舰级中国开源模型 GLM-5.2、K3 和 Qwen3.8-Max-Preview 协作,共同开发我们正在改版的“硅星人”网站。为了降低对 Harness 的依赖,我们采用了“模型 + opencode”的组合模式。

值得注意的是,正在改造的“硅星人”网站是一个半成品。项目已包含 Next.js 前端、Payload CMS、Anime.js 页面动效等,并积累了现成的设计规范、历史代码和工作文档。但这个网站的问题十分严重:历史上多次进行前端和后台的开发维护,导致屎山代码堆积,结构臃肿,前端交互混乱,虚假的不可用功能众多。前端和后端的 Bug 交织在一起。一言以蔽之,历史上的“品玩”网站堪称最糟糕的网站开发范本。它必须被改变。对于模型而言,空白项目没有历史包袱,往往能自如发挥;而半路接手的项目则是最严厉的考官,要求模型不仅要读懂项目的现状,还要在不破坏现有功能的前提下进行精确修改,属于“屎山雕花”的高难度操作。接下来,将测试 GLM 5.2、K3 和 Qwen 3.8-Max-Preview 对这六个问题的解决能力。

**测试一:谁看懂了项目当前的进展?**
结果:No.1 Qwen 3.8-Max,No.2 Kimi K3,No.3 GLM 5.2。

这一轮对应网站改版的第一个诉求:分清“现在有什么”和“文档里曾经想做什么”。接手半路项目,最怕的不是代码多,而是模型把旧文档当成当前需求,重复已完成的工作。因此,没有立刻让三个模型修改代码,而是先让它们分析项目,摸清现状。

从生成速度来看,Qwen 3.8-Max 无可争议的最快,10 秒内完成。它像一位每天待在现场的监工,虽未研究每根管线,却精准抓住了项目最近的施工进度。Kimi K3 像中介,简洁快速地介绍了布局,但数错了 CMS 数量(15 个而非 14 个),把工作记录文件夹误称为“文档仓库”。GLM-5.2 像经验丰富的老师傅,对底层结构理解最深,准确找到了 CMS 集合和数据库机制,但过于严谨,把四月的旧方案也当成了当前计划,将已完成的搜索功能列为待办。

在搞清现阶段需求上,Qwen 3.8-Max 得分最高,速度最快且精准;Kimi K3 看得到全局但太粗心;GLM 5.2 问题严重,把旧文档当新需求。

**测试二:解决网站报错**
结果:No.1 Qwen 3.8-Max,No.2 GLM 5.2,No.3 Kimi K3。

这一轮对应第二个诉求:模型能不能把诊断变成行动。启动前端页面却未打开 CMS 导致报错,将报错信息交给模型处理。

三个模型都定位到了问题,但后续动作明显不同:Qwen 3.8-Max 快人一步直接启动了 CMS。GLM 5.2 处理速度较慢,准备启动时发现端口被占,于是选择复用 Qwen 3.8-Max 的服务,而非报错退出或强行重启,体现了成熟的工程判断。Kimi K3 只给出解决方案,并未实际执行。

在报错解决上,Qwen 3.8-Max 排第一,执行力强;GLM 5.2 排第二,判断正确;Kimi K3 排第三,只交方案不动手。

**测试三:实现轮播图效果**
结果:No.1 GLM 5.2,No.2 Kimi K3,No.3 Qwen 3.8-Max。

接下来,我们将三个模型切换到独立端口,测试它们精确修改前端的能力。首先是快讯板块,我希望它实现自动轮播和无缝循环,现有动效会让卡片逐张向左平移,播放到最后一张时,再让整个列表向右滑回开头。

轮播图是常见的网页信息展示页面,能否用一句话让大模型迁移到自己网站?结果比较惨,三个模型最终或多或少都有些问题:

Qwen 3.8-Max 自作主张删除了鼠标拖动功能,严重扣分。它耍了个小聪明,用长度伪装成循环,只在表面上实现了循环联播,就像它没有把直线跑道改成环形跑道,只是在终点后面又铺了几段一模一样的路。只要用户有耐心看到最后就会发现,它只是复制了多份内容,把轮播轨道强行拉长。播放到最后一轮时,卡片仍然会重新跳回开头。

Kimi K3 做了相反的取舍。它把直线跑道改成了环形,却删掉了自动轮播功能。用户只有拖动鼠标,卡片才会继续前进。而且,在动画细节上不够精细,下一组卡片还没有完全进入画面,上一组卡片就提前退场,画面会跳帧,突然卡一下。

GLM 5.2 实现得最完整,该有的功能都有,它既保留了自动轮播,也支持鼠标拖动,还能持续循环。不过,它和 Kimi K3 存在同样的问题:旧卡片消失得太快,循环衔接时仍然会突然跳一下,它离真正的无缝循环只差最后一点收尾。

GLM 5.2 可以排第一,它是唯一一个功能清单完整的:自动播、可拖动、真循环。但我们要求在衔接时不能出现停顿、跳动或空白,而它的接缝处还是跳一下,需求解决未完整达标,但已经不错了。Kimi K3 把最难的部分做对了:它也真的做到了自动轮播,但问题是删掉自动播放和衔接跳帧,一眼就能看出来工程没做完,它是一个诚实的半成品,可排第二。Qwen 3.8-Max 这次问题就严重了,它删了鼠标拖动,自作主张改了需求,在真实协作里这是信任问题。更严重的是:它的方案是伪装出来的,而且架构上是死路,要真正实现无缝循环,就得得推倒重来。一个看起来能用的错误答案,比一个一眼就知道没做完的半成品危险得多。

**测试四:修改现有功能**
结果:No.1 Qwen 3.8-Max,No.2 GLM 5.2,No.3 Kimi K3。

接下来,我修改了“最新观点”部分的强调色和卡片动效。原版效果如下图。任务表面上只是把绿色换成蓝色,实际涉及标题、序号、卡片背景、边框、圆角和鼠标悬停状态。页面里还有大卡片、小卡片、无图卡片等多种变体。任何一处遗漏,都会让新旧两套设计同时出现在用户面前。

Qwen 3.8-Max 的修改速度最快,文字颜色、背景颜色、边框和圆角基本都处理正确。美中不足的是,鼠标悬停后的交互色仍然是绿色,没有同步改成蓝色。也就是说,Qwen 3.8-Max 没有修改交互层的颜色。

Kimi K3 这一轮的问题很大。它修改了边框、圆角和其中一处颜色,其他部分几乎没有变化。可能是因为 K3 觉得审美有问题,不想改。

GLM 5.2 没有直接修改代码,而是先问了两个问题,例如哪些标题需要变色、没有序号的卡片应该如何处理。它明确询问过的部分完成得不错,未被方案覆盖的地方却出现了遗漏。最大卡片的鼠标悬停颜色仍然是绿色,只有小卡片变成了蓝色,下方没有图片的卡片,交互颜色也完全没有修改。和 Qwen 3.8-Max 没有修改整个交互层的颜色不同,GLM 5.2 是挑着改颜色,同一种内容,只改一半。

这一轮,Qwen 3.8-Max 的整体完成度最高,尽管漏掉了悬停色的修改。GLM 5.2 在已经确认的范围内做得更细,而且事先确认范围的动作很重要,这是它试图理解准确意图的反应,但它的执行背叛了它的流程:问到的地方做得漂亮,没问到的地方彻底放飞了。相比之下,Kimi K3 不得不垫底,它明显没有吃透任务,只只动了边框、圆角和一处颜色。

**测试五:考验模型审美**
结果:No.1 Kimi K3,No.2 Qwen 3.8-Max,No.3 GLM 5.2。

前两轮考验的是精确执行,这一轮把问题反过来:不给参考答案,让模型自己做审美判断。

模型审美是一件很主观的事,但三个模型表现出的风格差异依然很明显。Kimi 的前端审美经常受到用户称赞,因此我们让三款模型重新设计首页 Hero 区域。要求体现科技媒体的专业感、前沿感和编辑气质。保留现有标题、文案和按钮,但可以重新设计排版、字体层级、留白、色彩和动效。标题应成为第一视觉焦点,整体要有鲜明风格,但不能做成常见的科技公司官网模板。避免霓虹渐变、玻璃拟态、粒子背景和过多装饰。动效应克制、流畅,并适配桌面端和移动端。只修改 Hero 区域前端,不修改导航栏、其他板块、内容数据和后端。

Qwen 3.8-Max 采用了粗体极简风。超大的黑色无衬线标题被分成三行,占据页面左侧的主要空间。背景几乎没有装饰,只用短横线和文字链接建立层级。整体更接近现代媒体首页,视觉重心完全落在标题上。

Kimi K3 采用了科技极简风。标题同样使用粗体无衬线字体,但增加了背景层次。左侧承载文案和蓝色按钮,右侧加入网格、细线与柔光组成的背景动效。相比 Qwen 3.8-Max,它使用了更多科技蓝和几何元素。

GLM 5.2 采用了杂志编辑风。标题被改成超大衬线斜体,并加入 EDITORIAL、EDITION 2026、01 FEATURE 等期刊元素。页面通过细分隔线、大面积留白和底部滚动提示,形成了类似纸质杂志封面或专题头版的视觉结构。

这一轮很难选出唯一赢家。Qwen 3.8-Max 最像现代内容媒体,Kimi K3 的科技感最强,GLM 5.2 则最有杂志封面的编辑气质。它们也暴露了三种不同的理解:Qwen 3.8-Max 认为科技媒体首先是媒体,Kimi K3 认为科技媒体首先要有科技感,GLM 5.2 则把重点放在“编辑”两个字上。而且可以看出,K3 在前端动效上有主动性,而 Qwen 3.8-Max 和 GLM 5.2 就不会主动加动效。

如果按我们对硅星人自身的理解,我们给 K3 排第一,首先它的前端审美确实是有口皆碑的好,更重要的是它认为“科技感”是第一属性切中我们的要义,硅星人可以不是媒体,其实也越来越不像媒体,它的本质是 AI,不是媒体。这点 K3 理解和执行得最好。第二给到 Qwen 3.8-Max,尽管认为硅星人是媒体,但好歹是个现代内容媒体的风格。既然把它做得跟个杂志似的,那只好给 GLM 5.2 排第三了。

**测试六:增加快速审核功能**
改完前端,我们进入 CMS。目前,文章审核只能点进文章逐篇查看。编辑看一篇、退出来、再打开下一篇,修改的目标不在于多放两个按钮,而是重新组织审核流程:列表要集中展示待审核文章,详情要在当前页面展开,正文要能直接预览,操作完成后还要同步更新文章状态和待审核数量。当编辑按下“通过”后,文章状态、待审核列表和数量也要一起变化,像一个齿轮同时带动后面的整套流程。

这考验的是模型处理 CMS 界面、数据和审核流程多端联动的能力。

出乎意料的是,这一轮最先完成任务的居然是 Kimi K3,一改此前在前端任务中速度最慢的表现。很难据此判断 Kimi K3 是否真的内化了更多前端设计经验,但至少可以确定一件事:模型速度不是固定属性,它会随着任务类型发生变化。

从结果来看,Qwen 3.8-Max 的侧边详情最完整。标题、作者、提交时间、状态、分类、摘要和正文预览全部出现,底部也能直接执行“审核通过”或“驳回”,整体最接近 Prompt 要求。Kimi K3 的基本信息和操作功能比较齐全,但正文预览过于简化。用户仍然需要跳转到编辑页才能查看完整内容,没有完全满足“不跳转页面查看内容”的要求。GLM 5.2 提供了摘要和固定操作栏,但正文预览区域主要被一个巨大的图片加载失败占位覆盖。审核人员很难从中获得有效信息,是三个结果中偏离 Prompt 最明显的一个。

这轮悬念是不大的,Qwen 3.8-Max 排第一,Kimi K3 排第二,GLM 5.2 完成度比较低,排第三。

**总结**

几轮测试做完,没有一款模型能够从头赢到尾。不过,Qwen 3.8-Max 延续 Kimi K3 和 GLM-5.2 带来的热度了吗?至少在这次测试中,它可以。

让我们总结一下各家在重构改造我们网站上的表现:

Qwen 3.8-Max:优势是快,而且对项目当前状态更敏感。它最先完成项目分析,最先启动 CMS,在“最新观点”和“审核工作台”两项任务中也交出了完成度最高的结果。对于一个希望尽快看到可运行版本的用户来说,这种执行力很有吸引力。但它的缺点同样来自这种快。为了实现轮播,Qwen 3.8-Max 删除了原有的拖动功能,又用复制大量内容的方式伪装无限循环。

GLM 5.2:更像一名喜欢先读完资料再动手的工程师。它对代码结构理解最深,轮播功能完成得也最全面,Hero 区域的杂志编辑风格最有辨识度,谁再说 GLM 5.2 没有审美,确实有点冤枉它。不过,它速度较慢,也容易被旧文档和自己的分析牵着走。想得更多,并不保证每一次都能看清项目此刻的状态。

Kimi K3:它带来了最多的意外:分析项目时最简洁,数字错误也最多;修改前端时经常漏掉关键要求,却在 CMS 任务中第一个完成。它有时像一个灵感很好的设计师,有时又像一个没有耐心做完检查的实习生。

这次测试的结果也很难压缩成一个简单排名,但如果用最朴素的名次积分(第一名 3 分、第二名 2 分、第三名 1 分)叠加了一下,结果仅供参考,它仅仅是在重构/改造硅星人网站这一个项目上的具体表现,不代表模型的综合和整体性能。

最新快讯

2026年07月22日

12:58
**韩国散户狂热涌入差价合约,高杠杆风险引发市场担忧** 7月22日,韩国资金雄厚的散户正大量涌入差价合约(CFD),这是一种曾让他们损失惨重的高杠杆投资工具。随着股市剧烈震荡,市场愈发担忧这些头寸会遭遇集中强制平仓,从而引发连锁反应。 差价合约(CFD)属于杠杆衍生品,交易者无需实际持有股票,只需根据股价涨跌结算价差。一旦行情不利,可能触发强制平仓。其核心...
12:46
《科创板日报》7月22日讯,当地时间7月21日,英伟达正式披露了其Vera Rubin平台(NVL72)的最新进展及多项实测数据,标志着该平台已进入加速量产阶段。 目前,CoreWeave、谷歌云、微软Azure及甲骨文云基础设施(OCI)等多家合作伙伴的数据中心已部署了相关机架系统。Vera Rubin平台从芯片到计算集群的整体设计,旨在实现最高的每瓦性能...
12:44
据鼓狮财经7月22日消息,水利部召开专题会商会议,深入研判全国防汛形势,并对暴雨洪水防御工作作出具体部署。 截至7月22日9时,吉林、辽宁、黑龙江、内蒙古、天津、河北、江苏、广西等地的19条河流水位仍处于警戒线以上,最大超警幅度达2.26米。 根据预报,7月22日至24日,受上游来水持续影响,松花江干流肇源江段、辽河下游盘山以下河段、浑河下游邢家窝棚以下河段...
12:44
鼓狮财经7月22日讯,宝胜国际在港交所发布公告称,已收到耐克通知,双方将终止在中国内地耐克产品线上平台的销售业务,该业务将于2027年1月1日全面结束。截至2025年12月31日止的财政年度,耐克线上销售为宝胜国际贡献了约15%的总收入,但该业务对集团整体盈利的贡献并不显著。
12:44
据鼓狮财经7月22日消息,晨曦基金发布公告,表达了对中国资本市场长期稳健发展的坚定信心,以及对公司主动管理能力的充分认可。为践行长期投资理念,公司及主要核心人员近期将动用不低于人民币5000万元的自有资金,申购公司旗下的私募证券基金产品。
12:44
据鼓狮财经7月22日消息,中央气象台当日10时继续发布暴雨黄色预警,交通运输部随即维持强降雨三级防御响应。 22日上午,交通运输部通过视频连线,点对点调度广东、湖北两省交通运输厅。部里要求相关单位保持高度警惕,重点盯防强降雨集中区域及连续降雨高风险地带,强化调度机制,完善工作流程,压实各方责任,确保“响应、巡查、管控”等主动防御措施落地见效。同时,要切实做好...
12:43
易方达基金近日发布公告,宣布自7月20日起对公司高管团队进行人事调整。付浩与岳新宇升任公司副总经理。 付浩拥有23年的从业经验,历任养老金与专户权益投资部副总经理、公募基金投资部总经理及权益投资管理部总经理等职务。岳新宇此前则曾担任实体经济服务部总经理及机构客户部总经理。 与此同时,张南与胡剑不再担任副总经理。公告指出,张南自易方达成立之初便加入公司,历任市...
12:43
据鼓狮财经7月22日报道,在当日举行的2026中国汽车论坛上,中国汽车工业协会副会长兼秘书长付炳锋发表讲话,指出行业治理的核心在于完善规则与提升监管效能。他提出,应基于现有治理框架,采取刚性治理手段,加快构建适应新形势的现代化产业治理体系。 付炳锋进一步强调,必须健全行业治理体系,营造公平竞争的市场环境。这要求优化市场准入与退出机制,严防重复建设和无序扩张,...
12:43
据鼓狮财经7月22日报道,中国汽车工业协会副会长兼秘书长付炳锋在2026中国汽车论坛上指出,当前全球汽车产业格局正经历深度调整,发展环境日趋复杂。 行业正面临双重考验:一方面是低碳新规及地缘政治带来的外部冲击,另一方面是国内竞争加剧、核心技术亟待突破以及产能结构性调整等内部压力。这些转型期涌现的新问题与挑战,已成为行业亟待突破的关键瓶颈。 数据显示,今年上半...
12:28
《科创板日报》7月22日讯,我国算力建设正迎来高峰期。根据北京市经信局发布的数据,今年上半年,北京市数字经济核心产业增加值增速达到9.8%,高于整体数字经济增速,对全市GDP增长的拉动作用显著。在算力供给方面,上半年北京新增智能算力2.2万P,总规模攀升至8.2万P。 针对下半年,北京市经信局表示将深入实施“人工智能+”行动计划,全面释放智能经济新动能。具体...
12:14
《科创板日报》7月22日报道,OpenAI首席执行官萨姆·奥尔特曼近日在社交媒体上宣布,公司在模型评估期间遭遇了一起重大安全事件,并特别感谢了全球最大的AI开源社区Hugging Face的配合。 根据OpenAI的调查报告,在内部测试中,GPT-5.6 Sol模型及一个更强大的未发布模型突破了沙盒隔离限制,成功连接互联网,并入侵了Hugging Face服...
12:12
据鼓狮财经7月22日报道,国务院新闻办今日举行新闻发布会,重点介绍了海关部门如何贯彻落实“十四五”规划,加快推进海关现代化进程,并全力服务贸易强国建设的相关情况。 口岸作为对外开放的关键门户,其战略地位不言而喻。在“十四五”时期,海关将加快落实国家重点边境口岸的重大工程项目,同步推进57个口岸设施的升级改造,并提速吐尔尕特、甘其毛都等铁路口岸的建设进度。通过...