7月17日凌晨,Kimi K3 正式发布。作为全球首个开源的3万亿参数级别模型,它引发了广泛关注,甚至引来马斯克在线留言表示“Impressive”。随后,PitchBook 的私募市场分析师哈里森·罗尔夫斯更是将其比作引发美股动荡的火星。然而,大模型竞争已进入第三年,参数规模和基准测试分数已难以制造惊喜。对于真正使用 AI 的人来说,判断模型是否实现跨代升级,只有一个标准:它能否替代工程师完成工作。抛开那些夸张的叙事,我们更关心 K3 是否好用、易用。目前,大厂软件工程师已将 AI 编码工具作为日常。他们不是为了体验“AI 写几个 Demo”,而是在真实场景中使用 Coding Agent 来编写功能、调试、审查代码和搭建 Web 应用。因此,本次测试没有选择基准测试,而是直接向 K3 提交四个真实、复杂的任务,看它在完全放手、自主规划、编码和测试的情况下能走多远。

7月16日,测试的第一天,我让 K3 从零复刻游戏《GTA 5》。当 K3 完成任务时,我才真正感受到了“核弹”般的震撼。为什么 Coding 测试总拿《GTA 5》开刀?因为日常开发中,AI 最大的价值不在于写代码,而在于理解复杂系统并进行高效复现或创新。《GTA 5》不是一个简单的程序,而是一套集角色、物理、经济和任务系统于一体的复杂系统。模型不仅要写出能跑的代码,还要理解是什么让游戏变得“好玩”。因此,它成为了 AI Coding 的试金石。

第一关:让 K3 和 GPT-5.6 Sol 对决。此前几个月,我的主力 Coding 模型一直是 GPT-5.5。智谱 GLM 5.2 的 Coding 效果不差,但因缺乏多模态能力,主力模型始终固定为 GPT。多模态也是我使用 Kimi Code 的原因。这次我决定让 Kimi K3 和 Codex 同题 PK。在长达一天的测试中,我选择直接告诉 K3 和 Codex 做什么,让 AI 自主生成开发方案、提交提示词并编码,最后测试交付。先说结果,几个小时后,Kimi Code 提交了,而 Codex 只用了半小时。但在我的体验中,Kimi K3 压过了 GPT-5.6 Sol。Kimi 一次性生成了一个可用性和完整度都很高的 GTA 网页游戏,Codex 做出来的也能跑,但 K3 补充了很多游戏工程师才能get到的细节。体验下来,Kimi 做的 GTA 里,驾驶系统完善,地图包含城市、沙漠和海边。碰撞系统合理,NPC 受到攻击会有反应。警察系统是做得最惊艳的。Codex 只是生成了几个警察 NPC,而 K3 理解了追捕逻辑,生成了触发机制:犯罪后警车赶来、警察下车开枪、甚至有直升机搜索。这些细节不是简单写代码能出来的,说明模型真的理解了游戏机制。Auto 模式确实让我惊艳,推荐编程小白选择,对有经验的开发者也能省下盯防精力。

第二关:视频复刻。我让 K3 复刻一分多钟的《滚动的天空》视频,但效果明显不佳。K3 没有体会到游戏的紧迫感和速度核心,只是简单复刻了地图和功能。原因既受限于刚上线时的服务器波动,也涉及模型自身的优化问题。当 Coding 难度升级为视频复刻,AI 需要理解画面、动作、节奏和美术风格,而 K3 的“看”是将视频拆成帧,导致偏差放大,效果大打折扣。最终,在三个任务中,GTA5 惊艳,其他两个不成功,K3 仍存在“抽卡”问题。此外,K3 注重细节的代价是巨大的 Token 消耗。一天测试下来,4-5 个任务消耗了 699 元最高档会员 40% 的额度。粗略估计,K3 单任务成本是 GPT-5.6 Sol 的两倍,如果大量使用,对打工人负担较重。测试中,K3 最大问题不是能力,是额度。为了完成任务,Token Plan 额度被烧光后,我一度用 Kimi Work 来调用 K3。高峰期 Token 输出速度仅几十 token/s,单个任务生成时长超过 40 分钟。

第三关:为 Agent 设计软件。月之暗面从 K2 开始就将“Agent 集群”作为核心架构,强调多智能体协作。未来,软件使用者将不再是人,而是 Agent。传统的剪辑软件(如 Premiere、剪映)是为人设计的,包含时间轴、鼠标拖拽等,对 Agent 来说几乎不可读。Agent 需要数据结构、可调用端点和回调机制。为了测验 K3 的 Agent 能力,我让 K3 设计一个给 Agent 使用的剪辑软件。理论上这很适合 Agent,因为它不需要复刻产品,而是从需求出发设计系统。但最终结果并未惊艳。虽然 K3 Auto 模式在游戏里表现权威,但在设计 Agent 软件时仍需大量人工介入。播放功能初期只能播放一小段,需要不断指出问题并修正。回顾 GTA5 的成功,是因为有明确标准(如能不能开车、警察追不追)。而设计 Agent 软件没有标准答案,需要模型理解 Agent 的交互对象,删除人类操作按钮,改为 Agent 专属功能。这暴露了所有模型在 Coding 场景的边界:K3 已能生成软件,但尚未完全理解软件应如何为 Agent 设计。

那 K3 是否超过 GPT?我没有简单答案。在某些任务惊艳,复杂任务需人工介入。如果无限量供应,我会将其作为主力模型。这不是因为单项能力超越所有模型,而是它提供了完整的闭环,表现都在第一梯队。我们选择 AI Coding 工具的原因,早已从“代码更准”变为“能真正执行任务”。过去是人操作软件,未来是 Agent 操作软件。这影响到了模型迭代思路。如果无法解决这个问题,包括 K3 在内的模型都离真正的“AI 软件工程师”还有差距。K3 开了个好头。

最新快讯

2026年07月22日

01:07
鼓狮财经7月21日讯,奥精医疗(688613.SH)对上交所的监管问询函进行了回复。针对公司三名共同实际控制人的决策机制,奥精医疗明确表示:在股东会上,黄晚兰与崔菡(Helen Han Cui)按持股比例独立行使表决权;而根据《一致行动协议》,胡刚(Eric Gang Hu)需与黄晚兰保持一致行动,若内部出现分歧,最终意见以黄晚兰为准。
01:07
据鼓狮财经7月21日消息,五洲医疗发布公告披露,公司股东黄凡及其一致行动人邹爱英、项炳义、张洪瑜,连同张樑、陈晓如、周乐翔,与嘉兴汇芯企业管理合伙企业签署了股份转让协议。此次交易涉及股份总数为802.88万股,占公司总股本的11.81%,转让单价为48.53元/股,总交易金额高达3.9亿元。
00:37
鼓狮财经7月21日发布消息,五洲医疗发布公告,宣布拟通过发行股份及支付现金的方式,收购旋智电子科技(上海)有限公司100%的股权,并同步募集配套资金。标的公司专注于高集成度电机控制芯片的研发、设计与销售,其产品广泛应用于智能装备、白色家电、工业控制及汽车电子等领域。此次交易完成后,五洲医疗将正式切入电机控制芯片领域,旨在寻找新的业绩增长点。目前交易价格尚未确...
00:37
鼓狮财经7月22日电,美国白宫当地时间7月21日发布声明称,美国总统特朗普已与约旦达成一项贸易协议。该协议旨在消除美国出口商长期面临的贸易壁垒,并为美国关键产业开辟新的市场准入机会。声明指出,这一协议建立在双方长期经济关系基础之上,其中包括2001年12月17日正式生效的《美约自由贸易协定》。
00:37
鼓狮财经7月22日讯,SpaceX正拉开资本市场历史上规模最大的一次股票解禁序幕。下个月,价值高达1160亿美元的股票将首次具备出售资格。这批涉及9.115亿股的股票,其禁售限制将于8月6日解除,时间点紧邻该公司首次公布季度财报的前两天。值得注意的是,这仅仅是解禁周期的开端,预计到今年年底前,还将有数十亿股股票陆续获得交易资格。
00:36
鼓狮财经7月22日报道,美国总统特朗普于当地时间7月21日会见了黎巴嫩总统约瑟夫·奥恩。双方此前已多次通过代表保持沟通,关系十分融洽。特朗普指出,黎巴嫩长期遭受不公正对待,美国承诺将提供支持。会谈期间,双方将探讨黎巴嫩军队接管真主党撤出村庄的议题,特朗普透露美方已制定具体计划,并计划联合其他各方共同协助。此外,特朗普还表示,若奥恩总统有此意愿,美方愿意与真主...
00:29
7月22日,Alphabet旗下谷歌周二发布三款成本更低的Gemini人工智能模型,但备受瞩目的旗舰版Gemini 3.5 Pro发布时间仍未公布。受此消息影响,美股盘中谷歌股价下跌约0.8%。 此次推出的新模型阵容包括Gemini 3.6 Flash和Gemini 3.5 Flash-Lite,两者均为现有轻量级模型的升级版本,主要适用于对算力要求不高的应...
00:06
鼓狮财经7月21日讯,联合国人权事务高级专员办事处发言人萨明·希坦在日内瓦举行的记者会上表示,近期以色列对加沙地带的军事打击力度持续加大。数据显示,仅7月13日至20日,以色列的袭击就已造成至少57名巴勒斯坦人死亡。希坦指出,在巴以停火宣布九个月后的今天,加沙地带的巴勒斯坦人依然无处寻求安全。 以7月17日至18日为例,以色列在加沙城、北加沙省及南部汗尤尼斯...