谷歌 DeepMind 宣布推出三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。然而,备受期待的 3.5 Pro 正式版依然缺席,取而代之的是这一系列被称为“阉割版”的模型。就在昨夜,这些模型在 Vertex AI 上线后,口碑遭遇了滑铁卢,被用户戏称为“史上最差”。
尽管谷歌声称 3.6 Flash 比 3.5 Flash 和 3.1 Pro 更具性价比,但实测结果令人失望。
**前端生成与代码能力崩盘**
Gemini 3.6 Flash 的前端能力全线崩盘。在代码竞技场中,它不敌 Meta 的 Muse Spark 1.1。开发者进行 2-shot 测试后发现,输出的界面代码逻辑错乱,组件嵌套混乱,交互逻辑断裂,完全无法投入实际使用。开发者社区迅速传播着“这是我真正见过的最差结果”的截图和评论。
**空间推理能力退步**
在空间关系理解方面,模型表现同样糟糕。它对基础位置关系和方向判断的准确率相比 3.5 Flash 明显下降。即便开启“高性能”模式,测试中仍出现木纹纹理渲染错误、大理石反射 bug 等问题。在 CursorBench 上,它甚至输给了 Cursor 的 Composer 2.5。
**综合性能不敌竞品**
谷歌官方测试显示,Gemini 3.6 Flash 在代码任务上已被其他模型超越,仅在视觉和上下文基准测试中保持领先。第三方评测 Artificial Analysis 的数据显示,其得分与 3.5 Flash 相同,落后于 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5 等众多模型。此外,有网友发现其知识截止日期存在造假嫌疑:它声称更新至 2026 年 3 月,但实际上对 2026 年及大部分 2025 年的内容一无所知,知识库似乎仅停留在 2025 年 1 月。
**Flash-Lite 与 Cyber 模型**
Gemini 3.5 Flash-Lite 主打速度快,每秒可输出 350 个 token。但速度优势在错误答案面前毫无意义,且其价格更高、效果更差。此外,谷歌还发布了网络安全模型 Gemini 3.5 Flash Cyber。
**3.5 Pro 延期与 AGI 竞争的隐忧**
在算力紧缺的时代,发布一个逻辑混乱的模型是否是渎职?有用户讽刺称,DeepMind 这种浪费算力的行为,不如将资源转让给 Moonshot 等竞争对手。这番言论背后,是对谷歌“版本号游戏”的深层厌恶。谷歌在公告中提到,3.5 Pro 尚未完全准备好,而 Gemini 4 已启动“目前最雄心勃勃的预训练”。据推测,3.5 Pro 的开发进展并不理想,因此谷歌启动了全新的、规模空前的预训练课程。
谷歌这种“赶鸭子上架”、败坏口碑的做法究竟图什么?它还能在 AGI 竞赛中占据一席之地吗?
