千问最近宣布它能帮我拼九宫格了,而且还是多主题的。其实,阿里刚刚发布了一款名为 Qwen-Image-3.0 的新生图模型。官方宣称它不仅能准确生成仿真 UI 界面,还能帮老师一键生成排版精良的期末试卷,设计师也能用它快速输出海报、分镜和网页原型,省去搭建框架的时间。更夸张的是,它能在单张图中同时呈现 9 份不同主题的知识图解,并自动整齐排布,兼顾信息密度和美观度。这次,Qwen-Image-3.0 的核心关键词只有一个字:实。它不仅追求好看,更注重细节和实用性。
官方将这种“实”拆解为三个层面。第一层是细节真实,支持 10px 小字精准渲染,笔画笔锋、人物毛孔、发丝、纸张、批注等细节都能稳住。第二层是内容丰实,最长支持 4.5k token 输入,能生成报纸、分镜、试卷、PPT 等复杂版面。第三层是知识厚实,支持 12 国语言原生渲染,能生成网页、游戏、直播等常见 UI 界面,甚至能结合世界知识做科普海报。
虽然外测显示其图像理解和代码生成能力已超过 GPT Image 2、Nano Banana 2 等海外模型,但图像模型的发布样例往往只展示最好的一面。真正落实到编辑、教育、电商等实际场景,还得看实际效果。因此,围绕官方提出的三个方向,我们设计了 9 道实测题,全面检验它的“装、稳、细、懂”能力。
**第一关:细节真实度测试**
我们选择最难处理的学术论文页作为开刀对象。论文包含密密麻麻的小字、上下标、希腊字母、分数线、多行公式推导。远看像论文不算数,放大后还要清晰不糊才行。
测试一:学术论文公式页。排版工整,字迹清晰,通过了。
测试二:萌宠与主人的近景肖像。人物皮肤纹理、发丝质感、服装材质、猫咪表情都在线,氛围感十足。就是速度慢了点。
测试三:读书笔记。在原图上模仿手写笔记。虽然出现了一个同音错字,但整体抓得很准,批注自然,甚至展现了从“吃人”到“虚伪”的思考过程。指出错误后修改也很快。
**第二关:复杂需求承载能力测试**
很多模型元素一多就失控。Qwen-Image-3.0 支持长输入,我们用九宫格题来测试其承载能力。
测试四:复杂的九宫格知识图解。表现不错。
测试五:高中数学模拟试卷。生成一张真实的高中数学模拟试卷。第一次尝试翻车,内容错乱。第二次尝试生成具体题目,结果它只给了题目文本。第三次尝试,用 Qwen 自己的提示词生成,终于成功了,像高三模拟考试卷。这让我发现提示词适配很重要。建议步骤:1. 发给千问生成专用提示词;2. 复制 Markdown 模板;3. 拼合 Word 题库和提示词一起生成。
测试六:一条提示词生成完整视觉初稿。用提示词生成发布会海报、分镜和移动端原型。它成功将三种不同视觉任务规整地放进一张图里,方便设计师参考。
**第三关:场景认知与知识厚度测试**
这考验模型对世界规则和场景的理解。
测试七:日文美妆直播间。生成日文美妆直播间界面。不仅要日文正确,还要符合日本直播电商的布局。效果良好。
测试八:多语种杭州夏日旅游海报。生成包含中文、英文、日文的杭州夏日旅游海报。标题、时间、地址、图片齐全,且无错字。效果漂亮。
测试九:仿一个量子位公众号界面。生成量子位公众号文章页。要求包含顶部导航、账号信息、标题、首图、互动按钮,还要有主编夸奖的弹窗。细节(时间、电量)都有,但整体风格有点像“混血”,是几个平台的混合体。
**总结:你很出色,但确实还有一些不足**
9 道题测完,Qwen-Image-3.0 在细节、多语言和复杂布局上进步明显。但它距离“放心拿来干活”还有差距。速度、准确度、复杂场景下的稳定性仍有问题。比如西班牙语学术图出现拼写错误。不过,它确实能完成复杂任务,只是还需要更精细的打磨和提示词适配。希望后续版本能解决这些痛点。
