千问最近宣布它能帮我拼九宫格了,而且支持多种主题。就在两天前,阿里巴巴推出了这款名为 Qwen-Image-3.0 的新 AI 生图模型。根据官方描述,它不仅能精准生成仿真 UI 界面,还能一键为老师生成排版精良的期末试卷;设计师也能利用它快速输出海报、分镜和网页原型,省去从空白画布一点点搭建框架的时间。更令人惊叹的是,它能在单张图中同时呈现九份不同主题的知识图解,并自动完成整齐排布,兼顾信息密度与美观度。这次,Qwen-Image-3.0 的关键词只有一个字:实。这并非单纯追求更好看,也不是只卷画风、构图或光影,而是希望 AI 作图能走出“哇,好漂亮”的惊叹,更进一步:这图能不能装下我的所有需求?能不能把细节画清楚?能不能直接拿去修改、使用或交付?
官方将这个“实”拆解为三个层面:第一层是细节真实,支持 10px 小字精准渲染,笔画笔锋、人物毛孔、发丝、纸张质感及批注等细节都能稳住;第二层是内容丰实,最长支持 4.5k token 输入,能生成报纸、分镜、试卷、PPT 等复杂版面;第三层是知识厚实,支持十二种语言原生渲染,能生成网页、游戏、直播等常见 UI 界面,甚至能结合世界知识制作科普海报。外网已有用户上手测试,结果显示 Qwen-Image-3.0 在图像理解和代码生成上的表现,已经超过了 GPT Image 2、Nano Banana 2 等海外模型。
听起来确实很猛。但图像模型的发布演示,向来存在一个老问题,即“官方 demo 通常展示的都是最顺的一面”。真正到了编辑、教育、电商、设计等场景里到底好不好用,不能只看宣传页怎么写,也不能只看生成图第一眼漂不漂亮,还得亲自上手测。因此,在收获一片掌声的同时,网上也出现了不少对 Qwen-Image-3.0 的吐槽,有人觉得“速度慢”,有人吐槽会“混淆术语”、“不懂语法”,甚至还有网友指出官网封面图里的阿拉伯语语法存在问题。基于此,我们围绕官方提出的“内容丰实”、“细节真实”、“知识厚实”三个方向,设计了九道具体的实测题,把测试额度测了个精光,看看它到底能不能装、能不能稳、能不能细、能不能懂,以及最关键的:能不能真的帮我们干活交差。
首先看它细节真不真实,放大后会不会露馅。开场就先拿最不讲道理、也最容易露馅的学术论文页开刀。论文页看似朴素,实则全是生图模型的雷区:密密麻麻的小字、上下标、希腊字母、分数线、多行公式推导……远看像论文不算数,放大后还能清清楚楚、不糊不乱,才算真本事。实测一:学术论文公式页。提示词如下,效果如下(用时约 3 分 20 秒):排版工整、字迹清晰,扛住了。出于好奇,在等待生成图片的间隙,我们还用同一套提示词测试了 ChatGPT Plus 版,结果如下(用时约 1 分 19 秒)。
测完论文,让我们来看一张治愈感满满的《主人与猫》。提示词:效果如下。人物皮肤纹理、发丝质感、服装材质、猫咪标配的傲娇表情等统统在线,氛围感十足。就是生成速度慢了点(用时约一分半)。
众所周知,生成一张新图是一回事,在原有图像上做精细编辑则是另一回事。所以我们这次要测的是 Qwen-Image-3.0 能否在不破坏原图结构的前提下,模仿高中生记课堂笔记的习惯,给鲁迅先生的《狂人日记》加上重点笔记。提示词:效果如下。在这个过程中,虽然出现了一处同音错字“叶”(应该是“页”),但整体来看,它对著名段落的抓取很准,没有魔改原文,批注也像手写,有真实的人类思考痕迹和红笔笔记,与纸张纹理的融合也比较融洽。最让人惊叹的是,它模拟并展现出了学生们从“看到‘吃人’一词的不解到分析出‘虚伪’本质”的真实思考过程。后续在对话中指出错误后,Qwen-Image-3.0 马上就改好了。
再看它能不能把复杂需求都装进图里。细节能画好只是第一关。很多生图模型并非不会画图,只是画面里的元素一多,排版就开始失控。针对这一痛点,Qwen-Image-3.0 把输入长度拉到了 4.5k token。第二关就用一道最直观的九宫格题来验验它的实际承载能力和横向铺开能力吧。实测四:复杂的九宫格知识图解。提示词如下:表现不错,过关。
接下来,让我们再测测 Qwen-Image-3.0 生成模拟试卷的能力。提示词:生成一张真实打印感的高中数学模拟试卷,A4 竖版,中文排版。顶部包含学校名称、考试名称、姓名和准考证号填写栏。第一部分为 6 道选择题,每题有 A、B、C、D 四个选项。第二部分为 4 道填空题。第三部分为 3 道解答题,其中包含一道带坐标轴和抛物线示意图的解析几何题,以及一道立体几何题。页面底部留出规范答题区域和横线。试卷应像真实教辅资料,题号连续、版面规整、公式清晰、图文不重叠。 OMG,翻车的一幕出现了……第一次生成的效果并不理想。我勒个去,怎会如此?难道测到一半就要翻车了吗?刺激!考虑到可能是因为没有在提示词内要求“具体题目”和“北京地区”,所以我进一步补充了具体要求,并请 Qwen-Image-3.0 帮我生成一份有具体题目的北京高考试卷。不过很遗憾,它这次竟然直接放弃了生图,但给了我一套标准的试卷题目,并在结尾标明了该套试卷的难度系数和题目设置的合理性,让我自行排版。不过亲爱的 Qwen-Image-3.0,我怎么可能乖乖就范?!不然还测你干嘛?于是情绪稳定的我将它给的试题整理到了文档中,并再次试图请求它据此生成一套试卷:很可惜,均不成功,而且这次它问题更大了。它不只是无法生成一套完整的试卷,还在未告知的情况下私自篡改了题目顺序,并吞掉了设计的其他 9 道题目(包括 2 道选择题、2 道填空题、5 道解答题)。啥情况……难道它牛吹大了?还是我的方法出了问题?我突然反应过来,会不会不是模型不行,而是我一开始就没用对它的打开方式?前两次我都是习惯性地让 Codex 帮我写提示词,再丢给 Qwen-Image-3.0 生图。问题会不会就出在这里,Qwen-Image-3.0 其实更吃自家模型生成的提示词?既然如此,那就试试看吧!来都来了!!!秉持着绝不轻易放弃的精神,我进行了第三次尝试:先用千问重新生成一套提示词,再交给 Qwen-Image-3.0 生图。还好,这次成功了!而且效果不错,很像我高三每周模拟考的试卷。这也让我发现,问题不在于模型本身,也不在于提示词要表达的内容,而在于“适配”。如果你也想让 Qwen-Image-3.0 帮你生成一份试卷,那你最好按这三步去操作:第一步,先把题库发给千问,让它基于这套题库生成一份适配 Qwen-Image-3.0 的专用提示词。第二步,复制千问给出的 Markdown 提示词模板。第三步,把 Word 题库和这份 Markdown 提示词一起发给 Qwen-Image-3.0,这样才能生成我们想要的试卷版面。
这一波三折确实很抓马。但它也深刻地提醒了我们一件事:用模型,最好还是要用对“钥匙”,别把 A 模型生成的提示词,原封不动地搬到 B 模型里用。毕竟提示词这东西,也有模型自己的脾气。这次我已经把踩过的坑连泥带土刨出来给大家看了,愿各位绕着走,别再沾一身灰啦。
第三关是知识厚实:看它的认知能否跟上现实、是否真的懂场景。如果说前两关考验的是 Qwen-Image-3.0 到底能不能装、能不能稳、能不能细,那么最后一关则考验的是它到底能不能懂。这应该是图像生成最难的部分,因为模型必须要拥有海量的认知,要真的了解现实世界的最新变化和各类规则。
实测七:日文美妆直播间。这是一道集语言、规则和产品知识于一体的综合题。Qwen-Image-3.0 不仅要写对日文,还要知道日本直播电商界面里,主播画面、弹幕、商品卡、折扣、下单按钮通常如何分布,有何特点。提示词为:这题的标准是不能只“有日文”,还想让熟悉日本产品的人一眼看过去也不会觉得别扭。让我们一起来看看实测效果:大家觉得咋样?
实测八:多语种杭州夏日旅游海报。接着,让我们来设计一张多语种商业旅游海报吧。我们需要让中文、英文、日文同时出现在一张商业海报物料上,且标题、时间、地址、图片一个都不能少,更重要的一点是不能有错字,因为只要有一个错字,整张设计稿都将回炉重造了。提示词如下:效果:太漂亮了,我将立即逃离工位出发杭州。
实测九:仿一个量子位公众号界面。最后,让我们来整个活,顺便测试一下 Qwen-Image-3.0 设计仿真 UI 界面的能力吧。这一次,我将指示 Qwen-Image-3.0 生成一张“手机端量子位公众号文章页”仿真图。它画图时要同时做到三件事:第一,像一个手机端真实微信文章页面,有顶部导航、账号信息、标题区、首图和互动按钮。第二,能自然露出量子位的账号信息和科技媒体调性。第三,还能把 Qwen-Image-3.0 这篇实测文章包装成一条足够想点开的推送。当然,作为整活环节,我还要偷偷加一个小彩蛋:主编微信消息弹窗,夸我写得真棒。提示词:非常期待,让我们一起来看看效果:哎呀,看到夸奖和 10w+ 我好高兴哈哈哈哈哈(梦里什么都有,但现实什么时候能眷顾我一下)。而且很惊喜的是,它生成的这张图片连手机界面的时间、信号、电量等细节都有!但客观来说吧,它生成的格式和现实里的微信文章页确实不太一样。整体感觉像是把小红书、微信公众号、知乎等几个平台的界面风格揉在了一起,最后画出来一个有点“混血”的页面。不过,至少它没有只生成一个泛泛的手机界面。Logo、账号信息、发布时间、转赞评互动区、浏览量数据这些元素都在,摘要、小标题等文章基本结构也基本具备。这说明它对具体 UI 场景已经有了一定理解,只是还需要像修错字一样,多沟通、多指令、多调几轮。哦,你问我这次为什么不继续调?前面文章里的错字、试卷我都一轮轮改了。求苍天辨忠奸……不是我不想测,恰恰相反,是我测得太认真,把额度测光了啊啊啊!真没了。它能让我把 9 道题完整测完再触发 limit,我已经很心怀感激了。不过话说回来,如果一个模型仍然需要用户反复烧额度,才能把图调到想要的样子,也说明它距离“一把出活”还有不少改进空间。大家感兴趣的话,欢迎把自己调好的版本发到评论区哦。答对无奖!“你很出色,但确实还有一些不足的地方。”
这 9 道题测完,相信大家对 Qwen-Image-3.0 的能力已经有了一个比较直观的认识。正如评论区这位俄罗斯网友说的:Qwen-Image-3.0 是很出色,但它确实还有一些不足的地方。相比于之前的 Qwen-Image-1.0 和 2.0,这一代在“细节真实”、“内容丰实”和“知识厚实”三个方向上,进步是明显的。但它距离“让用户放心拿来干活”,还有需要补课的地方。有的是速度问题,有的是准确度问题,也有的是复杂场景里的稳定性问题。比如这位用户在使用 Qwen-Image-3.0 生成一张西班牙语学术九宫格图时,就遇到了“同音术语混淆”、“拼写错误”、“格式不规范”等问题。但与此同时,她也坦诚地表示,Qwen-Image-3.0 在西班牙语文本质量上的进步让她印象深刻,并向 Qwen 表达了感谢。这也说明,Qwen-Image-3.0 确实让人惊艳、也确实已经能把很多复杂任务做起来,但要真正做到稳定、准确、快速、一把出活,还得继续打磨。毕竟,没有人希望自己在赶着交差时,交上去的是一张带着错误的图片。希望 Qwen-Image 系列后续能持续关注这些真实的用户反馈,并在下一代模型里把这些坑补上吧。
