一张仅包含简单线条、栏目框架和流程箭头的手绘草图,能否直接转化为一张符合商业出版标准的深海潜水装备流程高精海报?在下面的案例中,该模型不仅精准识别了氧气瓶、面镜、潜水电脑表等装备,更完整保留了“装备总览、功能详解、下潜前检查、安全下潜流程、下潜后检查”这五部分结构。它成功为不同栏目补充了图片、图标和说明文字,将原本粗略的构想转化为了深蓝科技风格的完整设计图。
从草图到彩绘海报,AI需要理解内容与结构,按要求补全细节、统一风格,并保留关键部分。这项任务由商汤最新开源的轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview完成。
**01. 8B轻量化体量,跑出硬核生成与编辑性能**
作为SenseNova U1开源模型的升级版,U1.5-Lite-Preview的核心亮点在于:仅以8B-MoT的轻量化规模,集成了看图、视觉推理、4K极清生成与高精度编辑的全套能力。它延续了商汤自研的NEO-Unify原生统一多模态架构,摒弃了传统方案中低效的模型拼接模式,在单一网络内部实现了多模态信息的统一表征与交互。
从评测成绩来看,U1.5-Lite-Preview的Qwen-Image-Bench成绩由U1的47.14分大幅跃升至55.20分;在衡量图像编辑能力的GEdit-Bench测试中,其英文项(8.17分)与中文项(8.05分)均超过了众多大参数级别的开源及闭源模型。
此外,该模型在4K画质、复杂提示词执行、参考图创作和图像编辑等方面带来了直观的提升。目前,该模型已在全球开源,开发者可通过Hugging Face、GitHub及魔搭社区免费获取与部署。
**02. 复杂提示词也能“看懂”,4K画质同步升级**
生成主体明确、构图简单的画面通常只需几句自然语言描述,但制作信息图、商业海报时,用户往往需要同时说明主体、布局、文字、风格及需要保留或避免的内容,相当于提交一份完整的创作方案。U1.5-Lite-Preview在U1的基础上,显著提升了提示词遵循能力和长上下文视觉控制能力,能将详细要求落实到同一画面中。
这种强提示词遵循能力并非依赖固定模板,即使未经过专门的Prompt Enhance格式化数据训练,模型也能稳定执行长篇、多约束和层次化的视觉指令,这是原生统一多模态架构的优势所在。例如,要求模型以横向长卷呈现二十四节气,按时间划分竖向栏目,每个栏目需包含节气名称、日期、自然景观,并保持中式绘画风格,展现四季流转。从效果来看,画面从春柳夏荷过渡到秋麦冬雪,二十四个栏目内容密集但层级清晰,四季色彩变化自然连贯。
当然,复杂创作并不意味着用户必须手写数千字提示词。商汤还设计了实验性的Prompt Enhance Skill,可将简短想法补充为包含主体、布局、风格、文字和限制条件的结构化方案。简单任务直接描述,复杂任务借助该工具即可完善要求。
在4K画质方面,SenseNova U1.5-Lite-Preview原生支持4K图像生成,对人物皮肤、产品材质、建筑纹理和环境光影的细节及整幅画面一致性提出了更高要求。例如,在生成的渔民整理渔网4K图中,渔网线结、船身油漆、机械设备锈迹清晰可见,远处水面倒影、岸边房屋和电塔的空间层次分明,大量细碎物体间边界清晰,整体光影与色彩统一。
**03. 看懂参考图再创作:既能借鉴风格,也能组合素材**
除了文生图,SenseNova U1.5-Lite-Preview还能根据参考图进行创作。用户有时希望借鉴图片的配色、构图和设计语言,替换主题;有时则需要分别使用多张图片中的元素,将互不相关的素材组合成新图。这要求模型能看懂图片,判断应提取什么,并按新要求重新组织。
依托原生统一多模态架构,模型可识别并理解图片。例如,以可再生能源主题海报为参考,模型沿用了棕褐色复古质感、红白大字排版和剪影式构图,重新生成了“古代香料贸易”主题海报。新海报主题改变,但构图、色彩、文字层级和复古颗粒质感保持呼应。对于多张素材,模型也能提取不同特征。例如,将金发黄衣少女、黑发狐耳红衣少女和蓝衣少女放入同一场景,保留三人外貌、服饰和配饰,并以金色火光、红色花瓣和蓝色能量分别呼应,重新组织站位、光影和层次。
**04. 改文字、换元素,AI开始接手精细改图**
参考图创作关注“从输入图片中取出什么,再怎样重新组合”,但用户往往已有满意的图片,只想修改一处内容。例如,产品海报上线日期临时调整,用户只想替换日期,但AI若重新生成整张图,会破坏满意的构图和风格。这正是U1.5-Lite-Preview此次提升的重点,它能精准判断“哪里需要改,哪里不能动”。
依托统一架构,模型可在同一模型中完成看图、定位和图像编辑。若想调整排版、转换语言或替换产品、文字,模型可根据要求修改,不影响其他内容。例如,在桥梁加固海报中,模型将“改造前后”对比图放大并移至中央,调整主标题和四项优势至下方,保留背景铁路桥、原有文字及工业风格,使信息更突出、层级更清晰。
除了排版,模型还能单独修改文字,保留原有字体、材质、光照和透视。例如,将灯泡招牌中的“VACKER”替换为“MARKET”,模型不仅准确修改了文字,还保留了立体字造型、灯泡排列、金属质感和光照效果,门窗、墙面等其他区域保持不变。
若单靠文字不易说明,用户还可直接圈出目标区域。例如,通过彩色标记指定三个编辑区域,分别要求“添加黏土狮子”“添加黄色黏土人偶”和“添加黏土长颈鹿”。模型按标记位置补充角色,并让新增元素的质感、光影与原图一致,前景中的兔子、花朵和蓝色水壶基本不变,实现了多区域同时编辑。图片生成后可成为修改基础,用户可逐步调整文案、版式和元素,让结果更接近预期。
**05. 结语:小规格模型继续向生成、编辑闭环迈进**
从SenseNova U1到SenseNova U1.5-Lite-Preview,商汤在轻量级规格下大幅提升了4K图像生成、复杂提示词遵循、参考图创作和图像编辑能力。从“能画图”到“改好图”,体现了国产开源多模态模型在商业化落地与可控生成领域的又一突破。智东西获悉,SenseNova U1.5-Lite正式版也将在近期推出并开源,届时将在图像生成和编辑等方面进一步完善。对于一款轻量级统一多模态模型来说,如何在有限规模内继续提升生成质量、编辑稳定性和视觉控制能力,将是正式版更值得关注的部分。
