据雷峰网报道,商汤科技8月21日正式开源轻量级原生统一多模态大模型SenseNova U1.5 Lite正式版。该模型支持3至4千字符超长复杂指令和原生4K图像输出,重点解决AI视觉生成在真实创作流程中的指令执行与编辑保持问题。

与预览版相比,正式版围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等能力。商汤科技称,其目标是让AI视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。

模型参数规模为8B,已面向全球开源,开发者可通过GitHub、Hugging Face、魔搭社区等渠道获取,并可在SenseNova Studio在线体验。官方表示,该模型在指令遵循与图像编辑保持度上超越同量级模型,在文字渲染与复杂布局方面亦有提升。

针对创作者常见的指令超出模型上下文而导致细节遗漏、编辑过程中无关区域被改动等问题,SenseNova U1.5 Lite原生支持3至4千字符上下文长度,可同时处理主体、数量、空间关系、文字、布局、风格等多重约束。原生图像编辑能力增强了主体身份、空间结构和非编辑区域的保持,支持局部修改、元素替换、文字精修和多参考图编辑。模型还提供Bounding Box、Visual Marker以及单图、多图参考等视觉控制方式,能够输出原生4K高分辨率图像。

实际演示覆盖创意海报、高密度信息图、手绘草图转漫画、跨主题海报迁移、多图融合、信息图编辑和局部文字替换等任务。例如,在保留原版式结构的前提下,可将海报主题从复古印刷风格切换为天文台公众开放日;在多参考图融合中,模型可提取多张图像的核心特征并自然重组光影与比例。

商汤科技表示,该模型旨在提供更高可控性、更高清、更高性价比的能力工具,推动AI视觉生成从优化画面美感走向组织完整的视觉表达。