最新消息:关注人工智能 AI赋能新媒体运营

商汤开源轻量多模态模型U1.5-Lite预览版:8B参数支持4K生成编辑

科技资讯 admin 浏览

商汤开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview:8B 参数实现 4K 视觉生成与编辑

商汤科技近日面向社区开源了轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。该模型基于 SenseNova U1 进行系统性迭代,并非简单的规模升级,而是在同一架构中贯通视觉理解、推理、生成与编辑四大能力。

这款模型最突出的特点是其轻量体量。仅以 8B-MoE 的参数规模,就实现了 4K 分辨率生成、更精细的真实质感表现以及更复杂的视觉控制。商汤方面表示,如果说 U1 验证了统一架构的可行性,那么 U1.5 的目标则是证明该架构的能力能否持续扩展。

SenseNova U1.5-Lite-Preview 模型效果展示

生成与编辑全链路优化,四大方向显著提升

相比前代 U1,U1.5-Lite-Preview 在四个核心方向实现提升:原生支持 4K 图像生成、更精细的局部纹理与真实世界质感、更准确的中英文文字生成与复杂版式组织、更稳定的图像编辑和视觉指令遵循。

在技术实现层面,商汤针对网格伪影和高分辨率细节建模难题,重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练分辨率扩展至 4K。图像编辑方面,模型重新组织了编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持能力,确保在完成目标修改的同时,尽可能保留原图中不需改动的部分。

基准测试成绩大幅跃升,编辑能力进步突出

多项评测结果验证了优化效果。Qwen-Image-Bench 得分从 47.14 提升至 55.20(配合提示词增强),ImgEdit-Bench 从 3.90 升至 4.37,GEdit-Bench 英文版从 7.47 提升到 8.17,中文版从 7.42 升至 8.05。生成质量与编辑稳定性均有明显进步,尤其在图像编辑的指令遵循与原图保持方面提升最为显著。

商汤强调,U1.5-Lite-Preview 的核心思路是不盲目扩大模型规模,而是对生成与编辑全链路进行系统性优化。这种"以架构创新换取能力增长"的路线,为轻量级多模态模型的持续迭代提供了参考范本——当 8B 参数即可跑通 4K 生成与精细编辑,统一多模态架构的潜力或许才刚刚开始释放。