阿里发布新一代图像生成模型 Qwen-Image-3.0:支持 4.5K Token 超长文本输入
阿里巴巴正式发布千问图像生成与编辑系列第三代基础模型 Qwen-Image-3.0。该模型最高支持 4.5K Token 超长文本输入,可一次性生成包含公式符号、几何图形、逻辑推导、多层 UI 界面等复杂内容,并原生支持 12 种语言和 20 余款字体渲染。
与上一代模型相比,Qwen-Image-3.0 将文本输入长度提升至 4.5 倍。在影视分镜、知识图解、产品说明页等需要长提示词的场景中,用户无需压缩需求,可像撰写设计文档一样完整描述画面结构、文案内容、视觉风格和版式细节,从而获得更精准的生成结果,降低反复修改和人工调试成本。
在复杂内容理解方面,该模型进一步强化了语义解析和空间布局能力,能够一次生成覆盖多个主题的九宫格知识图解,兼顾文字清晰度与内容准确性。同时,模型支持复杂逻辑嵌套,可根据单条指令生成网页、软件界面、聊天窗口、海报等多层视觉元素组合。例如在"VSCode 编程界面中,通过千问 App 生成一张发布在聊天界面的手冲咖啡海报"等复杂场景下,模型能够准确理解多层 UI 关系,保持各级界面风格一致,甚至对约 10 像素的小字号文字也能实现清晰呈现。
据官方介绍,Qwen-Image-3.0 在人像摄影、数学试卷、古碑拓片、直播页面等场景均具备较强的细节还原能力,对复杂图文混排和高密度信息承载进行了重点优化。
随着生成式 AI 逐步进入专业设计和商业内容生产环节,图像模型的竞争正从基础画质转向复杂信息表达、可读性和工程化能力。Qwen-Image-3.0 的发布,进一步推动 AI 图像生成向高精度、多语言和商业可用方向发展。