xAI 升级 Imagine Video1.5:新增图像参考、语音参考与 1080p 输出
xAI 近日为其视频生成模型 Imagine Video1.5 推出重大升级,新增图像参考、语音参考、纯文本生成视频以及原生 1080p 输出四项核心能力,进一步提升了 AI 视频创作中的角色一致性、场景控制精度和画面质量。
目前,文本转视频和 1080p 视频生成功能已面向 Grok Imagine 网页版、iOS 版及 Android 版用户全面开放。图像参考与语音参考功能则率先向美国地区的 SuperGrok Heavy 和 SuperGrok Plus 订阅用户开放,后续将逐步扩展至更多用户群体。
此次更新为创作者提供了更灵活的视频生成工作流。用户既可以直接输入文本描述生成视频,也能上传参考图像来固定角色、产品或场景特征;更可结合角色图片与语音样本,让 AI 在不同镜头中保持外观与声音的高度一致。据 xAI 介绍,Imagine Video1.5 单次生成最多支持七个视觉参考,可分别用于锁定人物面部、产品特征或环境元素,实现更精细的内容控制。
在多重参考模式下,创作者能够保留角色身份并替换背景,或保持场景不变更换角色,亦可仅调整动作而维持整体视觉设定。语音参考功能的加入,进一步解决了 AI 视频制作中长期存在的角色连续性问题,使同一角色在多个片段中保持稳定的面部特征与声音表现。
面向开发者群体,xAI API 已支持通过 grok-imagine-video-1.5 模型调用图像参考、文本转视频及原生 1080p 视频生成能力。开发者可通过 API 传入提示词、参考图像 URL、视频时长、宽高比和分辨率等参数完成视频生成;语音参考功能则需通过特定请求方式接入。
Imagine Video1.5 于上月正式发布,xAI 当时表示该版本在运动表现、物理模拟和音频生成方面均有优化。此次升级进一步强化了模型对身份、场景和产品细节的控制力,推动 AI 视频生成从简单的画面转换向更接近专业影视制作流程的多模态创作工具演进。