阿里开源了 Qwen-Image-2.1,把文生图和图像编辑整合到了一个模型,同时兼顾质量、效率和成本。
生成部分的参数是 7B,参数量不大。各种都兼顾的情况下,肯定就不要去和顶级 Image 模型比了,能用就行。
这个模型「最大的亮点」就是,支持生成和编辑「透明通道」的图片(无论是图像还是文字都可以),简单说就是 png 图片终于支持透明背景了。
其他特性还包括:
- 因为支持透明通道,因此可以用模型直接抠图
- 支持同时输入 10 张参考图合成一张图片,比如将 10 个人的单人照合并成全家福
- 图像编辑支持局部圈选修改,同时支持独立掩码作为输入。这个能实现更精准的生成需求,比如我想让任务戴一顶指定形状的帽子,就可以输入掩码图片,这样出来的帽子就和掩码一致
- 使用普通照片生成全景图,照片外的场景由模型扩展生成
- 提升文字排版、人物光影细节表现,加强了编辑时人物和商品的一致性,这个方向很明确,针对电商去的
整体来说在开源模型这一点,Qwen-Image-2.1 的能力很全面了,写着我都心动了,部署一个日常使用。
