9月21日,通义千问团队开源新一代图像模型Qwen-Image-2.1。该模型采用32层Single-Stream DiT结构,视觉生成模块参数量为7B,整合文生图、透明RGBA图像生成和多种图像编辑能力。官方称,模型通过混合粒度注意力与KV Cache复用提升多图输入推理效率并控制显存开销;支持最多10张参考图、圈选/涂抹/独立掩码局部编辑,并强化人像、商品一致性及文字渲染。目前已在GitHub、ModelScope、Hugging Face开源。
9月21日,通义千问团队开源新一代图像模型Qwen-Image-2.1。该模型采用32层Single-Stream DiT结构,视觉生成模块参数量为7B,整合文生图、透明RGBA图像生成和多种图像编辑能力。官方称,模型通过混合粒度注意力与KV Cache复用提升多图输入推理效率并控制显存开销;支持最多10张参考图、圈选/涂抹/独立掩码局部编辑,并强化人像、商品一致性及文字渲染。目前已在GitHub、ModelScope、Hugging Face开源。