最近在研究多模态大模型,发现阿里通义千问的视觉模型Qwen-Image确实不错,特别是在图像理解和推理方面表现亮眼。作为一个ComfyUI用户,我花了几天时间研究,终于搞定了两种在ComfyUI中调用Qwen-Image的方案,今天就来分享给同样感兴趣的伙伴们。

在这里插入图片描述
在这里插入图片描述

为什么选择Qwen-Image?

在开始之前,先简单说说为什么我选择Qwen-Image。相比其他视觉语言模型,Qwen-Image有几个明显优势:对中文支持友好、细节观察能力强、逻辑推理准确。比如你上传一张复杂的场景图,它能准确描述图像内容,还能回答各种关于图像的细节问题。

方案一:原生Qwen-Image工作流(推荐有显卡的用户)

这是我最初尝试的方案,也是效果最好的方案。

准备工作:

  • 确保你的ComfyUI已经更新到最新版本
  • 准备好至少8GB的显存(建议12GB以上)
  • 安装ComfyUI-Manager,方便管理节点

搭建步骤:

  1. 安装关键节点
    在ComfyUI-Manager中搜索并安装ComfyUI-Qwen,这是专门为Qwen系列模型开发的节点包。

  2. 模型下载
    从ModelScope或HuggingFace下载Qwen-VL-Chat模型文件。如果你的网络环境不太理想,建议使用ModelScope,速度会快很多。

Diffusion model

  • qwen_image_fp8_e4m3fn.safetensors

LoRA

  • Qwen-Image-Lightning-8steps-V1.0.safetensors

Text encoder

  • qwen_2.5_vl_7b_fp8_scaled.safetensors

VAE

  • qwen_image_vae.safetensors

在这里插入图片描述
Qwen-Image ComfyUI工作流操作指南

  1. 工作流搭建
  • 加载模型
    在Load Diffusion Model节点加载qwen_image_fp8_e4m3fn.safetensors。
    在Load CLIP节点加载qwen_2.5_vl_7b_fp8_scaled.safetensors。
    在Load VAE节点加载qwen_image_vae.safetensors。

  • 设置基础参数
    在EmptySD3LatentImage节点设置图片尺寸(如512×512)。
    在CLIP Text Encoder节点输入提示词,支持多语言。

  • 可选加速
    如需加速,启用lightx2v 8步加速LoRA,按Ctrl + B,并调整KSampler参数。

  • 运行工作流
    点击Queue按钮或按Ctrl + Enter运行,生成图像。

  • 调整参数
    根据需要调整KSampler参数,优化生成效果。

    搭建过程其实很直观:

    • 加载图像节点 → 连接到Qwen加载器
    • 添加文本输入节点作为问题输入
    • 连接Qwen-VL处理器 → 输出节点
  1. 实际体验
    在我的7900XT上,推理速度挺不错,模型对细节的把握也很可以,比如能准确识别图像中的文字内容、人物动作关系等。
方案二:GGUF量化版工作流(适合显存有限的用户)

如果你的显存不够大,或者想在不那么强大的硬件上运行,这个方案就是为你准备的。

GGUF是什么?
简单说就是一种模型量化格式,可以在保证性能的同时大幅降低资源占用。

搭建过程:

  1. 下载GGUF模型
    在HuggingFace上搜索Qwen-VL的GGUF版本,选择适合你硬件的参数量级。我用的的是q4_k_m版本,在精度和速度间取得了不错平衡。

  2. 安装ComfyUI-GGUF节点
    需要安装ComfyUI-GGUF节点包,它支持多种GGUF模型。

在这里插入图片描述
在这里插入图片描述

  1. 工作流搭建

Step 1 - 加载模型 (Load models)

  • Unet Loader (GGUF):加载Qwen-Image的Unet模型,我加载的是:Qwen-image-Q4_K_m.gguf,这是图像生成的核心网络。
  • CLIPLoader (GGUF):加载Qwen-Image的GGUF模型,加载的是:Qwen2.5-Vl-7B-Instruct-Q4_K_m.gguf可能用于特定的图像处理或优化。
  • VAE:加载VAE模型: qwen_image_vae.safetensors,用于图像的编码和解码,通常用于图像的预处理和后处理。

Step 2 - 设置图像尺寸 (Image size)

  • 空Latent图像 (SD3):设置生成图像的尺寸。

Step 3 - 提示词输入 (Prompt)

  • CLIP Text Encode (Positive Prompt):输入正面提示词,描述希望生成的图像内容。这里使用了一段详细的描述,包括场景、颜色、风格等信息。
  • CLIP Text Encode (Negative Prompt):输入负面提示词,描述不希望出现在图像中的内容。这有助于模型避免生成不想要的元素。

Step 4 - 采样和保存图像 (Sampling and image saving)

  • LoRA加载器 (仅模型):加载LoRA模型:Qwen-Image-Lightning-4steps-V2.0-bf16.safetensors,用于微调生成的图像风格或内容。
  • 采样算法 (AuraFlow):选择采样算法,这里使用的是AuraFlow,用于生成图像的采样过程。
  • K采样器:设置采样的参数,如步数、cfg等,这些参数影响图像的质量和风格。
  • VAE解码:使用VAE模型将生成的潜在图像解码为可查看的图像格式。
  • [Amor] Image WebSaver:将生成的图像保存到指定的文件夹,并可以选择保存为webp格式。

在这里插入图片描述
在这里插入图片描述

使用心得与避坑指南

经过大量测试,我总结了一些实用建议:

提示词技巧:

  • 问题要具体明确,比如不要问“这是什么”,而是问“图片左上角的红色物体是什么”
  • 可以要求模型以特定格式回答,比如“分点列出图片中的主要元素”

性能优化:

  • 原生版本可以调整batch size来平衡速度和显存
  • GGUF版本可以尝试不同的量化级别,找到最适合你硬件的版本
  • 如果遇到内存不足,先尝试减小输入图像的分辨率

应用场景:

我主要用它来做:

  • 图像内容分析和描述
  • 视觉创作的内容审核
  • 学习材料中的图像理解辅助
结语

两种方案各有优势:如果你追求最佳效果且有足够硬件,原生版本是不二之选;如果资源有限或只是想体验一下,GGUF版本提供了很好的入门途径。

ComfyUI的强大之处在于,一旦搭建好工作流,就可以像搭积木一样组合不同的功能模块。比如你可以把Qwen-Image的输出作为其他AI绘画模型的输入,创造出更智能的创作流水线。

希望这篇分享能帮你少走弯路。如果在搭建过程中遇到问题,欢迎交流讨论。

更多推荐