大家好,今天为大家介绍一款千问编辑模型的 GGUF 版本——Qwen-Edit 2511-AIO-GGUF。该版本支持 NSFW 内容处理,属于融合型 AIO 模型,体积更小、显存占用更低,推理速度显著提升,平均约 30 秒即可完成图像生成,效果不逊于原版,且模型体积缩减超过一半。
本次测试采用全 GGUF 加速工作流,包括 CLIP 模型也替换为 GGUF 格式。例如原版 CLIP 模型大小为 9GB,使用 Q4 量化后压缩至约 4GB;原版千问模型为 28GB,Q4 量化后仅需 12GB,显存压力大幅降低,运行效率明显提高。
以下为具体测试内容与结果:
基础图像编辑能力测试
- 手办化转换:将原图中人物转换为手持九尾狐手办的效果。首次运行耗时约 70 秒(含模型加载),后续运行稳定在 30 秒左右。输出图像细节清晰,手指纹理、手办质感表现良好,原始图像分辨率为 832×1248,适合进一步通过 SDR/SVR2 放大增强。
- 素描风格转换:将同一人物转为炭笔速写风格,用时 28.089 秒。皮肤质感、指甲纹理、线条表现均自然合理。
- 服饰与场景重绘:提示词为“图中人物穿上原始部落兽皮服饰,骑在黑豹之上”,用时 34 秒。人物发型、面部特征保持一致,黑豹毛发质感与光影效果表现到位。
多视角一致性测试
- 鸟瞰视角:生成人物俯视角度图像,用时 32.45 秒,背景瀑布与人物比例协调。
- 背面视角:生成人物背影,用时 34 秒,发型还原完整,背部结构合理。
- 侧面视角:用时 31.789 秒,发丝与面部轮廓细节保留较好,轻微光滑感可通过后续 VR2 增强皮肤质感进行优化。
风格迁移能力测试
- 真人→动漫:提示词为“将图片转换为日式动漫风格”,用时 42 秒,成功输出高质量二次元图像,风格识别准确。
- 动漫→真人:选取典型夸张二次元角色进行写实化转换,平均用时约 31–38 秒。衣物、鞋履、地面等元素真实感强,头部因原作特征过于鲜明略带 2.5D 效果,整体完成度达 80 分以上。多次重绘可进一步提升五官自然度。
多图协同与复杂提示测试
- 双人互动重绘:输入两张人物图,设定“穿黑色情趣服装、红色配色、相互拥抱”等提示,使用空尺寸(1024×1024)生成,用时 40 秒。发丝、布料褶皱等细节表现合格,符合提示逻辑。
- 四宫格表情包生成:按“微笑、愤怒、恐惧、害羞”顺序生成,用时 31.7 秒。各表情神态区分明显,其中愤怒与恐惧表现优于微笑,整体可控性良好。
模型配置说明
测试环境为搭载 RTX 4080 笔记本(12GB 显存),实际运行中首次加载模型约需 8–10 秒,K采样器首帧耗时约 40–50 秒,后续稳定在 20–30 秒区间。台式机平台性能更强,预计响应更快。
所用模型包含:
- Qwen-Edit 2511-AIO-GGUF(Q4 与 Q6 两种精度可选,Q4 已验证效果良好,Q6 可进一步提升画质)
- CLIP-GGUF(Q3/Q4 均可,Q4 推荐,约 4GB)
- VAE(千问专用 VAE,非必需但建议加载以提升色彩表现)
关键注意事项:
- CLIP-GGUF 模型必须放置于 ComfyUI 的
models/clip目录下,否则会报 “CLIP loading error” 错误,导致工作流无法运行; - 无需额外安装插件,仅需将模型文件与工作流导入对应路径即可使用;
- 推荐采样步数为 6,当前演示使用 4 步以兼顾速度与可视效果,提升至 6 步可明显增强细节质感。
