模型

Stable Diffusion XL

仅本地 开源 可商用
Stability AI · Stable Diffusion XL · OpenRAIL+ · 2.6B · 上下文 —
能做什么
图像生成
部署门槛
中端 16-24G
≥ 8GB
上下文
token 窗口
参数
2.6B
Stable Diffusion XL

01基础参数

参数规模
2.6B
上下文窗口
输入模态
image
可生成
image
模型系列
Stable Diffusion XL
开源许可
OpenRAIL+
主要语言
en

02推荐部署方案

推荐 Q4_K_M ComfyUI

03部署门槛详情

硬件等级 中端 16-24G · 最低显存 8GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
高分辨率艺术图像生成、设计草图与视觉概念创作、提示词控制精准的场景化出图
✗ 不适用
视频生成、图像编辑与修复、快速低显存环境部署

06部署与限制

⚙ 本地部署建议
基础模型 FP16 格式约需 8GB 显存,搭配 Refiner 级联使用建议 12GB 以上。推荐使用 Diffusers 框架,启用 torch.compile 和 xformers 加速推理并可开启 CPU 内存卸载降低显存压力。
⚠ 已知限制
不追求完美照片级真实感,复杂组合构图(如「红立方体在蓝球上方」)处理仍有困难。官方文档指出模型无法生成清晰可读的文字,但与部分第三方评测描述存在出入。

07详细介绍

Stable Diffusion XL (SDXL) 是 Stability AI 于 2023 年 7 月发布的开源高分辨率文生图扩散模型,基于其前代 SD 1.5 和 SD 2.1 迭代升级。模型核心采用 UNet 架构,其主干网络规模约为前代 3 倍,并引入 OpenCLIP-ViT/G 与 CLIP-ViT/L 双文本编码器以提升对复杂提示词的理解能力。SDXL 支持原生 1024×1024 分辨率输出,并可通过级联式 Refiner 模型对生成结果进行二次细节增强,实现更精细的纹理与色彩优化。

该模型凭借更强的图像质量、更优的文本理解以及对短提示词的友好性,广泛适用于数字艺术创作、设计概念图生成及视觉内容原型开发等场景。其基于 CreativeML Open RAIL++-M 许可证发布,支持商业应用。部署方面,基础模型 FP16 格式约需 8GB 显存,建议通过 diffusers 框架集成,并可借助 torch.compile 与 xformers 优化推理速度。

08官方资源

09同类模型