先给结论:截至 2026 年 8 月 31 日,在 Stability AI 的官方发布页、开发平台和公开模型集合中,都没有正式发布名为 Stable Diffusion 4 的图像模型。现有官方开权重主线仍是 Stable Diffusion 3.5,包括 Large、Large Turbo 和 Medium。
因此,不能围绕一个尚未公开规格的“SD4”推荐显存、节点或插件。更稳妥的做法是把标题理解为“面向下一代 Stable Diffusion 工作流的技术栈选型”,以可获得的 SD3.5 做基线,并把模型层做成可替换组件。
## 先按任务选模型,而不是按数字选
SD3.5 Large 约 8.1B 参数,面向较高质量与提示遵循;Large Turbo 是蒸馏版本,官方定位是用约四步快速生成;Medium 约 2.5B 参数,更容易在消费级硬件运行,并支持多种分辨率。
若任务是离线制作海报草案,单张质量和可控性通常优先,可从 Large 开始。若是交互式预览或大量候选图,Turbo 的低步数更合适。设备资源有限、需要本地微调时,Medium 往往更现实。
不要只比较“哪张图最好看”。建立自己的提示集,记录主体关系、文字、手部、风格覆盖、每张耗时、峰值显存和失败重试次数。同一模型在肖像、商品图和建筑构图上的强弱可能完全不同。
## 模型层包含的不只是一份权重
Stability AI 的 SD3.5 参考实现显示,工作流包含 CLIP-L、OpenCLIP bigG、T5-XXL 等文本编码器、16 通道 VAE 以及核心 MM-DiT。下载主模型不等于推理所需资产已经齐全。
这也解释了为什么磁盘占用、加载时间和显存不能只看参数数目。文本编码器可以在编码后卸载,VAE 可以分块解码,主网络也可量化或卸载到内存,但每种优化都会影响速度、精度或实现复杂度。

## 推理框架如何选
想用 Python 组成服务,Diffusers 提供统一的 Pipeline、调度器和设备管理,适合代码集成、自动测试和 API 化。想让创作者可视化搭工作流,节点式工具更便于查看每一步,并快速接入社区组件。
官方 `sd3.5` GitHub 仓库是小型参考实现,适合理解组成和验证底层行为;它不是面向所有生产需求的完整平台。选择框架时,要检查模型版本支持、ControlNet、批处理、内存优化、插件版本固定和无界面执行能力。
原型阶段用可视化节点并不妨碍生产代码化。可以先把有效流程固定成可导出的工作流,再用队列、日志和版本管理包住它。反过来,研发团队若从第一天就需要自动回归和多租户服务,代码式管线会更清楚。
## 控制组件决定作品能不能复用
纯文本生成适合探索,却不擅长重复同一构图。SD3.5 Large 已有官方 Blur、Canny 和 Depth ControlNet:边缘控制保留轮廓,深度控制保留空间层次,模糊控制可引导低频结构。
商品图还可能需要遮罩重绘、参考图条件和局部放大。人物连续性则需要身份参考与严格的种子、提示和后处理记录。每增加一个控制模块,都应有明确目的,并用样本验证它没有引入新的纹理或颜色偏差。

## 硬件选择看峰值和吞吐
能加载模型不等于能稳定服务。单人创作更关心一次生成的等待时间和交互流畅;批量服务更关心每小时有效图片数、并发、冷启动和队列长度。
BF16 或 FP16 通常是质量基线,FP8、ONNX 和 TensorRT 优化可减少内存并提高特定硬件的速度。Stability AI 公布的 NVIDIA TensorRT 优化针对 SD3.5 报告了最高约 2.3 倍速度提升和 40% 内存下降,但这是特定型号与实现的公司测试,采购前仍要在自己的分辨率、批量和提示上复测。
AMD 也提供了部分 ONNX 优化模型。跨硬件部署时,先确认算子支持与输出一致性,再比较标称算力。一个理论上更快但频繁回退到不支持算子的后端,实际未必占优。
## 服务层要保留可重现信息
每次生成至少记录模型精确版本、权重哈希、提示词、负面提示、随机种子、尺寸、步数、引导强度、调度器、控制模型和代码版本。只记“用了 SD3.5”无法复现结果。
队列应区分预览和精修优先级,设置显存不足后的明确失败策略。不要无限自动重试,因为错误尺寸或损坏工作流不会靠重跑变好,只会占满 GPU。
还应保存缩略图和关键性能指标,但原始中间张量通常没必要长期存储。技术栈越可观察,未来换模型时越容易做 A/B 对比。
## 面向未知版本怎样保留升级空间
把模型输入统一为内部任务描述,把框架特有参数放在适配器中;将后处理、存储、审核和业务元数据从模型进程拆开;用一组固定提示和参考图做回归测试。
新版本真正出现后,先在影子队列运行,不直接替换生产模型。只有当质量、速度、显存、控制能力和失败率都达到目标,再迁移流量。
所谓“为 Stable Diffusion 4 选型”,最重要的不是猜中未来参数,而是建立一套不依赖传闻、能够测量并可替换的图像生成系统。今天它运行 SD3.5,明天换模型时也不必推倒重来。
## 参考资料