用 Diffusers 与 PEFT 加速 Flux 的 LoRA 推理
HF 博客给出在 Flux.1-Dev 上加速 LoRA 推理的方案,结合 Flash Attention 3、torch.compile 与 TorchAO FP8 量化,并借助 Diffusers 的 hotswap 机制避免换 LoRA 时触发重新编译。
推荐理由:这篇博客把 Flash Attention 3、torch.compile 与 FP8 量化组合成可复用的 LoRA 推理加速配方,并给出 H100 与 RTX 4090 上的实测对照。