跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 1–3 条 · 共 3 条
9月3日周四
7月23日周三
  1. Hugging Face Blog65

    用 Diffusers 与 PEFT 加速 Flux 的 LoRA 推理

    HF 博客给出在 Flux.1-Dev 上加速 LoRA 推理的方案,结合 Flash Attention 3、torch.compile 与 TorchAO FP8 量化,并借助 Diffusers 的 hotswap 机制避免换 LoRA 时触发重新编译。

    推荐理由:这篇博客把 Flash Attention 3、torch.compile 与 FP8 量化组合成可复用的 LoRA 推理加速配方,并给出 H100 与 RTX 4090 上的实测对照。

3月7日周五
  1. Mistral AI66

    Mistral AI 发布 Mistral OCR 文档理解 API

    Mistral AI 发布文档理解 API Mistral OCR,输入图片和 PDF,输出有序的图文交错内容,已在 la Plateforme 上线,价格为 1000 pages/$,单节点最高可处理 2000 页/分钟。

    推荐理由:原文附带与主流 OCR 模型的基准对比,读者可以据此横向判断其在多语言文档理解场景中的相对位置。