OpenAI 发布开源模型系列 GPT OSS,包含 120B 与 20B 两个 MoE 模型
OpenAI 发布开源模型系列 GPT OSS,包含 gpt-oss-120b 和 gpt-oss-20b 两个 MoE 模型,许可证为 Apache 2.0,主打推理与智能体任务。
推荐理由:详细梳理 GPT OSS 在 transformers、vLLM、llama.cpp 等推理框架下的部署配置与微调示例,附带可直接运行的代码片段。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
OpenAI 发布开源模型系列 GPT OSS,包含 gpt-oss-120b 和 gpt-oss-20b 两个 MoE 模型,许可证为 Apache 2.0,主打推理与智能体任务。
推荐理由:详细梳理 GPT OSS 在 transformers、vLLM、llama.cpp 等推理框架下的部署配置与微调示例,附带可直接运行的代码片段。
HF 博客给出在 Flux.1-Dev 上加速 LoRA 推理的方案,结合 Flash Attention 3、torch.compile 与 TorchAO FP8 量化,并借助 Diffusers 的 hotswap 机制避免换 LoRA 时触发重新编译。
推荐理由:这篇博客把 Flash Attention 3、torch.compile 与 FP8 量化组合成可复用的 LoRA 推理加速配方,并给出 H100 与 RTX 4090 上的实测对照。