跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分75

vLLM transformers 建模后端提速至原生速度

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。

推荐理由

原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。

来源:Hugging Face Blog · huggingface.co