跳到正文
原文
Hugging Face Blog·· 2026-07-08精选AI 评分69

Hugging Face 升级 vLLM 的 transformers 建模后端 推理速度对标原生实现

Native-speed vLLM transformers modeling backend

AI 导读

Hugging Face 发布 transformers vLLM 建模后端的更新,使 Qwen3-4B、Qwen3-32B 和 Qwen3-235B-A22B-FP8 等模型在不重写代码的情况下,吞吐达到或超过 vLLM 原生手写实现。

推荐理由

vLLM 现可直接复用 transformers 模型实现达到原生速度,作者只需一行标志即可获得推理优化。

来源:Hugging Face Blog · huggingface.co