Hugging Face Blog·· 2026-07-08精选AI 评分69
Hugging Face 升级 vLLM 的 transformers 建模后端 推理速度对标原生实现
Native-speed vLLM transformers modeling backend
AI 导读
Hugging Face 发布 transformers vLLM 建模后端的更新,使 Qwen3-4B、Qwen3-32B 和 Qwen3-235B-A22B-FP8 等模型在不重写代码的情况下,吞吐达到或超过 vLLM 原生手写实现。
推荐理由
vLLM 现可直接复用 transformers 模型实现达到原生速度,作者只需一行标志即可获得推理优化。
来源:Hugging Face Blog · huggingface.co