Hugging Face Blog·· 16 天前精选AI 评分82
Hugging Face transformers 新增对 GGUF 与 llama.cpp 量化模型的直接加载支持
Transformers now runs llama.cpp quants
AI 导读
Hugging Face 官方博客宣布,transformers 现可直接加载 GGUF 量化模型,并复用 llama.cpp 背后的 ggml Metal 内核,以贴近 llama.cpp 的速度在本地运行。
推荐理由
官方给出 GGUF 在 transformers 中的加载方式、推理路径与硬件限制,读者可据此判断是否能用熟悉接口替代 llama.cpp。
来源:Hugging Face Blog · huggingface.co