这个模型比较特殊,它并不是普通的 GGUF 模型。PrismML 针对三值权重(Ternary)和 Hybrid Attention 做了专门的 llama.cpp 内核优化,因此不能简单地使用普通版本的 llama.cpp 或 LM Studio 加载。
Windows 本地部署 PrismML Ternary-Bonsai-2-27B:RTX 5070 + CUDA 13.3 + llama.cpp Web UI 完整教程
未经允许不得转载:小狮博客 » Windows 本地部署 PrismML Ternary-Bonsai-2-27B:RTX 5070 + CUDA 13.3 + llama.cpp Web UI 完整教程
小狮博客