Ternary Bonsai 27B GGUF 是一个面向本地推理的低比特大模型项目,核心看点是用三元 Transformer 权重实现 27B 级别模型的部署。README 提到,它面向 llama.cpp 的 CUDA、Metal 和 CPU 路径,部署占用约 7.2GB,可在标准笔记本或单 GPU 环境中评估。

低比特大模型本地推理与权重部署示意图。
它不是常规的 4-bit 量化包,而是强调端到端三元语言权重,覆盖嵌入层、注意力投影、MLP 投影和 LM head。README 称其平均每权重约 1.71 位,并额外提供紧凑的 4-bit HQQ 视觉塔。
README 给出的部署 footprint 约为 7.2GB,相比 FP16 约 54GB 的占用明显更低。这个级别的压缩让 27B 模型有机会进入笔记本、单卡 GPU 或 Apple Silicon 本地推理场景。
GGUF Q2_0 g128 格式面向 llama.cpp,并配合 CUDA 与 Metal 的低比特混合注意力内核。项目还提到 MLX 版本适用于原生 Apple Silicon 推理,另有 1-bit 版本面向手机级别运行点。
低比特模型落地时不能只看文件体积,还要看长上下文速度、数学与代码能力、工具调用稳定性和不同后端的内核支持情况。部署前建议用同一提示集对 FP16、常规量化和三元权重版本做横向对比。