官方介绍

Ternary Bonsai 2 是 Prism ML 发布的 27B 开源大模型,主打极限压缩:用三值(ternary)权重表示,把 27B 级推理模型从约 54GB(FP16)压到约 5.9GB,约为原来的九分之一,可在普通笔记本或单张 GPU 上运行。许可是 Apache 2.0,可商用。

模型派生自 Qwen3.8-27B(架构未改):混合注意力骨干(约 75% 线性注意力 + 约 25% 全注意力)、SwiGLU MLP、RoPE、RMSNorm,上下文长度 262K tokens。官方称保留 FP16 智能的 98.2%(14 项思考模式基准平均 84.78 分),其中数学 96.57、编程 89.42、agent 工具调用 74.92;Apple M5 Max 笔记本实测约 47 tok/s。

权重格式为 Ternary g128:每个权重只取 −1 / 0 / +1,每 128 个权重共享一个 FP16 缩放因子,整体折合 1.72 bit/权重。提供两种 GGUF 打包:PTQ1_0(1.75 bit/权重,5.95GB,三值密集打包)与 PQ2_0(2.13 bit/权重,7.21GB,2-bit 槽位);另有 Apple Silicon 原生 MLX 版(Ternary-Bonsai-2-27B-mlx-2bit)。视觉塔以可选 mmproj(Q8_0,0.63GB)单独提供,只在输入图片时加载。

核心功能

能力说明
极限压缩27B 压到 5.95GB(PTQ1_0),FP16 约 54GB,约 9 倍压缩;位宽与名称一致(官方点名部分第三方「2-bit」构建实际是 2.8 bit)
能力保留思考、推理与 agent 行为保留在 4-bit 以下区间:数学距全精度半分内、编程持平、工具调用 74.92
262K 上下文靠线性注意力为主的混合骨干在端侧也可用
双格式发布GGUF(PrismML fork 的 llama.cpp,CUDA / Metal / CPU)+ MLX(Apple Silicon 原生)
可选多模态mmproj 视觉塔仅图像输入时加载,纯文本推理不占内存
可商用Apache 2.0

使用说明

官方明确:GGUF 版必须用 PrismML fork 的 llama.cpp 运行。原版 llama.cpp 会直接拒绝 PTQ1_0 / PQ2_0(未知类型),并对 Q2_0 不报错地输出乱码;捆绑原版 llama.cpp 的工具(含当前版本的 Ollama)同样跑不了。Bonsai-demo 仓库是官方运行权威来源(各后端的测试配置与固定版本二进制)。

git clone https://github.com/PrismML-Eng/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON && cmake --build build -j   # macOS 去掉 -DGGML_CUDA=ON,Metal 默认
hf download prism-ml/Ternary-Bonsai-2-27B-gguf Ternary-Bonsai-2-27B-PQ2_0.gguf --local-dir .
./build/bin/llama-cli -m Ternary-Bonsai-2-27B-PQ2_0.gguf -ngl 99 -fa on -c 32768 -p "Explain quantum computing in simple terms." -n 256

推荐采样参数(与基模型 generation_config 一致):思考模式 temperature=1.0、top_p=0.95、top_k=20;非思考模式 temperature=0.7、top_p=0.80、presence_penalty=1.5。默认推理力度为 xhigh,要更短回答可改 medium(不支持 low)。MLX 版跑原版 MLX 即可:安装 mlx 后拉取 prism-ml/Ternary-Bonsai-2-27B-mlx-2bit。

打包选择:PQ2_0 在 H100、A100、Blackwell 上解码更快,且在所有平台预处理更快(Apple Silicon 实测口径也是它);PTQ1_0 在 Ada 代显卡与 L4 上解码更快,内存最紧张的场景选它。

官方链接