三值量化把 27B 模型压到 5.9GB,但视觉能力掉了 3 分
AIAI Summary (BLUF)
PrismML 发布的 Ternary Bonsai 2 27B 把三值量化推到了 27B 规模,模型体积仅 5.9GB,聚合基准保留率 98.2%,RTX 5090 上吞吐 143 tokens/s。编码几乎无损、指令遵循反升,但视觉掉 3 分,且需要自定义低比特 kernel 才能跑起来。
核心洞察
说实话,1.8% 这个数字放在发布会 PPT 上很好看,但拆开看分项就没那么乐观了。视觉掉了 3 分,知识推理掉了 2.7 分,这两个恰好是很多产品最吃重的能力。如果你的场景是纯文本编码或者数学推理,这模型确实香;但如果涉及图像理解,先别急着换。
核心结论
Ternary Bonsai 2 27BPrismML 发布的三值量化大语言模型,基座为 Qwen3.8 27B,权重取值为负一、零、正一,平均位宽 1.76 比特,模型体积 5.9GB,支持文本和图像,上下文窗口 262K token。 以 1.76 比特平均位宽将模型体积压缩至 5.9GB,相比 FP16 全精度的约 54GB 缩小 9.2 倍,聚合基准保留率达 98.2%(83.9 vs 85.4)。
分项能力损失差异显著:编码仅下降 0.59 分、数学下降 0.49 分,但视觉下降 3.05 分、知识推理下降 2.71 分,实际损失比 98.2% 的聚合数字更大。
指令遵循能力反而提升 1.41 分(82.66 vs 81.25),表明低比特量化不必然导致全面单调退化。
推理吞吐在 RTX 5090 上达 143 tokens/s、M5 Max 上达 46.8 tokens/s;RTX 4090 上每 token 能耗 0.714 毫瓦时,比全精度 8B 模型低约 40%。
模型采用 Apache 2.0 授权,支持 262K token 上下文和文本+图像多模态,但依赖自定义低比特 kernel为三值权重专门编写的计算内核,用于在特定硬件上高效执行矩阵运算。Ternary Bonsai 2 27B 的 CUDA 和 MLX 路径都依赖此类 kernel,导致无法直接使用现成推理客户端。(CUDA 和 MLX 两条路径),无法直接在 Ollama 或 LM Studio 中运行。
先说结论
PrismML 昨天发了 Ternary Bonsai 2 27B。这家公司从 Caltech 出来,拿了 Khosla Ventures、Cerberus 和 Google 的钱,只做一件事:把神经网络压小,同时尽量不把脑子压坏。
这次的结果我认真跑了一遍,值得聊。
数字先摆出来
| 项目 | 数值 |
|---|---|
| 基座 | Qwen3.8 27B |
| 权重量化 | 三值(负一、零、正一)+ FP16 分组缩放 |
| 平均位宽 | 1.76 比特每权重 |
| 模型体积 | 5.9GB |
| 上下文窗口 | 262K token |
| 模态 | 文本 + 图像 |
| 聚合基准 | 83.9(全精度版 85.4) |
| 能力保留率 | 98.2% |
| 推理吞吐 | RTX 5090 上 143 tokens/s;M5 Max 上 46.8 tokens/s |
| 能效 | RTX 4090 上 0.714 毫瓦时每 token |
| 授权 | Apache 2.0 |
上一代 Ternary Bonsai 27B 的保留率是 95%。这次到了 98% 以上。看着只涨了三个点,但低比特量化这个方向,最后几个百分点是最烧钱的。跑过量化的人应该都有体会,从 95 推到 98 花的功夫,可能比从 80 推到 95 还多。
三值量化一种神经网络压缩方法,将权重限制为负一、零、正一三种取值,理论上仅需约 1.585 比特表示,实际平均位宽因分组缩放系数而略高。相比传统量化,三值同时降低访存压力和算术强度。到底省在哪儿
每个权重只取负一、零、正一三种值。理论上表达三种状态只需要 log2(3) 约等于 1.585 比特。1.76 是算了分组缩放系数和未量化部分之后的实际平均值。
很多人只盯着压缩率看,但三值真正的收益还有另一半。
存储方面,27B 参数乘 1.76 比特大概 5.9GB。FP16 全精度是 27B 乘 2 字节,约 54GB。差了 9.2 倍,和官方说的超过 9 倍对得上。
计算方面才是重点。权重只有三种取值的时候,矩阵乘法里的乘法就退化成了加减法和条件累加。这是吞吐提升的另一半来源。传统量化降的是访存压力,三值同时把算术强度也降了。这个区别很关键。
代价也清楚:三种取值能表达的数值分辨率极低,必须靠分组缩放系数来补动态范围。分组越细,缩放系数开销越大,实际位宽越高;分组越粗,精度损失越明显。1.76 这个数就是团队在这个平衡点上的选择。
和传统量化比,差别在哪
| 路线 | 典型位宽 | 27B 体积量级 | 相对全精度的典型代价 |
|---|---|---|---|
| FP16 全精度 | 16 | 约 54GB | 基准 |
| GGUF Q4_K_M | 约 4.5 | 约 15GB | 困惑度退化约 1% 到 2% |
| AWQ 4 比特 | 4 | 约 14GB | 与 Q4_K_M 相当,质量略好 |
| 三值 / 1.58 比特路线 | 约 1.6 到 1.8 | 约 6GB | 本模型报告 98.2% 保留 |
传统量化和三值量化有一个根本区别。前者是训练后量化传统量化路线,模型训练完成后将权重映射到更粗的数值网格,误差只能靠标定数据事后补偿,常见方案如 GGUF Q4_K_M 和 AWQ 4 比特。,后者是把低比特表示嵌进训练流程里。
训练后量化的逻辑是:模型已经训好了,现在把权重映射到一个更粗的网格上,误差靠标定数据事后补。三值路线不一样,模型在被压到三值表示的过程中参与适配。权重表示形式是训练流程的一部分,不是事后套上去的壳。
这就解释了为什么三值能做到 98.2% 的保留率,而常见 4 比特方案通常有 1% 到 2% 的困惑度退化。位宽更低但代价更小,靠的不是压缩技巧,是把低比特变成了训练时的约束。
这条路线的先行者是 BitNet b1.58三值量化路线的先行者,同样使用三值权重,报告过在 3B 规模上匹配 FP16 LLaMA 的表现,同时实现约 2.71 倍推理加速、3.55 倍内存占用下降和 71.4% 的能耗降低。,同样用三值权重,之前在 3B 规模上报告过匹配 FP16 LLaMA 的表现,同时实现约 2.71 倍推理加速、3.55 倍内存占用下降和 71.4% 的能耗降低。Bonsai 2 的意义在于把这条路推到了 27B 级别,而且是通用模型,不是研究原型。
分项成绩里最值得看的三个格子
聚合分 83.9 对 85.4 的对比容易被 98.2% 这个数字盖过去。真正要看的是分项:
| 能力 | Bonsai 2 27B | Qwen3.8 27B | 差距 |
|---|---|---|---|
| 智能体与工具调用 | 77.57 | 79.74 | -2.17 |
| 编码 | 81.58 | 82.17 | -0.59 |
| 指令遵循 | 82.66 | 81.25 | +1.41 |
| 知识与推理 | 83.95 | 86.66 | -2.71 |
| 数学 | 96.57 | 97.06 | -0.49 |
| 视觉 | 78.59 | 81.64 | -3.05 |
三个格子单独说。
编码只掉 0.59 分。HumanEval+、LiveCodeBench v6、MBPP+、BigCodeBench 这套编码测试几乎无损。编码是压缩最敏感的领域之一,代码生成对数值扰动的容忍度远低于闲聊,一个 token 错就是语法错。这项能保住,说明三值表示对结构化推理的损害有限。
指令遵循反而涨了 1.41 分。从 81.25 升到 82.66,挺反直觉的。我猜 IFBench 和 IFEval 更侧重格式约束和条件遵循,三值化带来的轻微分布平滑恰好让模型在严格格式任务上更稳。不管原因是什么,至少说明量化不必然意味着全面单调退化。
视觉掉了 3.05 分,相对损失最大。从 81.64 掉到 78.59。多模态任务的中间张量形状更复杂、信息通路更长,低位宽在这里的代价更明显。官方宣传里说 Bonsai 2 提升了视觉能力,相比 Qwen3.6 27B 的 79.82 确实涨了,但和全精度基座比仍有肉眼可见的差距。
还有一个口径问题得指出来:数学类基准 96.57 这个分数会系统性拉高聚合均值。数学套件(AIME 2026、AIME 2025、GSM8K、MATH-500)本身就在 94 到 97 区间,任何模型的聚合总分都会被它抬起来。所以真实的能力损失应该按分项读,不要按 98.2% 这个单一数字读。知识推理和视觉上的实际损失,比 98.2% 听起来要大。
吞吐和能效才是本地部署的真门槛
143 tokens/s(RTX 5090)和 46.8 tokens/s(M5 Max)这两个数字,比压缩率更决定体验。
对编码 agent 来说,这个吞吐意味着编辑和调试循环可以保持交互感。本地模型的瓶颈历来不是答得对不对,而是等得久不久。延迟一超过某个阈值,你就会忍不住切回云端。
能效数字更值得注意。RTX 4090 上每 token 耗电 0.714 毫瓦时,比全精度运行的 8B 模型还低约 40%。
这个对比很有说服力:一个 27B 的三值模型,单 token 能耗低于一个 8B 的全精度模型。笔记本上的常驻助手不再需要频繁唤醒云端。能耗决定了本地推理能不能真正一直开着,而这正是本地部署相对云端最核心的价值。
生态领先,但你得自己动手
目前支持两条路:NVIDIA GPU 走 CUDA,Apple 设备(Mac、iPhone、iPad)走 MLX。两条路都依赖自定义低比特 kernel。
这是关键限制。你不能像下载一个 GGUF 文件那样,在 Ollama 或者 LM Studio 里点一下就跑起来。自定义 kernel 意味着硬件适配、编译环境和推理框架都得自己处理,社区微调生态和量化流程的复现方案也还需要时间。
权重是 Apache 2.0 授权,商业使用没有法律障碍。但权重可用和生态可用是两件不同的事。现阶段它更接近一个性能领先、需要动手能力的选项。
谁该换,谁不该换
值得考虑的场景:
- 显存紧张的设备。单张 8GB 卡或统一内存的 Mac 上想跑 27B 级能力,5.9GB 加 262K 上下文缓存仍然放得下。
- 需要长时间常驻的助手。能耗优势在笔记本上直接转化为可用时长。
- 编码 agent 循环。编码分项几乎无损,而这类任务对退化最敏感。
- 隐私敏感的高频任务。本地处理,仅对少数难任务选择性上云,这是混合编排最实际的形态。
暂时不必换的场景:
- 多模态工作流重度依赖。视觉分项损失最大,如果你的产品核心是图像理解,全精度基座或云端模型仍更稳。
- 需要成熟工具链。如果你的部署依赖现成的推理客户端和社区量化版本,GGUF 生态的成熟度短期内无法被替代。
- 追求绝对上限。三值的定位是在受限预算内交付最多有用智能,不是超越全精度模型。
这次发布把「27B 级能力需要多大显存」这个问题的答案,从 54GB 改成了 5.9GB,而且保留了 98.2%。真正需要你自己判断的是,剩下的那 1.8% 具体落在哪几个分项上,以及你的场景是否正好依赖那几项。
常见问题(FAQ)
Ternary Bonsai 2 27B 模型体积多大?能在消费级显卡上跑吗?
模型体积仅 5.9GB,采用三值量化,平均位宽 1.76 比特。在 RTX 5090 上吞吐达 143 tokens/s,RTX 4090 上能效为 0.714 毫瓦时每 token,适合显存紧张的设备本地部署。
三值量化相比传统 4 比特量化,精度保留和推理速度有何优势?
三值量化将低比特表示嵌入训练流程,聚合基准保留率 98.2%,而传统 4 比特量化通常有 1% 到 2% 的困惑度退化。三值同时降低访存和算术强度,吞吐提升更明显。
Ternary Bonsai 2 27B 在哪些任务上表现较差?适合什么场景?
视觉掉 3.05 分,知识推理掉 2.71 分,多模态和知识密集型任务损失较大。编码几乎无损,指令遵循反升 1.41 分,适合纯文本编码、数学推理及需要长时常驻的本地助手。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。


