GEOZ

三值量化把 27B 模型压到 5.9GB,但视觉能力掉了 3 分

2026/9/21
三值量化把 27B 模型压到 5.9GB,但视觉能力掉了 3 分

AIAI Summary (BLUF)

PrismML 发布的 Ternary Bonsai 2 27B 把三值量化推到了 27B 规模,模型体积仅 5.9GB,聚合基准保留率 98.2%,RTX 5090 上吞吐 143 tokens/s。编码几乎无损、指令遵循反升,但视觉掉 3 分,且需要自定义低比特 kernel 才能跑起来。

核心洞察

说实话,1.8% 这个数字放在发布会 PPT 上很好看,但拆开看分项就没那么乐观了。视觉掉了 3 分,知识推理掉了 2.7 分,这两个恰好是很多产品最吃重的能力。如果你的场景是纯文本编码或者数学推理,这模型确实香;但如果涉及图像理解,先别急着换。


核心结论

  1. Ternary Bonsai 2 27B 以 1.76 比特平均位宽将模型体积压缩至 5.9GB,相比 FP16 全精度的约 54GB 缩小 9.2 倍,聚合基准保留率达 98.2%(83.9 vs 85.4)。

  2. 分项能力损失差异显著:编码仅下降 0.59 分、数学下降 0.49 分,但视觉下降 3.05 分、知识推理下降 2.71 分,实际损失比 98.2% 的聚合数字更大。

  3. 指令遵循能力反而提升 1.41 分(82.66 vs 81.25),表明低比特量化不必然导致全面单调退化。

  4. 推理吞吐在 RTX 5090 上达 143 tokens/s、M5 Max 上达 46.8 tokens/s;RTX 4090 上每 token 能耗 0.714 毫瓦时,比全精度 8B 模型低约 40%。

  5. 模型采用 Apache 2.0 授权,支持 262K token 上下文和文本+图像多模态,但依赖自定义低比特 kernel(CUDA 和 MLX 两条路径),无法直接在 Ollama 或 LM Studio 中运行。

先说结论

PrismML 昨天发了 Ternary Bonsai 2 27B。这家公司从 Caltech 出来,拿了 Khosla Ventures、Cerberus 和 Google 的钱,只做一件事:把神经网络压小,同时尽量不把脑子压坏。

这次的结果我认真跑了一遍,值得聊。

数字先摆出来

项目 数值
基座 Qwen3.8 27B
权重量化 三值(负一、零、正一)+ FP16 分组缩放
平均位宽 1.76 比特每权重
模型体积 5.9GB
上下文窗口 262K token
模态 文本 + 图像
聚合基准 83.9(全精度版 85.4)
能力保留率 98.2%
推理吞吐 RTX 5090 上 143 tokens/s;M5 Max 上 46.8 tokens/s
能效 RTX 4090 上 0.714 毫瓦时每 token
授权 Apache 2.0

上一代 Ternary Bonsai 27B 的保留率是 95%。这次到了 98% 以上。看着只涨了三个点,但低比特量化这个方向,最后几个百分点是最烧钱的。跑过量化的人应该都有体会,从 95 推到 98 花的功夫,可能比从 80 推到 95 还多。

三值量化到底省在哪儿

每个权重只取负一、零、正一三种值。理论上表达三种状态只需要 log2(3) 约等于 1.585 比特。1.76 是算了分组缩放系数和未量化部分之后的实际平均值。

很多人只盯着压缩率看,但三值真正的收益还有另一半。

存储方面,27B 参数乘 1.76 比特大概 5.9GB。FP16 全精度是 27B 乘 2 字节,约 54GB。差了 9.2 倍,和官方说的超过 9 倍对得上。

计算方面才是重点。权重只有三种取值的时候,矩阵乘法里的乘法就退化成了加减法和条件累加。这是吞吐提升的另一半来源。传统量化降的是访存压力,三值同时把算术强度也降了。这个区别很关键。

代价也清楚:三种取值能表达的数值分辨率极低,必须靠分组缩放系数来补动态范围。分组越细,缩放系数开销越大,实际位宽越高;分组越粗,精度损失越明显。1.76 这个数就是团队在这个平衡点上的选择。

和传统量化比,差别在哪

路线 典型位宽 27B 体积量级 相对全精度的典型代价
FP16 全精度 16 约 54GB 基准
GGUF Q4_K_M 约 4.5 约 15GB 困惑度退化约 1% 到 2%
AWQ 4 比特 4 约 14GB 与 Q4_K_M 相当,质量略好
三值 / 1.58 比特路线 约 1.6 到 1.8 约 6GB 本模型报告 98.2% 保留

传统量化和三值量化有一个根本区别。前者是训练后量化,后者是把低比特表示嵌进训练流程里。

训练后量化的逻辑是:模型已经训好了,现在把权重映射到一个更粗的网格上,误差靠标定数据事后补。三值路线不一样,模型在被压到三值表示的过程中参与适配。权重表示形式是训练流程的一部分,不是事后套上去的壳。

这就解释了为什么三值能做到 98.2% 的保留率,而常见 4 比特方案通常有 1% 到 2% 的困惑度退化。位宽更低但代价更小,靠的不是压缩技巧,是把低比特变成了训练时的约束。

这条路线的先行者是 BitNet b1.58,同样用三值权重,之前在 3B 规模上报告过匹配 FP16 LLaMA 的表现,同时实现约 2.71 倍推理加速、3.55 倍内存占用下降和 71.4% 的能耗降低。Bonsai 2 的意义在于把这条路推到了 27B 级别,而且是通用模型,不是研究原型。

分项成绩里最值得看的三个格子

聚合分 83.9 对 85.4 的对比容易被 98.2% 这个数字盖过去。真正要看的是分项:

能力 Bonsai 2 27B Qwen3.8 27B 差距
智能体与工具调用 77.57 79.74 -2.17
编码 81.58 82.17 -0.59
指令遵循 82.66 81.25 +1.41
知识与推理 83.95 86.66 -2.71
数学 96.57 97.06 -0.49
视觉 78.59 81.64 -3.05

三个格子单独说。

编码只掉 0.59 分。HumanEval+、LiveCodeBench v6、MBPP+、BigCodeBench 这套编码测试几乎无损。编码是压缩最敏感的领域之一,代码生成对数值扰动的容忍度远低于闲聊,一个 token 错就是语法错。这项能保住,说明三值表示对结构化推理的损害有限。

指令遵循反而涨了 1.41 分。从 81.25 升到 82.66,挺反直觉的。我猜 IFBench 和 IFEval 更侧重格式约束和条件遵循,三值化带来的轻微分布平滑恰好让模型在严格格式任务上更稳。不管原因是什么,至少说明量化不必然意味着全面单调退化。

视觉掉了 3.05 分,相对损失最大。从 81.64 掉到 78.59。多模态任务的中间张量形状更复杂、信息通路更长,低位宽在这里的代价更明显。官方宣传里说 Bonsai 2 提升了视觉能力,相比 Qwen3.6 27B 的 79.82 确实涨了,但和全精度基座比仍有肉眼可见的差距。

还有一个口径问题得指出来:数学类基准 96.57 这个分数会系统性拉高聚合均值。数学套件(AIME 2026、AIME 2025、GSM8K、MATH-500)本身就在 94 到 97 区间,任何模型的聚合总分都会被它抬起来。所以真实的能力损失应该按分项读,不要按 98.2% 这个单一数字读。知识推理和视觉上的实际损失,比 98.2% 听起来要大。

吞吐和能效才是本地部署的真门槛

143 tokens/s(RTX 5090)和 46.8 tokens/s(M5 Max)这两个数字,比压缩率更决定体验。

对编码 agent 来说,这个吞吐意味着编辑和调试循环可以保持交互感。本地模型的瓶颈历来不是答得对不对,而是等得久不久。延迟一超过某个阈值,你就会忍不住切回云端。

能效数字更值得注意。RTX 4090 上每 token 耗电 0.714 毫瓦时,比全精度运行的 8B 模型还低约 40%。

这个对比很有说服力:一个 27B 的三值模型,单 token 能耗低于一个 8B 的全精度模型。笔记本上的常驻助手不再需要频繁唤醒云端。能耗决定了本地推理能不能真正一直开着,而这正是本地部署相对云端最核心的价值。

生态领先,但你得自己动手

目前支持两条路:NVIDIA GPU 走 CUDA,Apple 设备(Mac、iPhone、iPad)走 MLX。两条路都依赖自定义低比特 kernel。

这是关键限制。你不能像下载一个 GGUF 文件那样,在 Ollama 或者 LM Studio 里点一下就跑起来。自定义 kernel 意味着硬件适配、编译环境和推理框架都得自己处理,社区微调生态和量化流程的复现方案也还需要时间。

权重是 Apache 2.0 授权,商业使用没有法律障碍。但权重可用和生态可用是两件不同的事。现阶段它更接近一个性能领先、需要动手能力的选项。

谁该换,谁不该换

值得考虑的场景:

  • 显存紧张的设备。单张 8GB 卡或统一内存的 Mac 上想跑 27B 级能力,5.9GB 加 262K 上下文缓存仍然放得下。
  • 需要长时间常驻的助手。能耗优势在笔记本上直接转化为可用时长。
  • 编码 agent 循环。编码分项几乎无损,而这类任务对退化最敏感。
  • 隐私敏感的高频任务。本地处理,仅对少数难任务选择性上云,这是混合编排最实际的形态。

暂时不必换的场景:

  • 多模态工作流重度依赖。视觉分项损失最大,如果你的产品核心是图像理解,全精度基座或云端模型仍更稳。
  • 需要成熟工具链。如果你的部署依赖现成的推理客户端和社区量化版本,GGUF 生态的成熟度短期内无法被替代。
  • 追求绝对上限。三值的定位是在受限预算内交付最多有用智能,不是超越全精度模型。

这次发布把「27B 级能力需要多大显存」这个问题的答案,从 54GB 改成了 5.9GB,而且保留了 98.2%。真正需要你自己判断的是,剩下的那 1.8% 具体落在哪几个分项上,以及你的场景是否正好依赖那几项。

常见问题(FAQ)

Ternary Bonsai 2 27B 模型体积多大?能在消费级显卡上跑吗?

模型体积仅 5.9GB,采用三值量化,平均位宽 1.76 比特。在 RTX 5090 上吞吐达 143 tokens/s,RTX 4090 上能效为 0.714 毫瓦时每 token,适合显存紧张的设备本地部署。

三值量化相比传统 4 比特量化,精度保留和推理速度有何优势?

三值量化将低比特表示嵌入训练流程,聚合基准保留率 98.2%,而传统 4 比特量化通常有 1% 到 2% 的困惑度退化。三值同时降低访存和算术强度,吞吐提升更明显。

Ternary Bonsai 2 27B 在哪些任务上表现较差?适合什么场景?

视觉掉 3.05 分,知识推理掉 2.71 分,多模态和知识密集型任务损失较大。编码几乎无损,指令遵循反升 1.41 分,适合纯文本编码、数学推理及需要长时常驻的本地助手。

Roger深圳
本文由 Roger 审核,最后更新于 2026年9月21日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。