首页 / 资讯中心 / 文章详情

“智能密度”是什么?36Kr 都在讲的新叙事,Bonsai 2 用 27B/3.9GB 给了答案

“智能密度”是什么?36Kr 都在讲的新叙事,Bonsai 2 用 27B/3.9GB 给了答案 ★ FEATURED ARTICLE
“智能密度”是什么36Kr 都在讲的新叙事Bonsai 2 用 27B/3.9GB 给了答案【免费下载链接】Ternary-Bonsai-2-27B-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit过去两年大模型行业的叙事几乎被一条曲线统治规模法则Scaling Law——参数从 7B 涨到 70B、再到千亿级训练集群从千卡做到十万卡仿佛智能的上限只与参数量和算力投入成正比。直到 2026 年一个词开始频繁出现在科技媒体的标题里“智能密度”Intelligence Density。36Kr 用“从规模转向智能密度”来概括 PrismML 的新路线IT 之家报道 Bonsai 2 27B “以 1/9 内存占用保留基座模型 98.2% 性能”开源社区则围绕 1-bit/三值量化展开密集实测与讨论。这不是概念炒作。Bonsai 2 27B 给出的答卷是270 亿参数5.9GB1-bit 版 3.9GB保留基座模型 98.2% 的智能水平。本文从仓库源码出发拆解“智能密度”怎么算、这套低比特工程如何成立以及它对算力军备竞赛格局意味着什么。智能密度怎么算每 GB 参数能换多少能力“智能密度”并非营销话术而是一个可以精确计算的工程指标。在 README.md 的 Intelligence Density 章节中PrismML 给出了明确公式D -log2(1 - score/100) / size_GB其中score是模型在统一基准集上的平均分衡量“能力”size_GB是部署占用衡量“成本”。分子用-log2(1 - score/100)把“得分比例”映射到比特量纲分母是模型吃掉的存储/内存空间——最终单位是 1/GB即“每 GB 部署成本换来的智能比特数”。用该公式对仓库数据做独立核算结果与模型卡完全一致形态部署体积基准平均分智能密度 (1/GB)Qwen3.8-27B FP1654 GB86.320.053Qwen3.8-27B UD-Q4_K_XL“4-bit”17.6 GB85.180.157Qwen3.8-27B IQ2_XXS“2-bit”9.4 GB72.590.199Bonsai 2 27B5.80 GB84.780.469数据来源README.md 的 Intelligence Density 表这组数字透露两个关键信息密度提升不是靠降分换来的。FP16 版密度 0.053Bonsai 2 27B 密度 0.469接近 9 倍提升而基准分只从 86.32 降到 84.78保留 98.2%。杠杆全部压在体积端。传统“低比特”量化在密度赛道上并不占优。被广泛称为“2-bit”的 IQ2_XXS 真实位宽其实有 2.8 bits/weight、体积 9.4GB密度仅 0.199——不到 Bonsai 2 的一半。这类方法是事后量化把训练好的 FP16 权重压到低比特能力在长推理链任务上大量流失AIME26 掉到 57.5、LiveCodeBench 掉到 56.4详见 README.md 分项基准表体积却仍未压到位。这正是社区讨论反复出现的争议点很多“2-bit 模型”是标签上的 2-bit而非表示上的 2-bit。Bonsai 2 的做法是从根上换一种表示。从规模法则到密度法则真·低比特的工程链条Bonsai 2 27B 的密度优势来自一条完整的技术链路每一环都能在仓库源码中找到对应实现。第一环端到端三值权重Ternary g128。与“训练完再压缩”不同Bonsai 系列在训练阶段就约束权重落在{-1, 0, 1}三值集合上。一个三值符号的信息量是 log₂3 ≈ 1.585 bits配合每 128 个权重共享一个 FP16 缩放因子理想存储成本约 1.71 bits/weight。README 明确指出这是“end-to-end ternary language weights ... with no high-precision escape hatches”——embedding、注意力投影、MLP 投影、LM head 全部三值化不存在藏在低比特标签背后的高精度后门。第二环Hadamard 旋转基。直接三值化会损失过多信息Bonsai 2 的解法是先把权重做块级正交变换再量化。hadamard.json 记录了完整变换契约block_size: 1024、transform: normalized-sylvester-walsh-hadamard以及数百个需要施加变换的权重名embed_tokens走逆变换。旋转被离线折叠进存储权重“不花额外比特、不产生额外权重流量”运行时只做匹配的激活变换——runtime/runtime.py 的fwht()与Packed模块实现了这一点打包权重在mx.quantized_matmul中直接被消费从不展开回 FP16。第三环混合注意力撑起 262K 上下文。27B 模型在 5.9GB 里跑起来还离不开架构侧支持。config.json 的layer_types数组显示64 层中约 75% 为 linear attention、每 4 层插入 1 层 full attention。线性注意力大幅压低长上下文 KV 状态成本262K 上下文在端侧才变得可负担——max_position_embeddings: 262144直接写在配置里。第四环打包格式与逐比特验证。三值权重要落地工程必须有不打折扣的运行时。Bonsai 2 提供 PTQ1_0密集三值5.95GB与 PQ2_02-bit 槽位7.21GB两种 GGUF 打包本仓库则是 MLX 2-bit 打包7.67GB 语言模型 0.92GB 视觉塔共 8.60GB。runtime/codec.py 实现两种格式到 MLX 仿射 2-bit 块的无损转码——PQ2_0 逐字解码、PTQ1_0 做基 3 位解包并验证组级缩放与 GGUF 版本逐比特一致reload-validation.json 记录了reload_logits_exact: true、packed_modules: 402即重载后 logits 与打包前逐元素一致。这条链条的收益在实测吞吐上直接体现跨平台吞吐表中README.mdRTX 5090 上 token 生成 129.9 tok/s72W 的 L4 也能跑到 29.8 tok/sApple M5 Pro 笔记本 28.1 tok/s、CPUGPU 整机功耗仅 34.1W——对比 NVIDIA 卡的 300–455W 板级功耗。“270 亿参数在笔记本上以交互速度运行”这句话在两年前还是反常识的。对算力军备竞赛格局的潜在冲击智能密度叙事的价值不在于否认规模法则而在于开辟第二条曲线当算力增长放缓、单卡内存触顶、能耗成为硬约束时“同等智能、十分之一体积”的模型开始重新定义竞争力。冲击一端侧成为第一落点。1-bit Bonsai 27B 版仅 3.9GB社区实测已支持在 iPhone 17 Pro 上以约 11 tok/s 本地运行被媒体称为“手机 AI 的 DeepSeek 时刻”。Bonsai 2 27B 更进一步自带 0.92GB 视觉塔——runtime/vision_artifact.py 明确其“unrotated, unquantized, plain FP16 passthrough”即官方 Qwen 视觉塔原样保留离线多模态 Agent 成为现实。高通与 PrismML 联手把 1-bit Bonsai 塞进 AI 眼镜、实现离线识图问答的报道正是这一冲击的产业注脚。冲击二Agentic 场景的“本地可行性”。密度叙事最容易被打脸的场景是“看着全能、用起来崩”。Bonsai 2 27B 在 14 项思考模式基准中数学 96.57FP16 基线 97.06、代码 89.42基线 89.07、指令遵循 82.66基线 81.25、Agentic 工具调用 74.92基线 76.74数据见 README.md 技能分类表。传统低比特方法的退化是选择性的——集中在需要持续推理链的任务上恰是 Agent 的核心场景而 Bonsai 2 恰好守住了这些基准。这与社区实测“Math/Coding 保留良好、Tool Calling 存在数个百分点下降”的判断一致Agentic 可靠性仍有边界但“本地 27B Agent 循环”已从演示进入可用区间。冲击三算力定价逻辑松动。一张 409024GB 显存就能跑 27B 级模型意味着“高性能推理”不再绑定数万美元的单卡。IT 之家实测 Bonsai 2 27B 在 RTX 4090 上能效 0.714 mWh/token比全精度 8B 模型还低约 40%。当同参数级的智能可以用约 1/9 的内存、约 1/10 的功耗交付云端按 token 定价、数据中心 GPU 采购乃至训练端“参数军备竞赛”的逻辑都会被重新审视——训练成本不会消失但部署端的分发成本被急剧压缩这改变的是整个商业模型的底座。当然这套方案并非没有边界。Bonsai 2 27B 的基准分仍低于 FP16 基线约 1.5 个百分点差距集中在知识与视觉等最苛刻类别PTQ1_0 密集打包在部分 GPU 上因解包算术反而变慢说明“密度”与“速度”仍需按目标硬件权衡追求最后几点精度时传统 4-bit 高端量化仍是备选。但智能密度指标的价值恰恰在此——它第一次让“能力/字节”成为可量化、可比较、可优化的工程目标。从规模法则到密度法则的叙事转向本质是行业从“堆得动算力就有智能”进入“省着花算力也能有智能”的新阶段。Bonsai 2 27B 用 27B/5.9GB1-bit 版 3.9GB的答卷证明智能的上限不该只由参数规模定义更该由“每一 GB 里装了多少智能”来定义。这条曲线的斜率才刚刚开始被认真刻画。【免费下载链接】Ternary-Bonsai-2-27B-mlx-2bit项目地址: https://ai.gitcode.com/hf_mirrors/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站