35B 旗舰 vs 8B 轻量Edge0 两个档位到底差在哪【免费下载链接】Edge0-35B-A3B-preview项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview端侧大模型推理一直面临一个两难参数越多越聪明但内存装不下、速度跟不上。无界方舟开源的 Edge0 用SSD 流式 MoE 训练路由预测把 35B 级模型压进 3 GiB 活跃内存同时一口气放出 35B 与 8B 两个档位预览模型——这直接抛给开发者一个选择题同一套推理管线两档模型结构完全不同到底该选谁本文不打算复述35B 更强、8B 更快这种正确的废话而是直接拆开模型仓库config.json、model.safetensors.index.json、README.md与社区实测数据把两档模型的结构差异、激活专家数、内存占用、解码速度与推理质量逐项对齐最后给出一份按设备内存选档的决策清单。一、先看参数表两档模型差在哪根据仓库 README.md 与社区在 Mac mini M4 Pro24GB上的实测两档模型的关键指标可以这样对齐维度Edge0-35B-A3B旗舰Edge0-8B-A1B轻量基座模型Qwen3.6-35B-A3B8B 级 A1B MoE层数4024专家池 / 每 token 激活256 / K4K8量化int4部分 8-bitint4权重体积约 20.4 GB约 4.2 GB峰值活跃内存2.9 GiB约 1.0 GiB解码速度14.9–17.7 tok/s约快 1.5 倍AIME 2026 数学推理86.6约低 23 分几个数字值得先拆开看层数 40 对 24、激活宽度 K4 对 K8、权重 20.4GB 对 4.2GB。这三组差异决定了两个档位完全不同的性格——一个用深度换广度一个用宽度补深度。二、40 层 K4 vs 24 层 K8结构差异的本质层数与专家池旗舰的深打开 35B 的 config.jsontext_config段能直接看到旗舰版的骨架num_hidden_layers: 40, num_experts: 256, num_experts_per_tok: 8, hidden_size: 2048, moe_intermediate_size: 512, shared_expert_intermediate_size: 512, full_attention_interval: 4, max_position_embeddings: 26214440 层 Transformer 叠加 256 个专家的路由池hidden_size2048上下文窗口 262K。full_attention_interval: 4意味着每 4 层插入一个全注意力层其余 3 层使用线性注意力layer_types数组中同样能看到每 4 层一个full_attention的交替模式——这是 35B 能塞进端侧的关键工程之一全注意力的 KV cache 只存在于 25% 的层中长上下文的内存压力被显著摊薄。K 值每 token 真正花钱的专家数num_experts_per_tok8是基座模型 Qwen3.6-35B-A3B 的原始路由宽度记录而 README.md 中 edge0-35b 预览版标称的激活宽度是K4——也就是说35B 旗舰实际每 token 只调用 4 个专家8B 轻量版反而用K8的宽激活。这一反直觉的设计恰恰是两档模型的分水岭K 决定 SSD 读取带宽Edge0 的核心是把非激活专家留在 NVMe SSD 上按需流式加载内存只装活跃集。K 越大每 token 要从 SSD 拉取的专家越多读盘压力越大活跃内存也越高。35B 用 K4 把每 token 的专家加载量压到极限配合 256 专家的超大池用高稀疏度换端侧可行性K 决定模型容量表达8B 档位专家池小如果照搬 K4每层可用的知识容量太薄因此用 K8 的宽激活保证在 24 层深度下的表达能力。35B 靠深和大池8B 靠宽——这就是两个档位最核心的结构哲学差异。量化里的区别对待精度留给谁再往下看 config.json 的quantization段有一个容易被忽略的细节整体是 4-bit affine 量化group_size64但每一层的mlp.gate与mlp.shared_expert_gate单独标注为8-bit。也就是说路由权重和共享专家门控保留了更高精度。这在 SSD 流式架构里是合理且必要的路由决策直接决定该读哪些专家、跳过哪些专家一旦路由判错不仅要读盘补救还会拖累生成质量。旗舰版把精度预算优先给了决策层专家矩阵本身则用 4-bit 压缩体积——这也是 35B 能把 20.4GB 权重压进 2.9 GiB 活跃内存的底气之一。三、实测差异速度、内存与数学推理旗舰 35B官方基准Mac mini M4 Pro24GBREADME.md 的 Performance 段给出了官方实测指标数值解码速度14.9–17.7 tok/sPrefill 吞吐冷 / 热113 / 140 tok/s峰值活跃内存2.9 GiB解码 15 tok/s 对交互式对话已经可用prefill 140 tok/s 意味着长提示词的第一字延迟完全在端侧可接受的范围内。轻量 8B快 1.5 倍内存仅 1.0 GiB社区在相同 Mac mini M4 Pro 上的实测显示8B 解码速度约为 35B 的 1.5 倍峰值内存仅 1.0 GiB。24 层 小权重体积 全部专家更容易驻留缓存让 8B 在低内存设备上几乎零压力运行——这是移动端、嵌入式设备的主场。质量账35B 的 AIME 领先 23 分选择旗舰版并非没有代价体积 5 倍、速度慢 1/3但推理能力的差距是实打实的。社区对比数据显示35B 在 AIME 2026 数学推理上比 8B 高约 23 分。同时README.md 的 Quality 段给出了 35B 预览版自身的精度账本Benchmarkedge0-35b (int4)Qwen3.6-35B-A3B (fp16)AIME 202686.692.7HumanEval90.995.1GPQA-Diamond79.881.8MMLU-Pro81.084.6IFBench57.961.7平均79.283.2int4 量化 Recover-LoRA 蒸馏修复后相对 fp16 基座仅损失3.9 分平均而 AIME 仍保有 86.6 分。用 2.9 GiB 内存换来接近完整精度的旗舰推理这正是 35B 档位存在的意义。别忘了两件隐形引擎两档模型共享同一套 edge0 推理管线其中两项机制直接决定实测数据的含金量Prerouter路由预测训练一个轻量头提前一步预测下一 token 的专家路由让 SSD 读盘与前向计算重叠而不是互相阻塞。README.md 明确说明解码吞吐最高提升59%且收益随存储延迟、模型规模与路由宽度 K 增大而增长——8B 的 K8 更宽prerouter 的预取收益空间理论上更大Recover-LoRA冻结 int4 基座用 FP 教师蒸馏训练 LoRA 适配器恢复 4-bit 量化损失。适配器不合并进基座一个只读基座可以挂载多套 LoRA为批量服务与多任务切换留了口子。四、按设备内存选档位的决策清单把两档模型的数据摆平之后选型逻辑其实非常朴素——先量内存再看任务最后查存储1. 内存 2GB手机、平板、低端笔记本→ 选 8B峰值 1.0 GiB 的活跃内存让 8B 在 4GB 内存设备上都能与系统共存解码快 1.5 倍日常对话、摘要、改写等交互场景体验更跟手。牺牲的是深度推理能力。2. 内存 2–4GB8GB/16GB 内存的 Mac、常规 Windows 本→ 可选 35B2.9 GiB 峰值内存完全装得下 35B。需要数学、代码、多步推理时AIME 领先 23 分的差距会直接体现为答案质量。注意短上下文才能保持 3 GiB 以内的峰值——长上下文会额外吃 KV cache。3. 存储必须是 NVMe SSD且容量足够这是 Edge0 方案的前提不是可选项。20.4GB 的 35B 权重 4.2GB 的 8B 权重常驻磁盘专家按需流式加载SATA SSD 或机械硬盘的随机读延迟会直接拖垮解码速度。35B 建议预留 30GB 磁盘空间8B 预留 8GB。4. 按任务性质决定档位数学竞赛、复杂代码、长链条推理 → 35B高并发交互、低延迟响应、移动端常驻 → 8B。如果设备恰好内存充裕甚至可以两个都装按任务切换。五、同一管线随意切换换模型目录就能升降级两档模型最省心的地方在于它们共用同一套 edge0 推理管线切换档位不需要改任何代码只换模型目录。README.md 的 Quick start 展示了完整流程pip install -e githttps://github.com/Edge0-AI/edge0.git#eggedge0[fetch] # 下载模型到本地目录 huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview huggingface-cli download Edge0/Edge0-8b-a1b-preview --local-dir ./Edge0-8b-a1b-preview # 跑 35B export EDGE0_35B_MODEL$PWD/Edge0-35b-a3b-preview edge0 chat --name edge0-35b --prompt Introduce yourself # 换成 8B只需换 --name 指向另一个模型目录 edge0 chat --name edge0-8b --prompt Introduce yourself # 或者直接起 OpenAI 兼容服务 edge0 serve --name edge0-35b --port 8085这个即插即用的体验来自模型目录的自包含设计。看本仓库根目录的文件清单即可理解config.json——模型结构与量化配置model-00001-of-00004.safetensors 等 4 个分片——int4 基座权重model.safetensors.index.json 记录总计20,401,929,952 字节约 20.4GBlora_edge0_35b.safetensors——Recover-LoRA 适配器与基座同目录prerouter_edge0_35b.safetensors——路由预测头与基座同目录chat_template.jinja——内置思考模式think与工具调用的对话模板。README.md 明确指出LoRA 和 prerouter 适配器与基座检查点同目录存放、自动加载这个仓库本身就是一个完整的、可直接运行的 edge0 模型目录。所以升降级就是下载/指向另一个目录的事——8B 目录、35B 目录各自带齐适配器管线层零改动。结论Edge0 的两档模型不是简单的大 vs 小而是两条不同的设计路线35B 用 40 层深度 256 专家大池 K4 窄激活把稀疏性做到极致在 2.9 GiB 内保住接近 fp16 的旗舰质量8B 用 24 层 K8 宽激活把速度与内存下限推到移动端可用的 1.0 GiB。结构上深度换宽度实测上速度换质量唯一不变的是同一套 SSD 流式管线与换目录即换档的部署方式。对于开发者答案已经写在数据里内存低于 2GB老老实实用 8B内存有 3GB 富余且任务吃推理深度35B 的 23 分 AIME 差距值得你为它腾出磁盘空间。而两个都下载、按需切换或许是这台端侧推理机最完整的打开方式。【免费下载链接】Edge0-35B-A3B-preview项目地址: https://ai.gitcode.com/hf_mirrors/Edge0/Edge0-35B-A3B-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?