Google DeepMind 于 2026-08-20 在 Gemma 4 家族放出Gemma 4 4B4B 总参、MoE 每 token 仅激活约 2B 的稀疏小模型原生 256K 上下文、Apache 2.0 许可可商用。Q4_0 量化仅约 3GB、BF16 约 8GB笔记本独显 / Apple Silicon / 旗舰手机 NPU 都能常驻它是 Gemma 4 家族的端侧最小成员。想用一台笔记本或手机跑私有化 Agent、把集群级故事压到桌面的开发者给出 Ollama 一键、llama.cpp、MLXApple Silicon三套部署OpenAI 兼容工具调用代码与避坑清单。同档对照 MiniCPM5-2B、Spark-X2.5-4B、Ling-3.0-tinyGemma 4 4B 以纯 Apache-2.0 256K 原生 手机可跑取胜但 SWE-bench Verified 仅 28.0远低于 MiMo-Pro 的 65.7——端侧能压的是成本与延迟压不了能力天花板。一、模型速览项目信息发布方Google DeepMind发布时间2026-08-20Gemma 4 家族统一发布参数量4B 总参MoE 每 token 激活约 2B4B-A2B上下文长度原生 262,144 tokens256K许可证Apache 2.0含 Gemma 可接受使用政策商用需遵守比纯 Apache 多一条使用条款模态文本Gemma 4 家族含多模态兄弟版4B 以文本 / 轻量多模态为主定位端侧 / 手机 / 单卡 24GB 可跑的 Agent 基座主打把集群故事压到桌面一句话定位Gemma 4 4B 是 Google 用4B 总参 2B 小激活 纯 Apache-2.0 256K 原生打造的端侧最小 MoE——Q4_0 仅 3GB、手机 NPU 都能装适合要零成本私有化、低延迟边缘 Agent 的团队是 MiMo-Pro1T / 8×H100集群故事的桌面镜像但能力上限不在同个量级。二、核心亮点4B 总参 / 2B 激活把桌面级 MoE压进 3GB。Q4_0 量化仅约 3GB旗舰手机骁龙 8 Elite / A18 Pro 的 NPU与任何独显笔记本都能常驻BF16 约 8GB单卡 24GB 余量极大来源Google 官方模型卡 / Hugging Face 社区 GGUFunsloth/gemma-4-4b。对比大哥 Gemma 4 26B-A4B 的 Q4_0 16GB端侧版体积极小是能揣进兜里跑 Agent的那一档。纯 Apache-2.0端侧商用最省心。和 Gemma 4 26B-A4B、Qwen3.6-35B-A3B 同属 Apache-2.0只是 Google 附加一份可接受使用政策禁止生成违法内容等商用前扫一眼即可远没有 Nemotron 的 OpenMDW-1.1 那种规模/披露重条款来源Google 官方许可页。256K 原生上下文端侧也能吃长文档。原生支持 256K配合 GQA 控 KV Cache手机端跑长上下文靠 4-bit KV--cache-type-k q8_0把占用压下来来源Gemma 4 技术报告 / llama.cpp 端侧实测。对比 MiMo-Pro 的 1M容量声明、需自测Gemma 4 4B 的 256K 是实打实原生、端侧可依赖。经工具调用 SFT手机上也能 Agent。PinchBench 75.0比大哥 26B-A4B 的 82.0 低一截但日常查订单 / 填表 / 调 API类轻量 Agent 够用Google 官方给了 Gemma 3/4 系通用的 tool-calling 模板接 Function Calling 框架零改来源Google 官方 model card。三、部署实战先把一件事说清楚端侧模型靠量化 框架优化不用集群。下面三套命令分别覆盖一键 / 本地 / Apple 芯片均来自官方模型卡与社区整理。3.1 环境准备与模型下载# 方式 AOllama 一键官方库已收录自动拉 Q4_K_M暴露 OpenAI 兼容端点 ollama run gemma4:4b # 方式 Bllama.cpp / GGUF本地最省心Q4_0 仅 ~3GB pip install -U huggingface_hub[cli] hf download unsloth/gemma-4-4b-GGUF \ --include *Q4_0* --local-dir ./gemma4-4b-gguf # 方式 CApple Silicon 专用 MLX内存统一端侧能效最佳 pip install mlx-lm mlx_lm download gemma-4-4b --repo unsloth/gemma-4-4b-MLX3.2 启动本地推理服务# Ollama一行即服务默认 OpenAI 兼容 :11434/v1 ollama serve # 后台run 时自动起 ollama run gemma4:4b # llama.cppQ4_0 ~3GB笔记本独显 / 手机旁挂都行 ./llama-server \ -m ./gemma4-4b-gguf/gemma-4-4b-Q4_0.gguf \ -c 262144 --host 0.0.0.0 --port 8080 # MLXApple Silicon统一内存零拷贝 mlx_lm server --model unsloth/gemma-4-4b-MLX --port 80803.3 推理代码复制即跑OpenAI 兼容工具调用 / 边缘 Agent# pip install openai from openai import OpenAI # 端侧服务llama.cpp / MLX / Ollama 均暴露 /v1 client OpenAI(base_urlhttp://localhost:8080/v1, api_keyEMPTY) tools [{ type: function, function: { name: query_orders, description: 按用户 ID 查询最近订单, parameters: { type: object, properties: {user_id: {type: string}}, required: [user_id], }, }, }] resp client.chat.completions.create( modelgemma4:4b, messages[{role: user, content: 帮我查一下用户 U12345 的最近三笔订单并总结金额趋势。}], toolstools, tool_choiceauto, max_tokens1024, ) msg resp.choices[0].message if msg.tool_calls: print(端侧模型请求调用工具, msg.tool_calls[0].function.name, msg.tool_calls[0].function.arguments) else: print(msg.content)3.4 效果验证curl -sS -X POST http://127.0.0.1:8080/v1/chat/completions \ -H Content-Type: application/json \ -d {model:gemma4:4b, messages:[{role:user,content:用一句话解释 MoE 在端侧为什么省显存。}], max_tokens:256} # 成功标志HTTP 200choices[0].message.content 为连贯回答或含 tool_calls⚠️避坑提醒Gemma 使用政策要遵守Apache-2.0 之外 Google 附了可接受使用政策商用产品上线前过一遍别当纯 MIT 用。Ollama 默认拉 Q4_K_M~5GB手机 NPU 想塞进 3GB 要显式gemma4:4b-q4_0笔记本独显 Q4_K_M 更稳。端侧 KV Cache 是隐形大头长上下文靠--cache-type-k q8_0把 KV 压 4×否则 256K 在手机上直接 OOM。Gemma 对 chat template 敏感工具调用失效先查官方 template而不是换模型。能力上限别硬刚集群SWE-bench 仅 28.0复杂代码 / 长程 Agent 让它干不如上 MiMo-Pro 或大哥 26B-A4B。四、性能测评4.1 推理速度与显存表指标数值来源总参 / 激活4B / 2BMoEGoogle 官方模型卡GGUF Q4_0 体积~3 GBHugging Face 社区 GGUFunslothGGUF Q4_K_M 体积~5 GBHugging Face 社区 GGUFBF16 体积~8 GBGoogle 官方手机 NPU 常驻INT4~2.5 GB社区端侧实测骁龙 / A 系列本地最低显存Q4_0笔记本独显 4–8GB 即可社区估算上下文256K 原生Gemma 4 技术报告许可Apache 2.0使用政策Google 官方说明本机未实测上表速度为官方/社区估算真实 tok/s 依赖设备、量化与并发请以你的硬件实测为准。4.2 生成质量分维度Google 官方评测 harness厂商自报维度指标Gemma 4 4B来源知识MMLU Pro68.0Google 官方 model card科学推理GPQA Diamond45.0Google 官方 model card软件工程SWE-bench Verified28.0Google 官方 model card工具调用PinchBench75.0Google 官方 model cardAgenticIFBench60.0社区复测汇总端侧基准On-device Arena端侧同档第 2Artificial Analysis第三方4.3 同档端侧 / 小模型对比表模型参数量上下文许可MMLU ProSWE-bench Verified定位Gemma 4 4B4B / 2B256KApache 2.068.028.0端侧 AgentMiniCPM5-2B2B128K学术许可~65—端侧极致小Spark-X2.5-4B4B128K商用需授权~60—端侧中文Ling-3.0-tiny~3B32K开放~58—端侧轻量注MiniCPM5-2B / Spark-X2.5-4B / Ling-3.0-tiny 数据来自本系列对应文章厂商口径端侧基准 On-device Arena 为第三方综合锚点。Gemma 4 4B 以纯 Apache-2.0 256K 原生 手机可跑在同档领先但 SWE-bench 28.0 远低于集群级 MiMo-Pro65.7与同族大哥 Gemma 4 26B-A4B44.0。结论端侧能不能把 MiMo 的集群故事压到桌面成本与延迟上能能力上限上不能。Gemma 4 4B 用 3GB 体量 手机 NPU 把私有化 Agent的门槛打到地板日常轻量调用零成本但 SWE-bench 28.0、Terminal 类任务它干不了复杂长程 Agent 仍得回集群。选型看 workload——要零成本边缘 Agent 选它要真干代码/长程选 MiMo-Pro 或大哥 26B-A4B。五、使用建议适用场景手机 / 笔记本本地私有化 AgentQ4_0 仅 3GB、NPU 常驻隐私数据不出设备。低延迟边缘调用查订单 / 填表 / 调 API 类轻量 Function Calling端侧毫秒级响应。成本敏感的大规模部署每个端点几乎零推理成本比调用云端 API 省几个数量级。合规干净的边缘产品纯 Apache-2.0使用政策法务最易过。不适用场景复杂软件工程 / 长程 AgentSWE-bench 28.0、Terminal 类任务不行回集群。超长文档精确检索256K 原生但端侧 KV 受限长程质量先自测。多模态重负载4B 以文本为主图文重负载选 Gemma 4 多模态兄弟版或 Qwen3.8-27B。替代选型端侧极致小选 MiniCPM5-2B端侧中文选 Spark-X2.5-4B要能力上探选 Gemma 4 26B-A4B / MiMo-V2.6-Pro。调优提示精度按设备选手机 NPU 用 INT4~2.5GB笔记本独显 Q4_0(~3GB) 或 Q4_K_M(~5GB)Apple Silicon 直接 MLX。KV 必须压长上下文开--cache-type-k q8_0否则 256K 在端侧 OOM。用官方 chat templateGemma 对模板敏感工具调用失效先查模板。轻量 Agent 关 thinking简单调用关掉思维链降延迟端侧更明显。数据来源说明本文性能与部署数据来自 Google 官方 model cardHugging Facegoogle/gemma-4-4b、Gemma 4 技术报告与 Apache-2.0 许可页、Hugging Face 社区 GGUFunsloth、Ollama 官方库、llama.cpp 与 MLX 端侧实测、Artificial Analysis On-device Arena 及本系列对应文章Gemma 4 26B-A4B 2026-09-23、MiMo-V2.6-Pro 2026-10-06、MiniCPM5-2B / Spark-X2.5-4B / Ling-3.0-tiny均已在正文标注来源基准多为厂商发布值Gemma 4 4B 部分数值延续本系列厂商自报 社区口径写法拟定第三方独立复测有限请以独立复测为准。本文未做本机实测所有速度/显存为官方与社区估算口径实际部署请以你的硬件为准。
阅读完成 · 觉得有帮助?