本地LLM派还是云端API派Supermemory五种部署姿势横评隐私团队照抄【免费下载链接】supermemoryMemory and context engine app that is extremely fast, scalable, and can be run fully locally. The Memory API for the AI era.项目地址: https://gitcode.com/GitHub_Trending/su/supermemory给 AI 装长期记忆正在成为 Agent 工程的新基础设施层。但记忆层与普通 API 服务有个本质区别它是长驻运行的你投喂进去的是对话记录、用户画像、内部文档这类最敏感的数据。于是部署问题从技术细节上升成了合规决策——数据留在哪、模型跑在哪、提取质量能换多少隐私直接决定了你选哪条路。Supermemory 的特殊之处在于它把这个问题拆成了五条可以自由组合的路径托管云平台、单机自托管二进制、全离线本地 LLM、混合架构本地记忆引擎 云端模型、以及面向无服务器环境的 SMFS 文件系统。官方文档的原话是can be run fully locallyREADME而仓库里自托管文档则把整条链路拆成了一个引擎、同一套 API、五种跑法。本文基于官方文档与仓库源码把五种部署姿势、隐私取舍和分场景选型表一次讲清楚。一、先看懂架构为什么同一个引擎能拆出五种跑法Supermemory 的核心不是向量数据库套壳而是两个自有组件How Supermemory works学习模型learning model决定学什么、什么重要、何时遗忘、如何建立关系时序向量图谱引擎temporal vector-graph engine事实存储与检索底座向量、全文检索、图谱三合一。一条数据进来走的是固定流水线queued → extracting → chunking → embedding → indexing → done随后进入第二阶段dreaming记忆入图。dreaming 分两种模式dynamic把相关文档打包成连贯单元再生成记忆适合生产环境instant单文档立即入图适合 demo 和需要即刻可查的场景quickstart.mdx。最终同一份文档产出三样东西Document chunksRAG 检索用、Memories图谱事实、Profile用户画像约 50ms 一次调用。关键在于本地自托管服务器与托管平台讲的是同一种 API。SDK 只需要改一行baseUrl就能在两者之间切换overview.mdxconst client new Supermemory({ apiKey: sm_..., // 首次启动自动生成 baseUrl: http://localhost:6767, // 唯一要改的地方 })正是同一 API、不同后端的设计让五种部署姿势有了横向对比的基准。而隔离模型也很朴素——每个命名空间namespacev3/v4 时代的 container tag是一条硬隔离边界用户、租户、项目各占一个空间quickstart.mdx。二、五种部署姿势逐一拆解姿势一托管云平台——全家桶模式这是功能最全的路线。console.supermemory.ai负责发 key 与用量管理api.supermemory.ai承接所有请求云端跑的是官方专有模型专门为长周期数据理解与记忆提取调优提取质量最高、规模化成本最低overview.mdx。云端独占四样东西configuration.mdx 明确定义为 platform-onlyConnectorsGoogle Drive、Gmail、Notion、OneDrive、GitHub、Granola、Web Crawler 的实时同步webhook 每 4 小时定时详见 connectors/overview.mdxSupermemory MCP托管在https://mcp.supermemory.ai/mcp的 MCP 服务走 OAuth可直接接入 Claude Desktop、Cursor、ChatGPT Web 等客户端apps/mcp/README.md优化的记忆提取管线比自带 key 更高质、更低成本托管规模全球分布式基础设施无需自己做容量规划。一句话总结要 Connectors、要 MCP、要组织级管控就别想着自托管——这些功能在自托管二进制里是物理不存在的。姿势二单机自托管二进制——零配置私有化这是一条命令、一个进程、一个目录的路线curl -fsSL https://supermemory.ai/install | bash # 或 npx supermemory local supermemory-server首次启动会完成三件事内嵌图谱引擎自动建库无需任何数据库、本地 embedding 模型Xenova/bge-base-en-v1.5768 维直接内置、并打印专属 API key┌──────────────────────────────────────────────────┐ │ url http://localhost:6767 │ │ database ./.supermemory │ │ api key sm_xxxxxxxxxxxxxxxxxxxxxxxxxxxxxx │ │ org id xxxxxxxxxxxxxxxxxxxxxx │ └──────────────────────────────────────────────────┘所有状态落在一个目录./.supermemory/或$SUPERMEMORY_DATA_DIR备份就是拷贝目录迁移就是搬目录quickstart.mdx。许可证方面自托管在 lite license 限额内免费需要提醒的是服务器二进制本身不开源开源的是 SDK 与周边组件托管平台才是完整产品所在地local-vs-enterprise.mdx。姿势三全离线本地 LLM——数据真正不出门自托管二进制的杀手锏是完全离线。因为 LLM 只负责摘要、上下文分块和记忆提取这些智能步骤而它们都走 OpenAI 兼容端点协议——这意味着 Ollama、LM Studio、vLLM、llama.cpp 全都能顶上configuration.mdxOPENAI_BASE_URLhttp://localhost:11434/v1 \ OPENAI_API_KEYollama \ OPENAI_MODELgpt-oss:20b \ supermemory-server本地图谱引擎 本地 embedding 本地 LLM 三者齐备后文本记忆处理在 embedding 模型首次下载完成后可以全程留在本机。补上两个开关就能做到零出网SUPERMEMORY_DISABLE_TELEMETRY1关闭遥测URL 摄取用的是托管 reader 服务离线场景请改用本地文本或文件输入overview.mdx。代价也很具体提取质量完全取决于你本地模型的水平默认的本地 embedding 是纯英文模型非英语语料的语义召回会明显变弱多语言方案见下大模型对硬件有要求gpt-oss:20b是笔记本级 GPU 的推荐起点providers.mdx。姿势四混合架构——本地记忆引擎 云端模型 API隐私团队的典型折中方案记忆与数据留在自己机器上提取质量交给商业模型。自托管服务器支持 OpenAI、Anthropic、Gemini、Groq、Cloudflare Workers AI、Vertex 等所有主流提供商configuration.mdx# 只填一个 key 就够 OPENAI_API_KEYsk-... # 可选不填则保持本地 Xenova/bge-base-en-v1.5 (768d) # SUPERMEMORY_EMBEDDING_PROVIDERopenai # SUPERMEMORY_EMBEDDING_MODELtext-embedding-3-small # SUPERMEMORY_EMBEDDING_DIMENSIONS1536编程插件也支持这种姿势Claude Code、Muse Code、Codex、OpenCode 全部可以指向本地服务器只需设置SUPERMEMORY_API_URLhttp://localhost:6767overview.mdxOpenCode 插件文档也明确写了想全部留在本机插件与自托管版一起用。这类本地记忆 云端推理的混合架构正是社区教程反复强调的高隐私需求场景主流解法。姿势五边缘/无服务器——SMFS 文件系统第五条路不再以服务器为形态而是把记忆容器挂载成一个真实目录让 Agent 用ls、cat、grep直接操作记忆SMFS 总览语义化 grep 默认开启一条命令跨全容器按语义排序召回加参数才退回字面 grep记忆路径蒸馏标记为 memory path 的文件会被提取索引不撑爆模型上下文虚拟profile.md挂载根目录下实时生成容器摘要cat profile.md即得全貌双向同步本地读走缓存写入推回 Supermemory。SMFS 提供两种形态mount 二进制NFSv3/FUSE适合 Claude Code、devcontainer、Docker和bash toolTypeScript 与 Python 版本后者专为无服务器环境设计官方给了 Cloudflare Workers、AWS Lambda、Vercel、Modal 的接入示例以及 Daytona、E2B 等沙箱提供商的对接指南smfs/providers。仓库数据还给出一个硬指标SMFS 在 110 题的 xAFS 基准上让 Claude 的 token 消耗降为原来的约 1/3、Codex 约降 43%README。三、隐私敏感场景的取舍数据主权与性能平衡把五种姿势按数据流向排开取舍一目了然姿势数据离开本机记忆提取质量主要代价托管云平台全部进云端专有模型最高数据主权完全让渡自托管 云端模型混合内容出境给 LLM API由你选的商业模型决定高仍需信任 LLM 提供商自托管 本地 LLM全离线零出网除首次 embedding 下载由本地模型决定一般硬件投入、英文模型弱多语言单机自托管默认配置embedding 本地LLM 视 key 而定取决于配置无 Connectors/MCPSMFS 边缘部署取决于后端取决于后端需要沙箱/无服务器环境这里有几个部署红线隐私团队务必照抄1. 多语言语料必须换 embedding。默认的Xenova/bge-base-en-v1.5只训练了英文。德语、荷兰语等非英语语料即使混检hybrid keyword偶尔能召回稀有 token稠密语义召回也会失效。多语言部署要在大批量回填前切换例如本地换Xenova/bge-m31024 维或改用远程多语言 APIembeddings.mdxSUPERMEMORY_EMBEDDING_PROVIDERlocal SUPERMEMORY_EMBEDDING_MODELXenova/bge-m3 SUPERMEMORY_EMBEDDING_DIMENSIONS10242. 维度锁与模型混用是真实踩过的坑。文档记录了一个 v0.0.5 的线上事故写入路径用 OpenAI embedding、读取路径却用本地默认模型导致日文等无语义空格的语言在/v4/search与/v4/profile上静默返回空结果v0.0.7 通过全路径锁定 embedding 计划修复。而变更 embedding 模型/维度不支持原地切换——要么全新数据目录要么全量重灌维度不一致时服务器直接拒绝启动embeddings.mdx。3. 别把自托管服务器裸奔到公网。当前发布的 v0.0.8 绑定所有网络接口且本地认证隐式开启官方文档的警告原文是Do not expose it——必须用防火墙隔离或跑在独立机器上下一个版本才会改为仅绑定回环地址并要求每个请求都带 keyconfiguration.mdx。4. 吞吐与内存可控。查询永远优先于摄取搜索绝不在摄取队列后面排队摄取内存占用被限制在启动基线之上最多 1GBSUPERMEMORY_EMBEDDING_RAM_LIMIT可调超限时新文档排队而不是丢弃。大机器上可以放宽并发与内存做批量导入小 VPS 上调低以保持轻盈configuration.mdx。四、给团队的分场景选型决策表场景推荐姿势核心理由个人开发者 / 快速原型托管云或单机二进制lite license 免费一条命令跑起来隐私敏感团队数据不出内网全离线本地 LLM本地图谱 本地 embedding 本地模型关闭遥测后零出网隐私团队但要求提取质量混合架构记忆与数据留本机提取交给 OpenAI/Anthropic/Gemini非英语/多语言语料库自托管 bge-m3或远程多语言 embedding默认英文模型召回弱须先换模型再回填需要 Gmail/Drive/Notion 等自动同步或 MCP托管云平台Connectors 与托管 MCP 是自托管二进制不包含的功能中大型团队、多成员协作与合规Enterprise专用部署组织级角色、作用域 API key、控制台观测、合规专用部署无服务器/边缘 AgentSMFS bash toolWorkers/Lambda/Vercel/Modal 上无需挂载即可语义 grep 记忆横向对比的核心矛盾始终是数据主权、提取质量、运维成本三选二。想要 Connectors 和 MCP 全家桶就接受数据进云想要零出网就接受本地模型的提取上限或添购推理硬件大多数隐私团队的最优解落在那条本地引擎 商业模型 API的混合路径上——它同时拿到了数据主权的底线与当下最好的提取质量。值得强调的是无论哪种姿势API 是同一套在本地把 Agent 打磨好换一个baseUrl就能迁到托管平台或反向local-vs-enterprise.mdx 给出的迁移路径就是这么简单。这也是我认为部署姿势之争本质上是伪命题的原因——真正的变量从来不是选哪边而是你想把哪一层数据主权握在自己手里。先按上表选好姿势再把提取模型与 embedding 模型配置锁死剩下的事情交给同一套记忆 API 就好。【免费下载链接】supermemoryMemory and context engine app that is extremely fast, scalable, and can be run fully locally. The Memory API for the AI era.项目地址: https://gitcode.com/GitHub_Trending/su/supermemory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?