首页 / 资讯中心 / 文章详情

DeepSeek R1本地部署全攻略:Ollama+ChatBox+Cherry Studio私有知识库

DeepSeek R1本地部署全攻略:Ollama+ChatBox+Cherry Studio私有知识库 ★ FEATURED ARTICLE
简介这份 docx 文档面向具备一定技术背景、希望探索本地化 AI 部署的初学者与研发团队系统讲解 DeepSeek R1 在本地环境中的完整落地路径。内容围绕 Ollama 平台展开涵盖从下载安装、命令行运行到模型版本选择的实操指导并针对不同硬件条件给出 1.5b 至 70b 各规格模型的配置推荐帮助读者依据自身算力合理取舍。文档进一步延伸至 ChatBox 与 Cherry Studio 的配合使用演示如何搭建个人专属私有知识库为企业内部定制问答与咨询系统、保护敏感数据提供可行思路。资源包为 1 个 docx 文件约 2.8MB以图文步骤形式组织便于按章节对照操作。目前已有 16375 人学习下载读者可从中获取本地部署全流程的操作指引、模型选型参考、API 连接云端服务的配置方法以及应对网络风险时选用替代源的排错思路适合希望将 AI 能力私有化落地的技术人群参考。1. 从一张显卡说起DeepSeek 本地部署到底值不值得折腾手里有张 AMD VEGA 56跑不动 32B 模型但又不想把公司文档传到别人的服务器上——这是我决定折腾 DeepSeek 本地部署的真实起点。Ollama 负责把模型拉下来跑在本地ChatBox 和 Cherry Studio 负责当聊天前端私有知识库则让模型能回答我们公司自己的问题。整套链路跑通之后你得到的是一个完全离线的问答系统断网也能用数据不出本机。适合谁三类人一是手里有 16G 以上内存和一张还行的显卡、想把日常问答和文档检索本地化的开发者二是需要把内部文档变成可检索知识库、但又不放心上传到公有云的小团队三是纯粹想搞明白大模型部署链路长什么样的新手。硬件不够也能玩Cherry Studio 接云端 API 这条路对配置几乎没要求后面会单独讲。2. Ollama 安装与模型拉取从 1.5b 到 70b 的选型逻辑2.1 硬件门槛与模型版本对照选模型版本这件事本质上是拿显存和内存换回答质量。DeepSeek R1 的蒸馏版本从 1.5b 到 70b 都有参数量越大对显存和内存的胃口越大但推理能力也越接近满血版。下面这张表是我按实际部署经验整理的对照关系不是官方推荐是跑起来不崩的底线模型版本模型大小对标水平最低显卡建议内存存储占用deepseek-r1:1.5b约 1.1GB玩具级核显可跑8GB2GBdeepseek-r1:7b约 4.7GBGPT-3.5GTX 1080 / RTX 306016GB10GBdeepseek-r1:14b约 9GB接近 GPT-3.5RTX 3060 12G24GB20GBdeepseek-r1:32b约 20GB接近 GPT-4RTX 409032GB50GBdeepseek-r1:70b约 40GBGPT-4 级别RTX 4090 24G×264GB100GB我这张 VEGA 56 只有 8GB 显存跑 7b 是极限14b 会开始往内存里溢速度掉得厉害。所以我的建议是先用 1.5b 把整条链路跑通确认 Ollama、ChatBox、Cherry Studio 都能正常对话再根据自己机器的实际表现往上换。别一上来就拉 32b下载几个小时跑起来发现显存不够那种翻车体验很劝退。2.2 Ollama 安装与验证Ollama 的 Windows 安装包直接双击就行安装完它会在后台常驻。验证安装是否成功打开 cmd 输入ollama -v正常会输出类似ollama version 0.5.7的版本号。如果提示不是内部或外部命令说明安装时没把 Ollama 加进 PATH重新跑一遍安装程序或者手动把C:\Users\你的用户名\AppData\Local\Programs\Ollama加到系统环境变量 Path 里。安装完成后Ollama 默认监听 11434 端口。浏览器打开http://localhost:11434/看到 Ollama is running 就说明服务起来了。这一步很关键后面 ChatBox 和 Cherry Studio 能不能连上全看这个端口通不通。2.3 拉取 DeepSeek R1 模型模型拉取命令按版本区分在 cmd 里执行# 先拉最小的 1.5b 验证链路 ollama run deepseek-r1:1.5b # 硬件够的话换 7b ollama run deepseek-r1:7b # 显存 12G 以上可以试 14b ollama run deepseek-r1:14b # 32b 和 70b 对硬件要求陡增谨慎 ollama run deepseek-r1:32b ollama run deepseek-r1:70b第一次执行会自动下载模型文件默认落在C:\Users\你的用户名\.ollama\models。下载速度取决于网络国内直连有时候会慢常见做法是配一个国内镜像源或者用离线安装包手动导入。下载完成后会进入交互式对话界面直接打字就能聊。输入/?可以看帮助命令。2.4 把模型存到 D 盘环境变量改路径C 盘空间紧张是常态模型动辄几十 GB必须挪走。操作路径是右键此电脑→属性→高级系统设置→环境变量→新建系统变量。# 变量名 OLLAMA_MODELS # 变量值比如 D:\OllamaModels设置完必须重启 Ollama 才生效。重启方式任务管理器里结束 Ollama 进程再重新启动 Ollama。验证是否生效重新拉一个模型看 D 盘对应目录下有没有出现文件。这里有个坑如果你已经拉过模型再改路径旧模型不会自动迁移需要手动把.ollama\models下的文件剪切过去或者干脆删掉重新拉。2.5 删除不需要的模型模型拉多了占空间删除命令很简单ollama rm deepseek-r1:7b删除是不可逆的执行前确认这个模型确实不再需要。如果只是想临时切换不用删直接ollama run另一个版本即可Ollama 会同时保留多个模型。3. ChatBox 接入本地模型和云端 API 两条路怎么选3.1 为什么还需要一个前端Ollama 自带的命令行对话能用但体验很糙没有历史记录管理、不能传文件、不能调参数。ChatBox 和 Cherry Studio 这类前端解决的就是这个问题——它们把 Ollama 的 API 包装成图形界面让你像用网页版聊天工具一样用本地模型。ChatBox 的定位是轻量聊天客户端Cherry Studio 的定位是聊天知识库多模型管理的重型工具。如果你只是想让本地模型有个好看的聊天窗口ChatBox 够了如果你要建私有知识库直接上 Cherry Studio少走弯路。3.2 本地模型接入 ChatBoxChatBox 下载地址在chatboxai.app选对应系统版本。安装后打开设置模型提供方选 Ollama APIAPI Host 填http://localhost:11434模型名称填你拉下来的版本比如deepseek-r1:7b。保存后新建对话如果能正常回复说明本地链路通了。这一步最常见的翻车是端口填错或者 Ollama 没启动。排查顺序先浏览器访问http://localhost:11434/确认服务在跑再检查 ChatBox 里填的地址有没有多空格或者少斜杠。3.3 云端 API 接入配置不够的退路如果本地显卡实在跑不动或者你只是想先体验 DeepSeek R1 的能力可以走云端 API。ChatBox 支持 OpenAI 兼容接口配置方式# 在 ChatBox 设置里填写 Model Provider: OpenAI API API Key: 你的密钥 API Host: https://api.siliconflow.cn/v1 Model Name: deepseek-ai/DeepSeek-R1API 密钥在硅基流动平台注册后左侧菜单API 秘钥里生成。这个方案的好处是对本地硬件零要求坏处是数据要经过云端敏感文档别往上传。价格方面和官方基本一致适合做前期验证。3.4 ChatBox 汉化与基础设置ChatBox 默认可能是英文界面设置路径左下角 Settings → Display → Language 选中文。另外建议把流式输出打开不然模型生成时你会盯着空白等很久。温度参数一般保持默认做知识库问答时调低到 0.3 左右回答会更稳定、更贴文档。4. Cherry Studio 私有知识库把内部文档变成可检索的问答源4.1 Cherry Studio 安装与 API 配置Cherry Studio 下载地址在cherry-ai.com/download选对应系统。安装后打开设置添加模型服务。如果你走云端 API选硅基流动填入 API 密钥如果你走本地 Ollama选 Ollama地址填http://localhost:11434。关键一步是添加嵌入模型。知识库的检索依赖向量化没有嵌入模型文档传进去也搜不出来。硅基流动平台上有现成的嵌入模型选一个添加即可。本地 Ollama 也可以拉嵌入模型但对显存有额外占用配置不够的话建议嵌入模型走云端、生成模型走本地这样兼顾隐私和性能。4.2 建知识库的完整流程添加知识库的步骤左侧菜单找到知识库 → 新建 → 选择嵌入模型 → 上传文档。支持 PDF、Word、TXT、Markdown 等常见格式。上传后系统会自动切片、向量化、建索引。文档多的话这一步要等一会儿进度条走完才算完成。建好之后在聊天界面里把知识库挂上。具体操作是在对话设置里选择知识库勾选你刚建的那个。然后提问时Cherry Studio 会先从知识库里检索相关片段再交给模型生成回答。测试方法问一个只有你文档里才有的细节如果模型答对了说明检索链路通了如果答非所问大概率是切片粒度或者嵌入模型不匹配。4.3 知识库参数怎么调Cherry Studio 的知识库有几个关键参数切片大小、重叠长度、检索条数。切片太大检索精度下降切片太小上下文断裂。常见做法是切片 500800 字符重叠 50100 字符。检索条数一般设 35 条太多会挤占模型上下文窗口太少可能漏掉关键信息。注意知识库检索会消耗大量 token尤其是文档多、检索条数设得高的时候。如果走云端 API费用会明显上升。建议先用小批量文档测试确认效果后再全量导入。4.4 本地 Ollama 知识库的现状基于 Ollama 的纯本地知识库方案目前 Cherry Studio 的支持还在完善中。核心难点在于本地嵌入模型的质量和速度——嵌入模型要在本地跑就得额外占显存而生成模型已经吃掉大部分资源了。一个折中方案是生成模型用本地 Ollama嵌入模型用云端 API这样文档内容只在向量化那一步经过云端且传输的是向量不是原文隐私风险相对可控。纯离线方案需要等 Cherry Studio 后续版本或者换用其他支持本地嵌入的工具。5. 避坑与排查那些让我重装三次的问题5.1 模型下载卡住不动现象ollama run执行后进度条长时间不动或者速度只有几十 KB/s。原因默认下载源在国内访问不稳定。解决配置国内镜像源或者用离线安装包手动导入模型文件。如果已经下了一半卡住CtrlC 中断后重新执行命令Ollama 会断点续传。5.2 端口 11434 被占用现象Ollama 启动后浏览器访问localhost:11434没反应或者提示端口被占用。原因其他程序占用了 11434或者 Ollama 进程没起来。解决任务管理器里看有没有 ollama.exe 在跑没有就手动启动有的话检查是不是被防火墙拦了。Windows 上偶尔会出现安装后服务没注册的情况重装一遍通常能解决。5.3 知识库检索答非所问现象文档明明传进去了提问时模型却回答没有找到相关信息。原因嵌入模型没选对或者切片粒度太粗导致关键信息被淹没。解决换一个更强的嵌入模型把切片大小调小检索条数调大。另外确认文档上传后索引确实建完了进度条没走完就提问是搜不到的。5.4 显存溢出导致模型加载失败现象ollama run一个较大模型时提示显存不足或者加载到一半崩溃。原因模型参数量超过了显卡显存Ollama 尝试往内存溢但内存也不够。解决换小一号的模型或者关闭其他占显存的程序。NVIDIA 显卡可以用nvidia-smi看显存占用AMD 显卡用rocm-smi。如果经常溢出考虑加内存或者换显卡。5.5 API 密钥配置后仍报 401现象ChatBox 或 Cherry Studio 里填了 API 密钥但请求返回 401 未授权。原因密钥复制时带了空格或者 API Host 地址填错。解决重新复制密钥确认前后没有空格API Host 要填完整的https://api.siliconflow.cn/v1末尾不要多斜杠。如果还不行去平台后台确认密钥是否已激活、余额是否充足。6. 进阶技巧让本地 DeepSeek 更顺手的两三个习惯跑通基础链路之后有几个习惯能明显提升使用体验。第一个是模型分级日常问答用 7b复杂推理临时切 14b 或走云端 API别用一个模型扛所有场景。Ollama 支持同时保留多个模型切换成本很低。第二个是知识库的文档预处理。直接把几百页 PDF 扔进去检索效果通常很差。我一般会先把 PDF 转成 Markdown手动去掉页眉页脚和无关章节再上传。切片质量上去了检索命中率会高很多。这一步没有工具能完全自动化但花半小时整理文档比后面反复调参数省事。第三个是定期清理不用的模型。ollama list看当前有哪些模型ollama rm删掉不再需要的。模型文件动辄几十 GBC 盘或 D 盘被吃满之后Ollama 拉新模型会直接失败而且报错信息不一定指向磁盘空间排查起来很绕。最后一个习惯是每次改完环境变量或者换模型先跑一遍最小验证链路——ollama -v看版本浏览器看 11434 端口ChatBox 发一句你好确认对话通。这三步走完再干别的能省掉大量以为是模型问题其实是服务没起来的无效排查。从那以后我每次部署新机器都强制走一遍这个检查清单希望帮到你。本文还有配套的精品资源点击获取
阅读完成 · 觉得有帮助?
咨询建站