首页 / 资讯中心 / 文章详情

DeepSeek Harness 消耗 Token 太快怎么办?5 个官方开关把账单压下来

DeepSeek Harness 消耗 Token 太快怎么办?5 个官方开关把账单压下来 ★ FEATURED ARTICLE
发布日期2026-09-28DeepSeek Harnessdsh是 DeepSeek 于 2026 年 8 月开源的插件化 Agent 运行框架在 GitHub 上已有 23.7 万 Star。它烧 Token 快主要不是 bug而是默认配置偏重。默认推理强度是high单次输出上限 256,000 Token模型上下文窗口 100 万 Token。按官方公式自动压缩要等上下文涨到约 67.8 万 Token 才会触发在那之前每一轮请求都会把整段历史和之前的思维链重新发一遍。本文依据 dsh 仓库文档和 DeepSeek 官方价格页先讲清 Token 花在哪再给出 5 个原生配置开关降推理强度、提前压缩、让便宜模型写摘要、收紧工具输出、护住缓存命中率。最后附一份可以直接粘贴的cordis.patch.yml。先看账Token 到底花在哪一句话长会话里真正花钱的是「每一轮都重发的输入」不是模型这一轮写出的回答。dsh 的 Agent 循环每走一步都会把系统提示词、工具 schema、完整对话历史和工具结果重新组装成一次请求。官方llm-deepseek文档还特别写明此前每个推理轮次的思维链会原样回传到后续请求里。也就是说推理强度开得越高后面每一轮的输入就越重。再看价格。DeepSeek 官方价格页2026 年 9 月的单位都是元/百万 Tokendeepseek-flashV4.1-Flash高峰时段缓存命中输入 0.04 元未命中输入 2 元输出 8 元deepseek-v4-pro高峰时段缓存命中输入 0.30 元未命中输入 9 元输出 27 元空闲时段是高峰价的一半。高峰时段为北京时间工作日 9:00–12:00 和 14:00–18:00其余时间含周末、法定节假日全天都是空闲时段。算一笔账用 V4-Pro会话已经涨到 50 万 Token此时再发一轮请求。如果缓存命中率是 90%这一轮的输入大约 0.59 元如果缓存全部失效就要 4.5 元差了 7 倍多。所以省 Token 其实是两件事让上下文别无限膨胀让重复的前缀尽量命中缓存。为什么默认配置偏「费」dsh 的压缩插件dsh-compaction-basic默认开启。它的触发阈值公式是floor(min(W × 0.8, W − O − 65536))其中 W 是上下文窗口O 是单次输出上限。代入默认值W 1,000,000O 256,000算出来的触发点约为678,464 Token。换句话说会话要膨胀到六十多万 Token 才会第一次自动压缩。对只想改几个文件的日常任务来说这个阈值太宽松了。另外两个默认值同样偏向「能力优先」reasoningEffort默认是high可选off、low、high、max工具结果修剪器只在压缩触发之后才运行低于阈值的会话里超长的命令输出会原封不动地一直留在上下文里。5 个原生开关按收益从高到低1. 按任务调低推理强度模型选择器里有「推理等级」菜单可以随会话切换。简单改动、查资料、格式整理用low或off复杂重构再切回high。DeepSeek 自有路由的off会发送thinking.type: disabled是真正关闭思考。如果你是通过 OpenAI 兼容端点接入 DeepSeek V4 的要注意一个坑off留空时什么参数都不发模型会照常思考。官方文档要求给模型加上compat.thinkingFormat: deepseekoff才会真正生效。2. 把压缩阈值提前把thresholdRatio从 0.8 调到 0.3 左右100 万窗口下大约在 30 万 Token 时就开始压缩。默认保留比例retainRatio: 0.16不变近期的对话依然逐字保留。官方要求保留比例必须小于阈值比例否则插件加载会失败。想立刻瘦身的话在对话框里输入/compact即使没到阈值也会压缩一次并报告估算省下了多少 Token。3. 让便宜的模型写摘要每次压缩本身都要额外调用一次模型。summarizationProvider和summarizationModel两项可以把写摘要这件事单独指定给deepseek-flash。按高峰价算它的未命中输入是 V4-Pro 的 2/9输出不到 V4-Pro 的 1/3。4. 收紧工具输出修剪默认规则是工具结果超过 8,192 个字符时只保留开头 4,096 个字符和结尾 1,024 个字符。如果你经常跑会刷屏的测试或构建命令可以把这三个数调小。5. 护住缓存命中率TUI 页脚会显示cache N%Web 界面的输入框旁边有上下文占用圆环每一轮结束后还能展开查看这一轮的精确 Token 用量。要让缓存命中率保持在高位记住三件事同一会话里不要来回切换模型或提供方否则会换到另一个缓存域不要中途增删 MCP 工具或改写系统提示词工具 schema 一变从变化的位置开始往后的缓存都失效派子任务优先用subagent_fork。官方基础配置特意让它沿用父会话的模型这样继承下来的历史还能复用 KV Cache。实操一份可以直接粘贴的省 Token 配置打开$DSH_HOME/profiles/web/cordis.patch.yml用dsh web启动时 profile 就是web也可以在设置页顶部点「打开配置文件」追加下面几段# 默认推理强度降到 low需要时在模型选择器里临时切回 high-id:llm-deepseekconfig:reasoningEffort:lowmaxTokens:32000# 约 30 万 Token 触发压缩摘要交给 flash 写-id:compaction-basicconfig:thresholdRatio:0.3summarizationProvider:deepseek-officialsummarizationModel:deepseek-flash# 工具输出超过 4096 字符就只保留头尾-id:tool-result-prunerconfig:thresholdChars:4096headChars:2048tailChars:512有三点要注意Cordis 的覆盖会整条替换该条目的配置。如果文件里已经有llm-deepseek段比如模型页写入过 API 地址请把字段合并进原有段落不要重复写两段。用 DeepSeek 账号登录、而不是用 API Key 的摘要提供方要写成deepseek-account。适配器会在下一次请求时重新读取配置不用重启。改完后发一句话然后查看这一轮的 Token 明细确认配置已经生效。还有一个成本上零改动的技巧长时间跑的批量任务尽量放在工作日 18:00 之后或周末启动。按官方价格空闲时段的输入和输出都是半价。常见问题Qdsh 会偷偷上传会话日志多算我的 Token 吗dsh_session_log和dsh_plugin_packages这两个扩展字段默认开启确实会随请求发送。但官方协议文档写明它们放在messages、系统提示词和工具 schema 之外不会增加模型输入 Token也不会改变模型能看到的前缀。Q把maxTokens调小能直接省钱吗不能直接省。计费按实际生成的 Token 算这个上限主要是防止模型失控地长篇输出。它的间接作用是输出预留小了压缩公式里的W − O就变大历史能保留得更完整。Qflash 和 V4-Pro 怎么分工日常编码、摘要、检索类任务用deepseek-flash只把难题交给deepseek-v4-pro。两款模型的上下文都是 100 万 Token但切换模型会重建缓存最好按会话切不要在一个会话里来回换。结语DeepSeek Harness 的 Token 消耗本质上是「100 万窗口加高推理强度加晚触发压缩」叠加的结果。解法不在外部而在 dsh 自带的推理等级、compaction-basic、工具输出修剪器和缓存指标里。本文配置字段以 deepseek-ai/deepseek-harness 仓库 2026 年 9 月的文档为准最新版本 dsh-v0.1.7-rc.2仍处开发者预览阶段字段可能调整价格以 DeepSeek 官方价格页为准。延伸阅读DeepSeek Harness 仓库github.com/deepseek-ai/deepseek-harness会话压缩插件文档github.com/deepseek-ai/deepseek-harness/tree/main/packages/compaction/compaction-basic模型与推理等级配置指南github.com/deepseek-ai/deepseek-harness/blob/main/docs/user/guide/providers.zh.mdDeepSeek 官方价格api-docs.deepseek.com/zh-cn/quick_start/pricing七牛云 Token Plandeepseek最低1.2折https://www.qiniu.com/ai/plan
阅读完成 · 觉得有帮助?
咨询建站