引言

DeepSeek Harness,简称dsh,是DeepSeek在2026年8月开源的插件化Agent运行框架,项目在GitHub平台已积累23.7k Star。很多开发者在落地时会遇到Token消耗激增的问题,该现象并非框架Bug,而是默认配置偏向能力优先带来的结果。框架默认推理强度设置为high,单次输出上限256000 Token,上下文窗口最大支持100万Token。按照原生逻辑,自动压缩机制需要等待对话上下文膨胀至约67.8万Token才会触发,在此阈值之前,每一轮请求都会完整回传全部历史对话与过往思维链内容,持续拉高输入Token用量。本文基于dsh官方仓库文档与DeepSeek最新定价体系,拆解Token消耗的底层成因,介绍5个原生配置开关,从推理强度、压缩触发时机、摘要模型、工具输出裁剪、缓存命中率五个维度控制账单。文末附带一份可直接部署的cordis.patch.yml配置文件。

一、定位成本根源:长会话的开销来自输入侧,而非模型输出

在Agent多轮循环场景中,绝大多数成本产生于每一轮请求携带的输入内容,并非模型本轮生成的输出文本。dsh的Agent执行循环里,每一步都会将系统提示词、工具描述Schema、完整对话历史以及上一轮工具返回结果,重新组装成完整请求提交给大模型。在DeepSeek官方11m-deepseek文档中明确标注,每一轮推理产生的思维链内容,会原样带入后续请求上下文。推理强度reasoningEffort设置越高,附加的思维链内容体积越大,后续每一轮请求的输入Token体量会持续膨胀。

参考DeepSeek 2026年9月公开的官方计费标准,计费单位为元/百万Token,高峰时段定义为北京时间工作日9:00–12:00、14:00–18:00;其余时间(周末、法定节假日全天)属于空闲时段,计费单价仅为高峰时段一半:

  • deepseek-flash(V4.1-Flash)高峰时段:缓存命中输入0.04元,未命中输入2元,输出8元
  • deepseek-v4-pro 高峰时段:缓存命中输入0.30元,未命中输入9元,输出27元

我们可以做一组成本测算:使用V4-Pro模型,当对话上下文累积至50万Token,继续发起新一轮请求。如果缓存命中率维持90%,本轮输入成本约0.59元;一旦缓存全部失效,本轮输入成本将达到4.5元,二者差距超过7倍。
由此可见,Token成本优化包含两大核心方向:一是约束上下文无限膨胀,二是保证前置提示词尽可能命中KV缓存。在多模型业务架构中,统一管理不同模型的API请求、缓存策略与流量路由会增加运维复杂度,Treerouter作为API网关,能够简化多模型接入与流量管控流程。

二、默认配置为何容易产生高额账单

dsh内置压缩插件dsh-compaction-basic默认开启,触发阈值计算公式:floor(min(W × 0.8, W − O − 65536)),其中W代表上下文窗口上限,O是单次输出Token上限。
代入默认参数:W=1000000,O=256000,计算得到触发阈值约678464 Token。简单来说,对话上下文需要膨胀至接近68万Token,框架才会自动执行压缩操作。对于仅修改少量代码文件这类轻量化任务,该阈值设置过于宽松,会造成大量无效Token开销。

除此之外,另外两项默认参数同样优先保障模型能力,忽略成本控制:

  1. reasoningEffort默认值为high,可选参数包含off、low、high、max;
  2. 工具结果裁剪器仅在上下文压缩执行之后才会生效。对话长度未达到阈值时,超长命令返回内容会完整保留在上下文中持续累积。

三、5个原生优化开关,按投入收益排序

1. 按需调整推理强度

模型选择面板内置推理等级选项,支持会话内动态切换。查阅资料、文本整理、简单格式转换类任务,可将推理等级调整为low或off;遇到复杂代码重构、深度推理场景,再切回high模式。当设置为off时,DeepSeek会发送thinking.type: disabled,完全关闭推理思维链生成。

这里存在一个容易踩坑的适配细节:如果开发者通过OpenAI兼容接口接入DeepSeek V4系列模型,仅填写off参数并不会关闭推理。依据官方文档,必须额外增加参数compat.thinkingFormat: deepseek,off配置才能正常生效。

2. 提前下调压缩触发阈值

修改thresholdRatio参数,将默认0.8调整至0.3左右。在100万Token上下文窗口限制下,上下文达到30万Token即可触发自动压缩;retainRatio默认0.16保持不变,近期对话内容依旧完整保留。官方明确约束,保留比例必须小于阈值比例,否则配置加载失败。
若需要即时手动压缩,直接在对话输入框执行/compact指令,框架会立刻执行一次上下文压缩,并展示本次操作预估节省的Token数量。

3. 选用低成本模型承担摘要任务

每一次上下文压缩都需要调用模型生成摘要。summarizationProvider与summarizationModel两个配置项,可以单独指定摘要任务使用deepseek-flash。在高峰时段,flash未命中输入单价仅为V4-Pro的2/9,输出单价不足V4-Pro的1/3。长会话压缩摘要属于轻量任务,无需动用高成本旗舰模型。

4. 收紧工具输出裁剪规则

默认策略为:当工具返回结果超过8192字符,仅保留前4096字符与末尾1024字符。如果业务场景频繁执行测试脚本、批量构建命令,可进一步缩小字符截断阈值,减少工具返回内容占用的上下文空间。

5. 维护高缓存命中率

TUI终端界面支持查看缓存命中率指标,Web页面输入框侧边展示上下文占用圆环,每一轮会话结束之后,能够查看本轮精确Token消耗明细。想要稳定维持缓存命中率,需要遵守三条工程规范:

  • 同一个会话内,不要反复切换模型或服务商,切换会直接切换缓存域,原有缓存失效;
  • 会话中途不要新增MCP工具,或者修改系统提示词;一旦工具Schema发生改动,变更位置之后全部缓存都会失效;
  • 子任务优先使用subagent_fork模式。官方基础配置下,该模式复用父会话的模型,继承的历史上下文能够继续复用KV缓存。

四、实操配置:可直接粘贴的省Token配置

打开$DSH_HOME/profiles/web/cordis.patch.yml,执行dsh web启动时,profile名称为web,也可以在设置页面点击打开配置文件,追加下面yaml配置内容:

# 默认推理强度调整为low,复杂任务临时切换high
- id: llm-deepseek
  config:
    reasoningEffort: low
    maxTokens: 32000

# 设置约30万Token触发压缩,摘要交由flash执行
- id: compaction-basic
  config:
    thresholdRatio: 0.3
    summarizationProvider: deepseek-official
    summarizationModel: deepseek-flash

# 工具输出超过4096字符,仅保留首尾内容
- id: tool-result-pruner
  config:
    thresholdChars: 4096
    headChars: 2048
    tailChars: 512

配置使用有三项关键注意事项:

  1. Cordis配置采用全条目替换逻辑。如果配置文件已经存在llm-deepseek段落(比如预先填写过API地址),需要将新增字段合并进原有段落,不要重复创建两段相同id配置;
  2. 如果使用DeepSeek账号登录,而非API Key鉴权,摘要提供方名称填写deepseek-account;
  3. 适配器会在下一次请求加载新配置,无需重启服务。修改完成发送一条测试消息,查看Token消耗明细,验证配置生效状态。

还有一项零成本优化技巧:长时间运行的批量任务,尽量安排在工作日18点之后或者周末时段启动。根据DeepSeek定价规则,空闲时段输入、输出Token单价直接减半。

五、常见问题解答

Q:dsh是否会偷偷上传完整会话日志,造成额外Token扣费?

dsh_session_log和dsh_plugin_packages两个扩展字段默认开启,会随请求发送。但官方协议文档说明,这部分信息放置在messages、系统提示词和工具Schema之外,不会计入模型输入Token,不会改变模型读取的前置上下文,不会产生额外计费。

Q:调低maxTokens参数,能直接节省费用吗?

不能直接降低账单,计费以模型实际生成Token数量为准。这个参数本质作用是限制模型最大输出长度,防止失控超长输出。它的间接价值在于缩小输出预留空间,压缩公式中W-O值变大,能够保留更多历史上下文,减少频繁重写历史带来的开销。

Q:flash和V4-Pro如何合理分工?

日常代码编写、文档摘要、信息检索类任务交给deepseek-flash;高难度复杂问题、长链路推理交给deepseek-v4-pro。两款模型上下文窗口均为100万Token,但切换模型会清空缓存,建议新开会话执行切换,不要在同一会话来回切换模型。

六、总结

DeepSeek Harness产生过高Token消耗,本质是100万Token上下文窗口、默认高推理强度、宽松的压缩触发阈值三者叠加带来的结果。成本优化方案无需修改框架底层代码,依托dsh原生自带的推理等级、compaction-basic压缩插件、工具输出裁剪器、缓存控制参数即可落地。本文配置字段参考deepseek-ai/deepseek-harness仓库2026年9月文档,当前最新版本dsh-v0.1.7-rc.2,框架仍处于开发者预览阶段,字段定义存在调整可能性,价格以DeepSeek官方定价页面为准。

在大规模Agent集群落地场景,多模型路由、鉴权与流量观测会带来额外运维压力,借助API网关可以统一管控各类大模型请求。
了解更多:https://treerouter.com