首页 / 资讯中心 / 文章详情

Claw Compactor 跨消息语义去重:SimHash 如何消灭长对话中的重复 Token

Claw Compactor 跨消息语义去重:SimHash 如何消灭长对话中的重复 Token ★ FEATURED ARTICLE
Claw Compactor 跨消息语义去重SimHash 如何消灭长对话中的重复 Token【免费下载链接】claw-compactor14-stage Fusion Pipeline for LLM token compression — reversible compression, AST-aware code analysis, intelligent content routing. Zero LLM inference cost. MIT licensed.项目地址: https://gitcode.com/gh_mirrors/cl/claw-compactorClaw Compactor 是一款开源的 LLM Token 压缩引擎其 14 级 Fusion Pipeline 中的**语义去重Semantic Dedup**能力能在零 LLM 推理成本的前提下自动识别并消除长对话中反复出现的重复内容把上下文体积缩减 15–82%。本文带你弄懂它的 SimHash 指纹去重到底是怎么工作的。为什么长对话里全是重复 Token如果你用过 AI Agent一定见过这种场景工具调用返回了同一个文件的内容助手又复述了一遍用户跨多条消息粘贴了同一段错误日志每轮对话都带着相似的系统提示片段。这些复读会让上下文窗口迅速膨胀每一轮都白白为重复 Token 付费。Claw Compactor 的跨消息语义去重正是为此而生它让模型只读一遍其余重复内容全部替换成紧凑的引用标记。语义去重的 3 步工作原理去重逻辑集中在 scripts/lib/fusion/semantic_dedup.py整个流程可以概括为三步第 1 步切块——按段落和代码块划分文本先被切成逻辑块普通文字按空行切分而 围栏包裹的代码块则作为原子单元整体处理绝不会被拆开。这样既能精准定位重复又保证代码结构完整。第 2 步指纹——3 词 Shingle 近似 SimHash每个块会被小写化、去掉标点后滑动窗口提取所有连续 3 个词组成的 shingle 集合作为该块的指纹。这种 shingle 指纹就是项目文档中所说的 SimHash 风格指纹它不需要任何外部依赖纯标准库即可实现。第 3 步判定——Jaccard 相似度 ≥ 0.80 即视为近重复新块的指纹会与之前所有保留块做 Jaccard 相似度比较交集 / 并集。只要相似度 ≥0.80就判定为近重复——注意只改了一个词的变体也会被抓住。重复块随即被替换成紧凑引用单条消息内[duplicate of block 1 — omitted]跨消息场景[content similar to message 3 — omitted]短于50 字符的块直接跳过永远保留避免误伤好的是的这类短回复。跨消息去重压缩前的 Phase 0这是 Claw Compactor 的杀手锏。逐消息压缩是单线程视野根本看不到跨轮次的冗余所以 scripts/lib/fusion/engine.py 在compress_messages()中设计了先全局、后局部的执行顺序对话消息列表 │ ▼ Phase 0跨消息语义去重整段对话扫一遍 │ ▼ 逐条消息进入 14 级 Fusion Pipeline首次出现的完整内容原样保留并交给后续 14 个压缩阶段继续瘦身再次出现的相似消息整体替换为一行引用压缩器不再为它浪费任何算力。这一顺序保证了该压的压得深该跳的跳得快语义去重也因此被官方架构文档归类为无损阶段——信息没有真正丢失引用标记本身就指明了内容在哪里。效果如何用数据说话内容类型压缩率Fusion Pipeline 整体Agent 长对话31.0%搜索结果40.7%JSON100 条记录81.9%Python 源码25.0%在 SWE-bench 真实仓库任务上单实例最高 73K Token 的代码上下文也被稳定压缩 11–19%。而整个过程全程零 LLM 推理成本纯算法实现延迟通常在毫秒级。三步上手让去重为你工作# 一键安装零必需依赖 pip install claw-compactor # 对你的工作区做无损压缩基准测试 claw-compactor benchmark /path/to/workspace在代码中集成跨消息去重也很直接from claw_compactor.fusion.engine import FusionEngine engine FusionEngine() result engine.compress_messages(messages) print(result[stats][reduction_pct]) # 整体压缩率核心文件速查去重算法实现scripts/lib/fusion/semantic_dedup.py引擎入口与 Phase 0 调用scripts/lib/fusion/engine.py完整架构说明含跨消息去重章节ARCHITECTURE.md14 级流水线顺序表docs/architecture/pipeline.md覆盖 60 场景的单元测试tests/test_semantic_dedup.py小结Claw Compactor 的语义去重用shingle 指纹 Jaccard 相似度这套轻量组合拳把长对话里最臃肿的重复 Token 精准消灭且零 LLM 成本、零外部依赖、完全无损。长对话、多轮工具调用、Agent 工作流越重它的收益越明显——这正是 MIT 协议下这个 14 级压缩引擎值得放进你工具箱的理由。【免费下载链接】claw-compactor14-stage Fusion Pipeline for LLM token compression — reversible compression, AST-aware code analysis, intelligent content routing. Zero LLM inference cost. MIT licensed.项目地址: https://gitcode.com/gh_mirrors/cl/claw-compactor创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站