首页 / 资讯中心 / 文章详情

pstack的interrogate技能解析:让3个模型联手摧毁你的diff

pstack的interrogate技能解析:让3个模型联手摧毁你的diff ★ FEATURED ARTICLE
pstack的interrogate技能解析让3个模型联手摧毁你的diff【免费下载链接】pstack-claudeClaude Code, Codex, Copilot, Pi, OpenCode, Gemini, and Prime Agent versions of Potetos pstack. Rigorous agent workflows with Cursor primitives translated for other harnesses.项目地址: https://gitcode.com/GitHub_Trending/ps/pstack-claudepstack 是一套面向 AI 编程 Agent 的技能包Skill Stack支持 Claude Code、Codex、Copilot、Pi 等主流运行时。其中interrogate是它最有攻击性的技能一次派出 3 个不同的 AI 模型以对手身份围攻你的代码改动diff找出 Bug、设计缺陷和安全隐患最后由主审汇总成一份分级裁决。这篇文章带你完整看懂这套多模型对抗式代码评审multi-model review是怎么运作的以及你该如何配置和使用它。一句话理解 interrogate评审的火力来自模型多样性 大多数 AI 代码评审让一个模型顺便看看代码结果往往客气、笼统、充满可以考虑优化。interrogate 的设计哲学完全不同它的主指令只有一句话见 reviewer-prompt.md你是一名对抗式代码评审员。你不是来帮忙或鼓励的你是来压力测试这份代码的。关键点在于对抗信号来自模型多样性而不是给每个模型分配人设。3 个来自不同脑回路的模型拿着同一份提示词、同一份评分标准从独立视角攻击同一份 diff。如果两个模型各自独立地发现了同一个问题那几乎可以肯定它是真问题——这就是所谓的共识信号consensus signal。默认评审面板配置如下可通过setup-pstack自定义见 SKILL.md评审员默认模型Reviewer AopusReviewer BfableReviewer Csonnet面板以只读模式readonly: true运行评审员只能看、只能跑git diff不能改代码。最终交付物是一份综合裁决报告绝不自动修改你的任何一行代码。五步流程从一份 diff 到最终裁决 ⚔️整个技能定义在 interrogate/SKILL.md流程分为五步第 1 步圈定评审范围从上下文判断要评审什么用户指定的文件或 diff、当前分支相对主干的完整改动git diff main...HEAD或最近讨论的工作内容并打包周边上下文文件一起发给评审员。第 2 步声明改动意图在派出评审员之前先用一段话明确这次改动的意图是什么来自用户消息、提交信息或 PR 描述。评审员被要求只挑战执行不挑战意图——这让火力集中在代码有没有实现好目标上而不是无休止地争论方向。第 3 步一次性派出全部评审员在一条消息里并行启动所有评审子代理。每位评审员收到的模板完全相同包含四要素声明的意图Intent待评审的 diff 或文件内容评审评分标准rubric.md代码质量视角code-quality-review.md每条发现必须标注严重级别critical / warning / nit、给出具体位置和证据链空报告也是合法结果——找不到问题就直说no findings禁止夸奖、禁止硬凑。第 4 步综合各模型发现结果回来后做四件事解析所有发现 → 找出共识2 个以上模型独立提出的发现信号最强→ 保留单模型发现降权对待→ 合并重复项并记录模型之间的分歧。第 5 步主审拍板Lead Judgment这一步是 interrogate 区别于简单投票机的灵魂。主审不是中立的聚合器而是一名务实的资深工程师判定框架见 lead-judgment.md。它要过滤掉对抗式评审天然会产生的噪音吹毛求疵引力找不到大问题的评审员会用风格建议凑数——全是 nit 说明代码大概率没问题假想 vs 实际如果有人传 null 呢只有调用方真的能传 null 才算数过度抽象警告不需要第二种变化的代码不需要抽象我会写得不一样这是代码评审中最常见的误报直接驳回并说明理由。裁决报告长什么样四级分类 共识地图 ✅最终输出是一份结构化裁决每条发现都会标注由哪个模型提出分类含义Act On必须处理影响正确性、安全或可维护性的真实问题足以拦住一个真正的 PRConsider值得考虑有道理但不确定是否值得现在付出改动成本Noted记录在案技术上成立但当前阶段不可执行过早优化、低影响等Dismissed已驳回错误的、吹毛求疵或缺少上下文的发现附驳回理由报告末尾还有一张Agreement Map共识地图哪些点模型们一致、哪里出现分歧、这种分歧模式本身说明了什么。值得强调的是Dismissed 部分不是走过场而是信任机制——它把主审驳回的理由摊开给你看让你可以在不认同时推翻它的判断。另外一个健康的裁决中 Act On 列表不应超过 5 条超了说明主审过滤得不够狠。快速上手如何触发与配置 interrogate 触发方式装好 pstack 插件后直接说interrogate 一下这个改动、挑战这份代码、stress test this diff或在支持斜杠命令的运行时输入/pstack:interrogate命令一览见 docs/reference.md。也可以什么都不做——在 poteto-mode 工作流里当设计存在争议时它会在发布前自动引入 interrogate见 playbooks/feature.md开 PR 的子代理也会自动执行 interrogate /deslop/no-comments三连。配置评审面板运行setup-pstack技能在覆盖表中修改interrogate reviewers一行即可增删评审员例如interrogate reviewers: opus, fable, sonnet列表多长就派几个评审员。还可以给角色追加推理强度如opus xhigh。注意一个细节如果运行时能访问的模型家族太少比如只有一个厂商可用技能会要求用不同的推理强度来制造多样性并在裁决中注明多样性已降低。评审到底看什么评分标准里藏着高级工程师的直觉 评分标准rubric.md覆盖了六大视角每一条都很实战正确性边界值、错误是捕获还是被吞掉、幂等性重跑两次会怎样、并发访问如何序列化根因 vs 表象重试逻辑是不是在掩盖一个坏掉的契约别做 X的注释能不能变成类型约束或 lint 规则结构完整性校验是否发生在系统边界这次改动是补丁式拼接还是本来就该长这样可验证性Bug 修复有没有配套测试检查的是真实产物还是模型的自我汇报复杂度预算为不存在的场景预留的参数和以防万一的代码路径全部清掉安全用户输入流向危险汇点SQL、shell、eval的路径必须被完整追踪出来。叠加在上面的 代码质量视角 更狠它要求评审员主动寻找code judo代码柔术式重构——不改变行为、却让整段复杂度消失的结构性简化并立下明确红线把一个 1000 行以下的文件推过 1000 行默认视为必须解释的坏味道。总结什么时候该请出三位评审员一句话记忆设计有争议、改动跨模块、要开 PR 之前是 interrogate 的最佳战场。它的价值不在于多看了几遍代码而在于用模型多样性制造独立视角、用共识信号过滤噪音、用主审框架把 30 条原始发现收敛成一份你读完就能安心发布的裁决。如果你的 diff 只是改了一个拼写让它歇着如果它动了系统的承重墙让三个模型先把它拆一遍吧 【免费下载链接】pstack-claudeClaude Code, Codex, Copilot, Pi, OpenCode, Gemini, and Prime Agent versions of Potetos pstack. Rigorous agent workflows with Cursor primitives translated for other harnesses.项目地址: https://gitcode.com/GitHub_Trending/ps/pstack-claude创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站