大模型挂一个小模型lm模型太大但是没有训练我们新的内容 不能用这个模型的小型化训练一下新数据 挂到新模型上然后 decode下面把这条路线的关键论文按“挂载方式”整理成可对照的文献地图。这条技术谱系有两个源头一支源自 2019–2021 年的可控生成研究PPLM 一脉一支源自 2022 年后的推理加速研究speculative decoding 一脉两者在 2024 年后开始与 reward model / 检索增强合流。一、Logits 融合外挂小模型逐步引导大模型分布这是与你设想最直接对应的路线冻结大模型decode 时每步用小模型的输出修改大模型的 logits。论文作者会议/年份核心贡献PPLMDathathri et al.ICLR 2020, arXiv:1912.02164开山之作冻结 GPT-2小属性模型通过梯度更新大模型隐状态实现属性控制GeDiKrause et al.ACL 2021, arXiv:2009.06367类条件 LM 做生成式判别器比 PPLM 快 30 倍可给 GPT-2 1.5B 降毒FUDGEYang KleinNAACL 2021, arXiv:2104.05218“未来判别器”小模型预测当前前缀未来能否满足属性再对 logits 偏置DExpertsLiu et al.ACL 2021, arXiv:2105.03023专家/反专家小模型 logits 差作偏置项小模型即可操控 GPT-3Contrastive DecodingLi et al.ACL 2023, arXiv:2210.15097大模型分布减去小模型分布突出“大模型独有的知识”可降幻觉这个方向的演进逻辑从 PPLM 的“梯度反传改隐状态”慢→ GeDi/FUDGE 的“纯 logits 偏置”快→ DExperts 的“极简差分”可跨模型家族。当前 FUDGE 和 DExperts 是工程上最实用的范式。二、草稿-验证外挂Speculative Decoding小模型先写草稿大模型并行验证接受一致前缀。这是目前工业界采纳最广的路线。论文作者会议/年份核心贡献Fast Inference via Speculative DecodingLeviathan et al. (Google)ICML 2023, arXiv:2211.17192奠基之作确立 draft-verify-reject 框架保证输出分布不变Accelerating LLM DecodingChen et al. (DeepMind)2023, arXiv:2302.01318并行版本的投机采样与 Google 工作同期独立提出MedusaCai et al.2024, arXiv:2401.10774抛弃独立 draft 模型直接给大模型加多个轻量解码头并行预测未来 tokenEAGLELi et al.ICML 2024, arXiv:2401.15077在特征层而非 token 层做自回归 draft解决 draft 模型特征不匹配问题EAGLE-2Li et al.2024, arXiv:2406.16858引入上下文感知的动态 draft 树进一步提速 20–40%EAGLE-3Li et al.2025, arXiv:2503.01840改进训练策略用多步特征divergence 处理更稳P-EAGLE2026arXiv将 EAGLE 从自回归改为并行 draft 生成B200 上再提速 1.05–1.69×这个方向的演进逻辑从“独立小模型做 draft”→ Medusa 的“解码头内嵌”→ EAGLE 系列的“特征级对齐”。EAGLE-2/3 是 2025 年以来 vLLM 等推理框架默认集成的主流方案。三、打分外挂Verifier / Reward Model 事后裁判小模型不介入每步解码只对大模型的完整或部分输出打分择优。论文作者会议/年份核心贡献Let’s Verify Step by StepLightman et al. (OpenAI)ICLR 2024, arXiv:2305.20050过程奖励模型PRM的代表作逐步打分优于整段打分ReST-MCTS*Zhang et al.NeurIPS 2024, arXiv:2406.03816树搜索 过程奖励引导收集高质量轨迹无需逐步人工标注Decoding Matters2025—分析推理时对齐中 reward hacking 的失效模式四、外部知识注入小模型/检索器补充新知识当新数据是“事实知识”而非“偏好/风格”时logits 引导救不了要走检索或非参数化路径。论文作者会议/年份核心贡献kNN-LMKhandelwal et al.ICLR 2020, arXiv:1911.00172鼻祖decode 时在 datastore 上做 kNN 检索与 LM 分布插值无需重训RETROBorgeaud et al. (DeepMind)2021, arXiv:2112.04426冻结预训练 transformer 也能低成本改造为检索增强版NPMGutkin et al.2023, arXiv:2301.10323神经短语模型非自回归式地引用检索到的短语五、参数级挂载LoRA 系小模型退化为一小块可插拔参数直接改大模型前向推理时几乎零开销。论文作者会议/年份核心贡献LoRAHu et al.ICLR 2022, arXiv:2106.09685低秩适配块几 MB 即可改变模型行为LoraHubHuang et al.2023, arXiv:2307.13269多个 LoRA adapter 的动态组合跨任务泛化阅读路径建议如果你打算按这个体系入手建议的顺序是先读 PPLM FUDGE DExperts 三篇理解“小模型如何在 decode 时介入大模型”的三种基本机制梯度改隐状态 / 未来判别偏置 / 专家差分——这一组论文之间互相引用和对比连读效率最高再读 Leviathan 2023投机解码奠基作 EAGLE 系列掌握工业界最成熟的挂载路径按你的场景选支线注入新知识读 kNN-LM / RETRO注入任务能力读 LoRA / LoraHub注入质量标准读 Let’s Verify Step by Step。演进趋势判断这个方向 2020–2022 年主要在可控生成风格、毒性上验证可行性2023 年投机解码让它进入工业部署2024–2025 年的关键变化是与 reward model 和 test-time compute 的合流——“外挂小模块”正在从“控制属性”的工具演化成“在推理时注入领域知识 提供验证信号 加速推理”的三合一组件。最新趋势EAGLE-3、P-EAGLE、上下文感知 draft表明这个方向还有明确的技术增量空间远未收敛。llm decode阶段 除了用自回归 加上rl 能不能提高模型能力能但前提是任务有可验证或可评估的信号且提高的来源要区分清楚。在解码阶段引入 RL 或奖励引导的搜索本质上是把单步自回归采样扩展为生成—评估—选择/回溯的闭环这条路线已在数学推理、代码生成等可验证任务上被反复验证有效但对开放生成、事实性等场景的收益有限且代价显著。先厘清一个关键概念两件常被混为一谈的事你说的decode 阶段加 RL实际上对应两条完全不同的技术路径作用机制不同路径一训练时的 RLRLHF/PPO/DPO/RLVR这类方法通过奖励信号改变模型权重训完后推理时仍是普通自回归greedy 或 sampling。模型的能力已经内化到参数里。其与解码阶段的关系在于RLHF 训练本身依赖大量采样 rolloutrollout 策略的质量直接决定训练效果。路径二推理时的奖励引导解码inference-time search模型权重冻结不动在解码时引入奖励模型RM或验证器对多条候选路径打分、筛选或树搜索。这才是真正意义上的decode 阶段用 RL 思想。o1、DeepSeek-R1 等推理模型将两者结合先用 RL 训练出会深度思考的策略再在推理时投入更多 test-time compute。下面重点讨论路径二——即不改变权重、纯在解码阶段提升输出的方法。主流方法对比方法核心机制奖励信号类型计算开销提升上限已验证适用场景Best-of-N (BoN)采样 N 条完整回复RM 挑最优Outcome Reward整段打分N 倍中易受 reward hacking 限制对话偏好对齐、通用任务Self-Consistency采样多条 CoT对最终答案多数投票无 RM靠一致性作为隐式奖励N 倍中数学、符号推理等有唯一答案的任务Tree-of-Thoughts (ToT)维护思维树对中间分支评估后剪枝/回溯LLM 自评或外部 RM树宽×深度倍中高需要规划的推理任务24点、创意写作PRM 引导的 Beam Search每生成一步就用 Process Reward Model 打分按 step 分数保留候选Process Reward逐步骤打分2–4 倍高数学竞赛题、多步推理PRM MCTS 树搜索蒙特卡洛树搜索展开推理空间PRM 做价值估计Process Reward数十倍很高但极贵极难数学题、代码搜索其中Process Reward ModelPRM与 Outcome Reward ModelORM的区分是关键ORM 只看最终答案对错一个推理链可能每一步都错但碰巧得到正确答案PRM 对中间每一步打分能捕捉到答案对但过程错的隐藏缺陷因此在多步推理上显著优于 ORM。典型代表工作与实证结果ReST-MCTS*清华 KEG CaltechNeurIPS 2024是这条路线的集大成者。它用 MCTS 树搜索 过程奖励引导来收集高质量推理轨迹且巧妙地绕开了 PRM 需要逐步人工标注的瓶颈——只给定最终正确答案通过树搜索反推每一步导向正确答案的概率作为隐式过程奖励。在同等搜索预算下其准确率超过 Best-of-N 和 Tree-of-Thought 基线用搜出的轨迹自训练策略模型后效果进一步提升。Apple 的 AdaBoN研究了自适应 Best-of-N 对齐指出 BoN 的有效性依赖 RM 质量与采样多样性的平衡。OpenAI o1则代表了另一极它在训练时用 RL结合可验证奖励塑造模型的长思考行为推理时通过更多 test-time compute更长的 CoT、更多自我修正持续提升性能——论文与后续分析均观察到性能随训练时 RL 算力和推理时思考时间两条轴同时增长。能力提升的来源纠错与择优而非新知识理解这类方法为何有效很重要。自回归解码是贪心且不可回溯的——一旦某一步走错后续所有 token 都建立在错误之上。奖励引导解码提供的核心增量是错误路径的早期识别PRM 能在第 2 步就发现方向不对避免浪费剩余预算多条路径的横向比较BoN/Self-Consistency 利用多条独立采样中正确答案占多数的统计规律系统性探索MCTS 在推理空间做类似 AlphaGo 的 lookahead。但必须明确这些方法不会让模型掌握它本来不会的知识。它们做的是从模型已有分布中百里挑一提升的是输出质量的下限和期望值而非知识边界。这也是为什么它们在模型知道但容易出错的任务数学、代码上收益最大而在模型根本不知道的任务上无能为力。局限与代价Reward Hacking 是最核心的风险。NeurIPS 2025 的研究专门分析了 inference-time alignment 中的 reward hacking 问题当 BoN 用 RM 从多条候选中选优时如果 RM 学到了某些表面特征长度、格式、特定措辞模型会采样出迎合 RM 但实际质量更差的回复导致性能不升反降。计算开销线性甚至指数增长BoN 是 N 倍开销MCTS 配合 PRM 在困难任务上可能需要几十倍甚至上百倍的推理算力这也是为什么纯 MCTS 解码目前主要停留在研究和离线数据生成场景难以直接上线。PRM 的标注瓶颈训练一个好的过程奖励模型需要逐步骤标注成本极高。ReST-MCTS* 用从最终答案反推步骤价值的方式部分解决了这个问题但这要求任务有可验证的最终答案。分布偏移树搜索选出的路径可能偏离模型自回归的自然分布用这些路径做自训练时需要额外处理。对开放任务收益有限创意写作、开放对话等任务没有客观对错RM 的判断本身就不可靠基于 RM 的择优容易引入新的偏差。落地建议如果目标是提升已有模型在可验证任务上的表现按性价比排序的实践路径大致是Self-Consistency零成本改造只需要采样多次 投票适合有唯一答案的任务Best-of-N 强 RM适合偏好对齐和有明确质量标准的任务N 取 4–16 通常收益最佳需警惕 reward hackingPRM 引导的 step-wise beam search适合多步数学/代码推理开销 2–4 倍是精度与成本的最佳平衡点MCTS PRM仅在极难任务或离线生成高质量训练数据时使用线上部署成本过高。如果资源允许从头训练先训 PRM 再做 RL 训练类似 ReST-MCTS* 的迭代范式把搜索带来的收益固化到模型权重中是当前被验证最充分的用推理时搜索反哺训练的方案。简言之decode 阶段的 RL/奖励引导确实能提升模型表现但它提升的是既有能力的兑现率而非能力本身且收益高度依赖任务的可验证性和奖励模型的质量。llm模型太大但是没有训练我们新的内容 不能用这个模型的小型化训练一下新数据 挂到新模型上然后 decode 这样行不行能而且其中最关键的一种挂载——小模型 draft 做投机解码——已经有现成的开源实现可以直接用在 Kimi K3 上。但 K3 的架构混合线性注意力 MoE MXFP4对外挂方案提出了比一般 dense 模型更多的约束条件不是所有挂载方式都同样容易落地。下面按实际情况拆解。先看 K3 的关键事实决定挂载难度维度具体参数对外挂的影响总参数2.8TMoE激活 104B/token无法全量训练必须走外挂路线注意力93 层中 69 层是 KDA线性/循环注意力 24 层 Gated MLAdraft 模型必须能处理循环状态的回滚不能随便找个 dense 模型就当 draft词表163,840小模型词表必须与 K3 一致量化MXFP4 权重 MXFP8 激活量化感知训练小模型在 logits 偏置时需匹配目标分布Chat 模板Python 程序渲染非 Jinja含独立 reasoning/tool-call 区段FUDGE/DExperts 类方案需处理控制 token 边界部署门槛自托管需 64 加速器 supernode权重约 1.56TB任何外挂算力预算都要先扣掉 K3 本身的巨大开销许可Kimi K3 License自定义非完全开源许可商用前需审阅条款各挂载方式在 K3 上的可行度✅ 投机解码已有两个开源 draft 模型可直接挂这是你的方案在 K3 上最成熟、最被验证的路径。vLLM 在 K3 发布当天就提供了完整支持且社区已经训练并开源了至少两个 DSpark speculator# Inferact 的版本 --speculative-config {model:Inferact/Kimi-K3-DSpark,method:dspark, num_speculative_tokens:7,attention_backend:FLASHINFER_MLA, draft_sample_method:probabilistic,rejection_sample_method:block} # RedHatAI 的版本 --speculative-config {model:RedHatAI/Kimi-K3-speculator.dspark,method:dspark, num_speculative_tokens:8,draft_sample_method:probabilistic, rejection_sample_method:standard}实测效果单用户从 118 tok/s 提升到 370 tok/s3.14 倍加速代码类任务平均接受 4.73 个 token/步创意写作类约 2.61 个 token/步。为什么 draft 在 K3 上不是随便挂个小模型K3 的 69 层 KDA 是循环状态不是传统 KV cache。投机解码写 draft 时每个位置都要保存一份循环状态用于回滚代价极高。vLLM 的解法是ReplaySSM不存状态而是缓存最近的 SSM 输入在 commit 时重建接受状态回滚只移一个 buffer 指针——这相当于把 cache 容量白捡了 10.97%。K3 的 DSpark draft 被特意做成MLA-native即 mirror 了 K3 自己的注意力结构让 draft 和 target 的 KV 布局一致才能兼容 P/D 分离部署和高级 KV 管理。draft 用TorchSpec训练以保证和 vLLM 推理时数值完全一致——这意味着如果你想在自己的数据上继续训这个 draft需要用同一套工具链否则分布漂移会让接受率崩掉。你的具体方案的落地路径拿 Inferact 或 RedHatAI 的开源 DSpark draft 作为起点在你自己的领域数据上继续训练用 TorchSpec 保持一致性然后挂到 K3 上。这条路径完全成立工程上需要处理的是领域数据和 K3 的程序化 chat 模板的对接。✅ RM/Verifier 打分Best-of-N架构无关最容易挂外挂一个小 reward model 做 Best-of-N 择优不需要任何架构对齐——它只看最终输出不碰 K3 的中间状态。163,840 的词表意味着你的 RM 也要能处理这个 tokenizer 的文本除此之外没有特殊约束。这是在 K3 上启动成本最低的外挂方式适合先验证你的领域信号有没有用再考虑更紧的耦合。⚠️ LoRA 微调原则可行但有现实障碍NVIDIA 的 NeMo AutoModel 文档明确列出了 Kimi K3 的微调支持。但有几个现实问题MXFP4 量化感知训练K3 的权重本身就是 4-bit/8-bit 混合精度训练出来的LoRA 在这个基础上训练需要适配量化路径。自托管成本就算 LoRA 训练只需要在少量 GPU 上做推理时你仍然要跑完整的 2.8T 模型64 加速器这远超多数团队的承受范围。许可限制Kimi K3 License 对衍生品的具体条款需要审阅LoRA 分发是否被允许需确认。务实的 LoRA 路径如果你用 Moonshot 官方 API 而不是自托管LoRA 这条路暂时走不通——API 不支持外部 adapter 注入。✅ RAG架构无关推荐的主力路径在 K3 的 1M 上下文里做 RAG 是设计上的最优解——它的 Mooncake serving 在代码任务上 cache 命中率超过 90%长前缀重用成本极低。你的新知识走 RAG 注入不需要任何模型层面的改动性价比最高。针对你的场景的建议路径综合 K3 的特性我会这样设计第一步零成本验证K3 RAG 注入你的领域知识同时外挂一个领域 RM 做 Best-of-N。这一步验证你的数据在 K3 上的边际收益。第二步中等投入拿 RedHatAI 的Kimi-K3-speculator.dspark用 TorchSpec 在你的领域数据上继续训练得到一个领域特化的 draft 模型在投机解码里同时获得领域加速和吞吐提升。第三步仅当自托管可行时LoRA 微调但这要求你有 64 GPU 级别的推理集群。一个关键提醒K3 的模型卡自己承认它在 reasoning 默认开启的状态下输出 token 量很大“思维链回传缺失会导致输出质量严重不稳定”。你的外挂方案无论是 RM 打分还是 draft 加速都要正确处理它的 reasoning trace 格式否则会踩到 Moonshot 自己标注的坑。总结一句话你的小模型挂载思路在 K3 上不但可行投机解码这条路甚至已经有社区预训练好的 draft 模型可以直接用——你需要做的是在这些开源 draft 基础上用你的数据继续训练而不是从零开始。最需要当心的是 KDA 循环状态和程序化 chat 模板这两个非常规设计带来的工程复杂度。
阅读完成 · 觉得有帮助?