把 671B 的推理能力压缩进 7BR1 蒸馏的魔法、代价与边界【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R12025 年 1 月DeepSeek-R1 的开源让推理大模型第一次以完整形态进入公众视野不依赖人类标注的思维链数据仅靠大规模强化学习RL就在数学、代码、STEM 竞赛上追平 OpenAI o1模型权重与推理管线全部开放。更让社区沸腾的是随 R1 一同发布的六款蒸馏小模型——1.5B 到 70B全部基于 Qwen2.5 与 Llama3 系列。一时间本地部署 R1成为主流教程的流量密码Ollama、vLLM 的部署帖在各大平台刷屏甚至有博主专门盘点20 个 DeepSeek 版本怎么选。但把 671B 参数的 MoE 大模型压缩成 7B 的稠密模型究竟靠的是什么魔法追平了多少又在哪里露了馅本文不写营销稿直接对照本仓库的 README.md、config.json、modeling_deepseek.py 等源码与评测数据把 R1 蒸馏的机制、成绩单和边界一次说清楚。一、蒸馏的魔法转移的不是权重是怎么想1. 从 R1-Zero 到 R1推理能力的源头要理解蒸馏先要理解蒸馏什么。README 的引言部分交代了 R1 家族的诞生路径README.mdDeepSeek-R1-Zero在基础模型上直接做大规模 RL完全不经过监督微调SFT模型自主涌现出自我验证self-verification、反思reflection、长思维链long CoT等推理行为——这是首次在开放研究中证明纯 RL 即可激励出推理能力DeepSeek-R1为了解决 R1-Zero 的无限重复、可读性差、语言混杂等问题在 RL 之前引入 cold-start 数据并用两阶段 RL 两阶段 SFT的完整管线打磨最终在数学、代码、推理任务上达到与 OpenAI o1 相当的水平。换句话说R1 的真正资产不是那 671B 参数本身而是强化学习在参数里烙下的推理策略遇到难题先分解、再验证、必要时换思路。蒸馏要做的事就是把这套思考习惯转移给小模型。2. 蒸馏的正确打开方式行为克隆而非权重压缩很多人误以为蒸馏是把大模型压扁。仓库给出的做法完全是另一条路README.md 第 79–82 行Using the reasoning data generated by DeepSeek-R1, we fine-tuned several dense models that are widely used in the research community... We open-source distilled 1.5B, 7B, 8B, 14B, 32B, and 70B checkpoints based on Qwen2.5 and Llama3 series.而在 License 一节补充了关键数字Qwen 系列的四个蒸馏模型是finetuned with800k samplescurated with DeepSeek-R1README.md 第 220 行。也就是说蒸馏的本质是用 R1 生成的高质量推理轨迹问题 逐步思考 答案做监督微调让小模型模仿 R1 的思维过程。这是一种行为层面的知识迁移小模型学到的不是大模型的全部参数分布而是遇到数学题要展开推导、遇到代码题要验证分支的解题模式。论文摘要里那句话说得很直白大模型涌现出的推理模式可以被系统地用来guide and enhance the reasoning capabilities of smaller models。3. 蒸馏族谱与规模对照仓库给出了完整的蒸馏家族README.md 的 Model Downloads 表格蒸馏模型基础模型DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math-1.5BDeepSeek-R1-Distill-Qwen-7BQwen2.5-Math-7BDeepSeek-R1-Distill-Llama-8BLlama-3.1-8BDeepSeek-R1-Distill-Qwen-14BQwen2.5-14BDeepSeek-R1-Distill-Qwen-32BQwen2.5-32BDeepSeek-R1-Distill-Llama-70BLlama-3.3-70B-Instruct注意两个细节一是基础模型选型有讲究数学蒸馏用了 Qwen2.5-Math系列相当于带数学底子的学生来继承推理教师的方法二是 8B/70B 走 Llama 路线说明蒸馏并不绑定自家架构对开源生态是普适方法。再看规模的悬殊。满血 R1 是 MoE 架构config.json 写得很清楚总参数量 671B、每个 token 只激活 37B61 层 Transformer256 个路由专家 1 个共享专家每个 token 激活 8 个专家还叠加了 MLA 多头潜在注意力、YaRN 长上下文扩展163,840 位置和 FP8 量化。仓库里的model.safetensors.index.json记录权重总量约 1.37 TB——而一个 7B 稠密模型不过 14 GB 量级一张消费级显卡就能推理。这正是社区本地部署热潮的物质基础推理能力首次以普通人可运行的尺寸分发。最后是法律底座LICENSE 采用 MITREADME 更明确写道允许任何修改与衍生作品包括但不限于蒸馏训练其他 LLM。这条允许被蒸馏的条款直接催生了后来一大批基于 R1 的二次蒸馏与微调实践。二、成绩单哪些任务真的追平了1. 蒸馏模型的评测数据仓库原文表格节选README.md 的 Distilled Model Evaluation 表格给出了六款蒸馏模型在五个推理密集基准上的成绩模型AIME 2024 pass1MATH-500 pass1GPQA-Diamond pass1LiveCodeBench pass1Codeforces ratingGPT-4o-05139.374.649.932.9759Claude-3.5-Sonnet-102216.078.365.038.9717o1-mini63.690.060.053.81820DeepSeek-R1-Distill-Qwen-1.5B28.983.933.816.9954DeepSeek-R1-Distill-Qwen-7B55.592.849.137.61189DeepSeek-R1-Distill-Qwen-14B69.793.959.153.11481DeepSeek-R1-Distill-Qwen-32B72.694.362.157.21691DeepSeek-R1-Distill-Llama-8B50.489.149.039.61205DeepSeek-R1-Distill-Llama-70B70.094.565.257.51633为了对照满血 R1 在这几个基准上的成绩是AIME 79.8、MATH-500 97.3、GPQA-Diamond 71.5、Codeforces rating 2029README.md 的 DeepSeek-R1-Evaluation 表格。2. 三组关键读数数学竞赛AIME7B 就跨过了 GPT-4o/Claude 的线。1.5B 的 28.9 已是 GPT-4o9.3的三倍7B 的 55.5 接近 o1-mini63.614B 的 69.7 正式反超 o1-mini32B 的 72.6 逼近满血 R1 的 79.8。这意味着一个 7B 模型在高中竞赛数学上的表现已经远超当年闭源的旗舰多模态大模型。MATH-5007B 就追平 o1-mini。92.8 vs 90.07B 反超 o1-mini32B/70B 的 94.3/94.5 已经摸到满血 R197.3的边。GPQA-Diamond研究生级科学问答差距开始显现。这是五列里最硬核的。7B 只有 49.114B 的 59.1 仍未过线32B 的 62.1 与 70B 的 65.2 才越过 o1-mini60.0但距离 R1 的 71.5 还有明显缺口。结合 Codeforces 一列32B 1691 vs o1-mini 1820可以提炼出规律任务越可验证、规则明确竞赛数学、代码竞赛蒸馏的继承率越高任务越依赖广泛知识储备与深层科学推理GPQA小模型的容量天花板越早触顶。下图是仓库随附的 R1 与主流模型全基准对比图figures/benchmark.jpg可以看出推理模型的成绩单高度集中在数学、代码与 STEM 领域而这正是蒸馏最保真的区间3. 追平是有配方的推理格式是易碎品成绩单好看但 README 专门列了一节Usage RecommendationsREADME.md 第 205–215 行堪称推理能力的正确打开方式也是蒸馏模型边界的第一条线索温度必须压在0.5–0.7推荐 0.6否则容易出现无限重复或语无伦次不要加 system prompt所有指令放进 user prompt数学题最好显式要求请逐步推理并把最终答案放在\boxed{}内评测要多测几次取平均最关键的一条模型有时会偷懒跳过思考模式直接输出空的think官方建议在每次输出开头强制think\n以触发完整推理。仓库的生成配置与这一配方完全对应generation_config.json 里temperature: 0.6、top_p: 0.95、do_sample: truetokenizer_config.json 的 chat template 则内置了think标签处理逻辑——推理输出被显式包裹在think.../think中应用层可以据此把思考过程与最终答案分离展示。这组配方的存在本身就是信号蒸馏模型学到的推理能力是以显式思考为前提的。一旦温度失控、加了系统提示、或者没有think前缀成绩会明显退化。推理能力不是长在模型里的无条件技能而是需要正确的调用方式。三、代价与边界蒸馏到底损失了什么1. 边界一知识面没有跟着推理一起蒸馏过来蒸馏表里全是推理基准几乎没有通用知识基准——这不是表格的疏忽。翻到满血 R1 的评测README.md 第 130–150 行R1 的 SimpleQA事实性问答只有30.1明显低于 GPT-4o 的 38.2C-SimpleQA 63.7 也低于 DeepSeek V3 的 68.0。也就是说R1 家族的强项从设计上就不是知道得多而是想得深——800k 条蒸馏数据是从 R1 生成的推理轨迹中筛选的小模型继承的自然是推理风格而不是百科全书式的知识。可以做一个直白的推演7B 蒸馏模型在 GPQA 上只有 49.1甚至低于非推理的 Claude-3.5-Sonnet65.0。如果拿它去做开放域的问答、检索增强、创意写作它既没有满血模型的知识广度也没有通用 instruct 模型的对齐手感。蒸馏红利是领域性的数学、代码、逻辑推理吃满红利知识问答、事实核查、开放生成几乎吃不到。2. 边界二压缩的是权重不是思考时间蒸馏模型输出的思考链往往很长README 明确说明评测时最大生成长度设为32,768 tokenREADME.md 第 121 行。这是推理范式的一个反直觉代价模型变小了但想的过程并没有显著变短。一个 7B 模型在本地跑一道 AIME 题可能仍要生成上千 token 的思考过程——推理延迟和 token 消耗并不会因为参数变小而同比例缩小。这带来两个工程后果一是本地部署省的是显存和算力门槛省不了推理时长流式输出体验一个字一个字蹦思考是推理模型的常态二是成本模型变了——短 query 场景下蒸馏模型的胡思乱想反而可能比通用模型的直接回答更费 token。所以蒸馏模型更适合值得多想的结构化难题而不是高频低延迟的琐碎问答。3. 边界三容量天花板与教师上限把 AIME 一列纵向看1.5B→7B→14B→32B分数 28.9→55.5→69.7→72.6曲线在 14B 之后急剧变平GPQA 一列更是 7B 到 14B 几乎没动49.1→59.132B 到 70B 只涨了 3 个点62.1→65.2。这说明蒸馏的收益随模型规模递减小模型能模仿的推理深度存在硬性的容量上限——行为可以克隆但多步推理所需的中间状态容量、知识检索容量无法靠模仿凭空获得。同时要正视教师上限即便是最强的蒸馏模型70B在 AIME70.0 vs 79.8、MATH-50094.5 vs 97.3、GPQA65.2 vs 71.5上也全面低于教师 R1。蒸馏的天花板是教师的水平R1 自己都答不对的题蒸馏模型不可能答对。这也是论文与 README 反复强调的另一条结论的另一面蒸馏小模型可以超过直接在小模型上做 RLREADME 原文better performance compared to the reasoning patterns discovered through RL on small models但永远追不上大模型本身。4. 边界四架构断层——MoE 的并行魔法无法蒸馏最后要回到架构层面。满血 R1 是 MoE671B 总参数、每 token 只激活 37Bconfig.json。它的推理能力建立在两个引擎上一是 256 个专家 分组路由n_group: 8、topk_group: 4、每 token 激活 8 个专家带来的按需调用领域子网络能力二是 MLA 低秩注意力压缩的 128K 长上下文源码见 modeling_deepseek.py 中的DeepseekV3MoE与DeepseekV3Attention路由打分走 sigmoid noaux_tc 分组 top-k。蒸馏模型是稠密架构它继承的是 R1 的输出分布与推理模式而不是 MoE 的并行计算结构——这就注定了蒸馏模型的长文本推理、多任务并行容量与满血版存在结构性差距。四、结语把魔法留给该用的地方回头看这场 671B→7B 的压缩实验结论其实是清晰的魔法是真的用 R1 生成的 800k 条推理轨迹做 SFT就能让 7B 模型在竞赛数学上反超 GPT-4o、在 MATH-500 上反超 o1-mini——推理能力的知识迁移效率远超在同等小模型上直接跑 RL。MIT 许可与全开源进一步放大了这个魔法让它成为整个开源生态都能调用的公共资源代价是实的推理能力是格式敏感的必须配think前缀、压温度、按官方配方调用知识面没有跟着蒸馏走思考时间没有跟着参数变小边界是硬的蒸馏收益随规模递减14B 之后曲线变平所有成绩都有教师上限MoE 的架构红利也无法通过行为克隆转移。超过这些边界还是得请满血 R1 出场。所以给开发者的实用建议只有一句数学、代码竞赛、逻辑推理类任务优先考虑 14B/32B 蒸馏模型本地或私有化部署性价比极高涉及知识问答、事实核查、开放领域生成的任务别把蒸馏模型当万能平替回归通用大模型或满血推理模型。理解了蒸馏的魔法、代价与边界671B 的推理能力才能在你的场景里真正落地为生产力。【免费下载链接】DeepSeek-R1探索新一代推理模型DeepSeek-R1系列以大规模强化学习为基础实现自主推理表现卓越推理行为强大且独特。开源共享助力研究社区深入探索LLM推理能力推动行业发展。【此简介由AI生成】项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-R1创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?