文档教程知识库人工智能【免费下载链接】ai-guide程序员鱼皮的 AI 资源大全 Vibe Coding 零基础教程分享 OpenClaw 保姆级教程、大模型玩法DeepSeek / GPT / Gemini / Claude / GLM、最新 AI 资讯、Prompt 提示词大全、AI 知识百科Agent Skills / RAG / MCP / A2A、AI 编程教程Harness Engineering、AI 工具用法Cursor / Claude Code / TRAE / Codex / Copilot、AI 开发框架教程Spring AI / LangChain、AI 产品变现指南帮你快速掌握 AI 技术走在时代前沿。本项目为开源文档 aiguide已升级为鱼皮 AI 导航网站项目地址https://gitcode.com/GitHub_Trending/aig/ai-guide点击查看免费下载DeepSeek 以抒情走心、富有文采的回答风格出圈其背后并非玄学而是由训练数据、后训练策略与迭代优化共同塑造的工程结果。本文以仓库内《DeepSeek华丽文风从何而来业内人士训练数据、训练策略和迭代优化缺一不可》一文为主体骨架结合《DeepSeek-R1的四个训练阶段》《DeepSeek-R1的训练流程强化学习RL阶段采用了GRPO算法》《DeepSeek-V3 高效训练关键技术分析》等仓库文档交叉印证完整拆解 SFT 与 RL 两步协同的机理、数据质量驱动模型性能的四个维度以及迭代式开发流程背后的工程逻辑。读完本文你将掌握 DeepSeek 文风背后的完整技术链路并具备按同样思路理解其他大模型后训练策略的分析框架。一、现象观察让用户找不到下巴的文风在深入技术原因之前先看两个广为人知的例子它们直观展示了 DeepSeek 的文风特征。例一为《哪吒之魔童闹海》中的哪吒写诗。用户给出如下提示后DeepSeek 生成了这样的诗句节选他们说我是魔、是妖、是异数。可谁见过莲花在淤泥里如何长出自己的形状。我割开血肉剔出龙筋还给东海一个太平。却还不清这具身体的债。乾坤圈在手腕上长成另一道年轮。风火轮碾过陈塘关的黄昏碾碎每一块试图定义我的石碑。例二为人物写诗。旅游博主福瑞环宇用 DeepSeek 写关于使徒保罗的诗成文后感慨写出来一看简直要去地上找下巴——它不仅准确区分了特洛伊与特罗亚艺术化呈现了特罗亚的地理位置与保罗在那里发生的两件要事最后一句一粒麦子埋入欧洲的春秋更是惊艳深沉。事实上DeepSeek 不仅会写诗其走心的回答风格已让大量用户直呼戳中心窝。这种华丽抒情、兼具知识准确性与文学美感的文风展现了 AI 温暖的一面。问题随之而来是什么技术促成了这样的风格二、后训练阶段的两步协同SFT 筑基、RL 点睛耶鲁大学助理教授杨卓然从微观角度给出的结论是根据 DeepSeek-V3 技术报告DeepSeek 的华丽文风主要是通过后训练阶段的两个步骤协同实现的——监督微调SFT与强化学习RL。2.1 角色与风格能力从何而来训练数据上海交通大学副教授赵波通过试用发现DeepSeek 主要包含八种角色设定电影角色、新闻主持、历史人物、动漫游戏、文学角色、职业角色、搞笑角色和科幻角色每种角色大类之下又分别包含其类型中的经典人物。DeepSeek 可以按照用户要求模仿特定角色的语言或行文风格与用户交互。这一能力的直接来源自然是训练数据。它要求开发者针对丰富的角色/风格/场景收集对应的多轮对话和指令跟随数据来训练模型。而这些数据的来源大体可分为三类数据来源类型说明原始资料数据直接取材于书籍、文献、网页等已有文本人工标注数据由人工撰写的示范回答与偏好标注模型合成数据由模型生成、经筛选或审核后回灌训练的高质量数据其中模型合成数据 人工审核的路径正是 DeepSeek 塑造文风的关键手段之一详见下文 SFT 部分。2.2 第一步监督微调SFT——文风的地基在监督微调阶段模型接触到了大量高质量的语言表达示例尤其是针对创意写作等非推理任务的数据。杨卓然指出具体来说对于创意写作任务初始回答由DeepSeek-V2.5 生成随后经过人工审核确保内容的准确性和风格的一致性正是在这部分数据中模型学习到了大量语言表达优美、用词讲究的示例为后续生成华丽文风奠定了基础。也就是说SFT 阶段扮演的是授人以渔的地基角色它不直接产生文风而是把优美表达的样本教给模型让模型具备模仿与生成的初始能力。2.3 第二步强化学习RL——文风的点睛之笔在强化学习阶段模型利用奖励机制进一步优化生成结果。对于创意写作这类开放式任务奖励模型会对生成的回答进行评分不仅要求答案准确还鼓励模型在措辞、句式、逻辑上表现得更精致、更富有文采奖励模型基于监督微调阶段得到的 DeepSeek-V3 checkpoints 进行训练训练过程通过高温采样高温解码增加生成多样性与多步优化使模型在生成时逐步融合精美的修辞和细腻的表达方式。SFT 与 RL 的协同关系可以概括为SFT 提供会写的能力底子RL 提供写好的方向引导——前者注入优美的语言样本后者用奖励信号把模型推向更精致、更有文采的表达。2.4 交叉印证从 R1 的四阶段训练看 SFTRL 的完整协同上述SFT 筑基、RL 点睛的逻辑并非只体现在文风这一个侧面。仓库内《DeepSeek-R1的四个训练阶段》详细记录了 R1 的训练流程其整体框架是两个 SFT 阶段 两个 RL 阶段交替推进阶段类型核心任务阶段一冷启动Cold StartSFT用数千条人工收集的高质量长链思维CoT数据对 DeepSeek-V3-Base 微调规范输出格式为后续 RL 提供稳定初始策略阶段二面向推理的 RLRL采用 GRPO 算法以规则奖励答案准确性、格式一致性和语言一致性奖励驱动推理能力提升阶段三拒绝采样与 SFTSFT从 RL 检查点采样约 60 万条推理数据拒绝采样筛选 复用 V3 的约 20 万条非推理数据写作、事实问答等两轮微调平衡推理与通用能力阶段四全场景 RLRL结合规则奖励与神经奖励模型人类偏好优化有用性Helpfulness与无害性Harmlessness最终对齐值得注意的是阶段三的数据中明确包含了写作等非推理任务的数据——这正是文风类能力在 R1 训练管线中获得持续强化的位置。可以推断DeepSeek 在塑造文风时所依赖的多轮对话 指令跟随 人工审核数据工程与 R1 阶段三的拒绝采样 混合 SFT 数据方法一脉相承。2.5 宏观视角从 V2 到 R1 的技术演进脉络北京邮电大学副教授白婷从 DeepSeek 多款模型的技术报告出发梳理了其关键技术演进的宏观脉络DeepSeek-V2采用Multi-Head Latent AttentionMLA与Sparse MoE架构。MLA 通过对注意力键值进行低秩联合压缩减少 KV 缓存、提升推理效率MoE 架构则通过利用多专家能力提高模型能力。DeepSeek-V3在 MoE 架构基础上加入辅助函数进行负载均衡优化同时引入强化学习进行增强。仓库内《DeepSeek-V3 高效训练关键技术分析》进一步揭示V3 每个 MoE 层包含 1 个共享专家和 256 个路由专家共 58 个 MoE 层、14906 个专家每个 Token 激活 8 个路由专家并采用无辅助损失负载均衡与序列级负载均衡来避免部分专家过载、部分专家闲置的问题。DeepSeek-R1聚焦推理能力直接使用强化学习指导思维链的生成并通过知识蒸馏将能力赋予小模型。白婷同时强调DeepSeek 所采用的技术并非独创学界和业界此前已在广泛使用这些技术甚至一些团队的某些单项技术做得更好。她认为DeepSeek 成功的关键要素在于大量算力资源、大量高质量训练数据以及适宜的训练策略三者的组合——华丽文风或更像人的回复正是受到上述关键技术手段影响的结果但更核心的要素是高质量训练数据、训练策略与大量迭代优化的结合。三、数据即模型数据质量决定模型上限如果说后训练策略是方法那么数据就是原料。2024 年 3 月DeepSeek 研究员陈德里在一场业界大会上的演讲《和而不同大语言模型价值观对齐解耦化》中透露了其数据工程的底层流程在实际模型生产过程中我们会进行模型的迭代式开发即每轮的训练结束之后都会有一个独立的测试团队对模型在上述各个维度上的安全性进行充分的测试并给出反馈意见来指导进行下一个周期的数据迭代和模型训练。这段话揭示了 DeepSeek 文风背后的第三根支柱——迭代式开发训练 → 独立测试团队评估 → 反馈 → 数据迭代 → 再训练。文风不是一次性注入的而是在多轮数据迭代 模型训练循环中逐步打磨出来的。3.1 高质量数据提升表达与推理能力优质数据包含准确、连贯且富有表现力的语言样本。例如包含链式思考CoTChain of Thought的数据可以引导模型在推理时进行反思进而在生成回答时展现出清晰的逻辑与优美的语言表达。这正是模型能够既准确又有文采的关键因素之一——准确性与文风并不矛盾逻辑清晰本身就是文风的一部分。3.2 高质量数据降低噪音、确保一致性数据中的错误、噪音或不一致信息会导致模型生成内容出现语法或逻辑问题。高质量数据能有效减少这些问题使模型更好地学习语言规律从而提高整体生成质量。可以这样理解低质量数据教会模型出错的路径高质量数据则教会模型正确且优美的路径两者在长尾输出上的差异会被逐步放大。3.3 高质量数据提升泛化能力数据的多样性和全面性使模型在不同领域和任务下都能生成高质量回答。丰富且准确的样本帮助模型在多种场景下自如切换风格——无论是精炼的技术解答还是文采斐然的创意写作都能游刃有余。这解释了为何 DeepSeek 既能写诗也能给出严谨的技术回答风格切换能力本质上是数据多样性在参数中的沉淀。3.4 少量高质量数据就能显著提升能力杨卓然特别提到最近一些论文如《s1: Simple test-time scaling》和《LIMO: Less is More for Reasoning》强调数据质量的极端重要性即便只有少量高质量数据也能显著提升模型能力因为高质量数据蕴含的信息更准确、更具代表性为模型提供了高效的学习信号。这种精炼数据不仅帮助模型在推理和生成上达到更高水准还能更快收敛并降低训练成本。3.5 实例佐证从教科书质量到合成数据实例一百家智能体大模型的反超实验。白婷介绍其团队开发的百家智能体大模型baijia.online在阿里 Qwen-7B 上微调后结果反超了 DeepSeek-V2.5-238B。其做法是收集大量低资源、分散的历史语料来构造训练数据和训练策略——此时模型基座的能力强弱已不再是决定性因素。换句话说高质量训练数据能够大大增强大模型在某一目标任务上的能力。该实验还揭示了一个值得注意的现象DeepSeek 能很好地扮演李白这类高资源角色但对于低资源人物的效果一般。这正是数据质量与训练策略两大因素共同作用的结果——白婷团队为此采用了RLAIFReinforcement Learning from AI Feedback的方式将高资源角色丰富的朝代、背景等信息迁移协同到低资源人物的构造中。实例二Phi-2 的教科书质量数据。赵波指出2023 年微软的 Phi-2 模型使用教科书质量的训练数据实现了小模型高性能。大量实例证明小规模高质量数据能够训练出比大规模低质量数据更好的模型且训练成本更低。实例三合成数据与 SVIT。合成数据已成为大模型训练数据的重要来源通过合成可以低成本地获得大量高质量数据主流大模型目前都大量使用合成数据。赵波团队于 2023 年 7 月推出了针对多模态大模型训练的百万级高质量合成数据集 SVIT。综合而言正如赵波所强调的数据即模型有多高质量的数据就可以得到多强大的模型。随着训练数据的不断收集研究团队对数据的关注重心已从数据规模转移到数据质量。四、知识获取路径内化与检索的权衡在数据策略层面DeepSeek 的回复风格更活泼、更严谨等背后其实反映了工程师对对话数据的构造与提示方式的设计。而在知识获取路径上业界存在两种典型思路路径机制优势局限预训练内化将所有数据通过预训练方式写入模型参数泛化性强回答流畅庞大知识易导致专而不精容易出现幻觉检索召回通过检索将更精准的知识召回辅助生成人机协同回答更可信依赖外部知识源的质量与检索精度检索方式属于人机协同检索的内容可以是人类构建的、带有一定可信度的网页内容、史料等使大模型回复更加可信。理解这两条路径有助于理解为何文风与准确性可以兼得——它们分别来自内化的语言能力与可选检索的知识保障。五、尾声与展望从文风走向更完整的智能白婷在总结中指出无论是 AGI 还是 Agent其本质上都是模拟并超越人类这一目前最高等的智能体。从 DeepSeek 的设计来看早期 DeepSeek-V2 版本中多专家 MoE 的群体决策对应人类决策时多个视角汇合的行为模式DeepSeek-R1 版本中思维链的推理能力对应人类先想后答的思考过程知识蒸馏带来的学习能力强化对应人类向更强个体学习的成长路径。但只有这些能力远远不够。更高效强大的记忆系统、共情能力、反思进化能力、个性化能力都是大模型后续发展、超越并服务人类时需要具备的能力。文风只是这些能力在表达层面的一个缩影——它证明模型已经在表达得像人这一维度上迈出了坚实一步。六、延伸阅读仓库内同主题文档本文为 ai-guide 仓库 DeepSeek 技术解析系列中的模型训练专题若想进一步深入可在仓库内继续阅读以下文档DeepSeek-R1的四个训练阶段冷启动 SFT、推理 RL、拒绝采样 SFT、全场景 RL 四阶段完整拆解DeepSeek-R1的训练流程强化学习RL阶段采用了GRPO算法GRPO 组内相对奖励、KL 约束、与 PPO 的对比及 AIME 2024 等基准的性能提升数据DeepSeek-V3 高效训练关键技术分析MLA、DeepSeekMoE、无辅助损失负载均衡、MTP 多令牌预测、FP8 低精度训练等高效训练技术DeepSeek-R1 技术全景解析从原理到实践的炼金术配方V3、R1-Zero、R1 三大模型的定位差异与训练关系图解DeepSeek技术解读从V3到R1的MoE架构创新MoE 架构演进视角下的技术脉络参考资料与事实边界说明本文主体内容整理自腾讯新闻《DeepSeek华丽文风从何而来业内人士训练数据、训练策略和迭代优化缺一不可》一文采访对象包括上海交通大学副教授赵波、耶鲁大学助理教授杨卓然、北京邮电大学副教授白婷以及 DeepSeek 研究员陈德里并结合仓库内《DeepSeek-R1的四个训练阶段》《DeepSeek-R1的训练流程强化学习RL阶段采用了GRPO算法》《DeepSeek-V3 高效训练关键技术分析》等文档进行交叉印证。文中涉及 AIME 2024 成绩、代码可运行率等具体指标均出自仓库姊妹文档所述的技术报告转述如需确认原始数据请以 DeepSeek 官方技术报告为准。有关最强最佳等未经技术报告直接证实的表述本文一律不作结论性使用。赞分享文档教程知识库人工智能【免费下载链接】ai-guide程序员鱼皮的 AI 资源大全 Vibe Coding 零基础教程分享 OpenClaw 保姆级教程、大模型玩法DeepSeek / GPT / Gemini / Claude / GLM、最新 AI 资讯、Prompt 提示词大全、AI 知识百科Agent Skills / RAG / MCP / A2A、AI 编程教程Harness Engineering、AI 工具用法Cursor / Claude Code / TRAE / Codex / Copilot、AI 开发框架教程Spring AI / LangChain、AI 产品变现指南帮你快速掌握 AI 技术走在时代前沿。本项目为开源文档 aiguide已升级为鱼皮 AI 导航网站项目地址https://gitcode.com/GitHub_Trending/aig/ai-guide点击查看免费下载相关推荐如何7天打造你的JavaScript驱动超可爱机器人Stack-Chan完整指南如何7天打造你的JavaScript驱动超可爱机器人Stack Chan完整指南 你是否想过拥有一个会眨眼、会说话、能追踪人脸的超可爱桌面机器人伙伴Stac嵌入式物联网智能硬件机器人硬件开发前端AI 应用Qwen-VL模型训练分布式训练策略与参数调优Qwen VL模型训练分布式训练策略与参数调优 引言大模型训练的核心挑战 在视觉语言Vision Language, VL模型领域Qwen VL通义大模型多模态人工智能微调模型推理服务Qwen如何快速掌握鸣潮自动化工具ok-ww终极指南如何快速掌握鸣潮自动化工具ok ww终极指南 鸣潮自动化工具ok ww是一款专为《鸣潮》玩家设计的开源自动化辅助程序通过先进的图像识别技术实现后台自动战斗、GUI 自动化计算机视觉RPA人工智能创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?