首页 / 资讯中心 / 文章详情

Jackrong-llm-finetuning-guide的24个高保真蒸馏数据集宝藏清单:CoT推理、数学、代码全覆盖

Jackrong-llm-finetuning-guide的24个高保真蒸馏数据集宝藏清单:CoT推理、数学、代码全覆盖 ★ FEATURED ARTICLE
【免费下载链接】Jackrong-llm-finetuning-guide项目地址https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide点击查看免费下载Jackrong-llm-finetuning-guide是一个面向新手的 LLM 微调Fine-Tuning教学项目其 High-fidelity Dataset/ 目录收录了24 个高保真蒸馏数据集覆盖 CoT 思维链推理、数学、STEM、代码竞赛与多轮对话五大方向全部来自 DeepSeek、Qwen3、GLM-4.7、GPT-OSS 等旗舰模型蒸馏支持一键批量下载是初学者微调大模型最值得收藏的数据集清单。 微调大模型时数据质量往往比超参数更决定效果。这套数据集最大的价值在于每个文件都来自顶级教师模型的完整推理过程Chain-of-Thought而不只是最终答案。 什么是高保真蒸馏数据集用一句话解释让最强的大模型教师把解题的完整思考过程写下来再拿这份思维笔记去训练较小的模型学生这就是模型蒸馏。这套数据的核心特点是保留完整推理链多数数据按thinking推理过程/thinking 最终答案的 CoT 格式组织让模型学会怎么想教师阵容豪华DeepSeek-V3.2-Exp、Qwen3-235B-A22B、GLM-4.7、gpt-oss-120b 等旗舰模型轮番授课✅经过清洗与质检部分数据还引入了 LLM-as-a-Judge 打分、低温采样等质量控制手段开箱即用统一 JSONL 格式与项目内的 SFT 训练 Notebook 直接配套️ 24个数据集速览总表#数据集含README教师模型方向规模/语言1Qwen3.5-reasoning-700xQwen3.5-27BCoT 推理1K / 英2glm-4.7-Superior-Reasoning-stage1GLM-4.7CoT 推理数学1K-10K / 英3glm-4.7-multiturn-CoTGLM-4.7多轮 CoT1K-10K / 英4Natural-Reasoning-gpt-oss-120B-S1gpt-oss-120b-high自然场景推理1K-10K / 英5gpt-oss-120B-distilled-reasoninggpt-oss-120b通用推理1K-10K / 英6GPT-OSS-20B-Distilled-Reasoning-Minigpt-oss-20b推理三段式质检1K-10K / 英7LogosForge-scored-sft-v1gpt-oss-120B打分式 SFT10K-100K / 英8DeepSeek-v3.1-reasoner-Distilled-math-samplesDeepSeek-V3.1数学推理1K / 英9DeepSeek-V3.2-Exp-reasoning-exampleDeepSeek-V3.2-Exp数学推导对比1K / 英10GPT-OSS-120B-Distilled-Reasoning-mathgpt-oss-120b数学解题1K-10K / 英11gpt-oss-120B-distilled-math-OpenAI-Harmonygpt-oss-120b数学Harmony格式1K-10K / 英12gpt-oss-120b-reasoning-STEM-5Kgpt-oss-120b-highSTEM 理科1K-10K / 英13Competitive-Programming-python-blend混合来源算法竞赛代码10K-100K / 英14qwen3-coder-480b-distill-miniQwen3-Coder-480B代码推理9,543 条 / 英15LogicMind-Chat-Reasoning-SFT-300KQwen3-32B大规模聊天 SFT29.6 万条 / 英16Chinese-Qwen3-235B-Thinking-2507-Distill-100kQwen3-235B-Thinking中文推理指令~10 万条 / 中17Qwen3-235B-A22B-Instruct-2507-Distilled-chatQwen3-235B多语言聊天1K-10K / 多语18ShareGPT-Qwen3-235B-A22B-Instuct-2507Qwen3-235B多轮对话英19ShareGPT-gpt-oss-120B-reasoninggpt-oss-120b多轮推理对话中/英20MultiReason-ChatAlpaca机器生成多轮指令跟随1.8 万条/15.8 万消息 / 英21Chinese-DeepSeek-V3.2-Exp-chat-exampleDeepSeek-V3.2-Exp中文真实对话6,655 轮 / 中22gpt-oss-120b-Reasoning-Instructiongpt-oss-120b推理指令英23IELTS-writing-feedback-reasoningGLM-4.7雅思写作评分1K-10K / 英24financial-economics-reasoningQwen3-235B-Thinking金融经济推理12.2 万条 / 中英 CoT 推理系7 套教模型怎么思考的数据这是全套数据中的精华区重点提升模型的分步逻辑与演绎能力⭐Qwen3.5-reasoning-700x用 Qwen3.5-27B 全参数模型生成超长 CoT 响应覆盖数学、代码、逻辑、科学四大领域glm-4.7-Superior-Reasoning-stage1GLM-4.7 低温T0.6蒸馏的 Stage1 数学推理数据采样温度低意味着推理轨迹更稳定glm-4.7-multiturn-CoTShareGPT 式多轮对话 think标签的 CoT 注入适合训练多轮推理格式Natural-Reasoning-gpt-oss-120B-S1基于 280 万题级自然推理题库STEM、经济学、社会科学的 S1 部分LogosForge-scored-sft-v1两阶段构建——先蒸馏再生成最后由 Qwen3-235B 自动打分可支持课程学习GPT-OSS-20B-Distilled-Reasoning-Mini完整演示了种子题 → 蒸馏 → 自动清洗 → LLM 评审打分的四段式质检流程gpt-oss-120B-distilled-reasoninggpt-oss-120b 通用推理蒸馏带长度分布可视化分析 数学与 STEM 系5 套高难度解题数据DeepSeek-v3.1-reasoner-Distilled-math-samples以 NVIDIA Nemotron 数学子集为种子题用 DeepSeek-V3.1 Reasoner 模式蒸馏平均推理链长达 1.7 万字符长尾分布明显DeepSeek-V3.2-Exp-reasoning-example附 208 题的 V3.2-Exp vs R1-0528 数学推导对比报告直观展示结构化推导与无显式 CoT的差异GPT-OSS-120B-Distilled-Reasoning-math字段完整拆分Input / CoT_Native_Reasoning / Reasoning / Answer方便分别做 CoT 训练与 SFTgpt-oss-120B-distilled-math-OpenAI-HarmonyOpenAI Harmony 格式版本适配不同推理框架gpt-oss-120b-reasoning-STEM-5K从纯数学扩展到科学、技术、工程全理科领域 代码与竞赛编程系2 套算法能力利器Competitive-Programming-python-blendPython 为主的竞赛编程混合集兼顾 C 与无 Agent 式 SWE 任务规模达 1 万~10 万条qwen3-coder-480b-distill-mini由 480B 参数35B 激活的 Qwen3-Coder 蒸馏从 rStar-Coder 抽取 1 万题种子、32K 上下文清洗后保留 9,543 条高质样本 指令对话系8 套多轮与多语言 SFT 数据LogicMind-Chat-Reasoning-SFT-300K全套数据中的巨无霸29.6 万条聊天样本每条含problem → 推理轨迹 → 最终答案完整结构分 4 个 part 文件存放Chinese-Qwen3-235B-Thinking-2507-Distill-100k约 10 万条中文推理与指令数据覆盖数学、知识问答、写作、编程做中文模型微调首选MultiReason-ChatAlpaca1.8 万条记录、15.8 万条消息的多轮指令跟随数据Qwen3-235B-A22B-Instruct-2507-Distilled-chat英文为主、涵盖中/俄/韩/日的多语言聊天数据ShareGPT-gpt-oss-120B-reasoning与ShareGPT-Qwen3-235B-A22B-Instuct-2507ShareGPT 式多轮蒸馏前者由 gpt-oss-120b 授课后者由 Qwen3-235B 授课Chinese-DeepSeek-V3.2-Exp-chat-example6,655 轮真实中文对话样本附输入输出长度分布报告gpt-oss-120b-Reasoning-Instruction推理 指令跟随融合数据 垂直领域系2 套面向真实业务场景IELTS-writing-feedback-reasoningGLM-4.7 生成的雅思写作 Task 2 评分数据集最大亮点是保留完整的评分推理轨迹评分可解释、可审计接近真实考官的决策过程financial-economics-reasoning12.2 万条中英双语金融经济数据用 Qwen3-235B-Thinking 蒸馏并保留完整 CoT32K 上下文窗口 最快获取方式一键批量下载 24 个数据集全部数据以 JSONL 格式存放在 High-fidelity Dataset/ 目录下仓库提供了配套工具download_datasets.py批量下载脚本自动拉取全部 24 个数据集到本地High-fidelity Dataset/目录✂️split_large_files.py大文件自动分片工具——超过 1.5GB 的 JSONL 会被切分为part01/part02/...多段文件这就是你在目录里看到sft_part01.jsonl等分片的原因训练时按顺序拼接即可本地没有克隆仓库的话执行以下命令获取完整数据git clone https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide 从数据到训练配套 Notebook 与 PDF 指南数据集不是孤立的项目 train_code/ 目录提供了浏览器即可运行的配套训练代码模型训练方式入口Qwopus 3.5 (27B)SFTtrain_code/Qwopus3-5-27b-Colab.ipynbQwopus 3.6 (27B)GSPOtrain_code/Qwopus3.6-27B-GSPO/qwopus3_6_27b_gspo_training.pyLlama 3.2 (3B)RL (GRPO)train_code/Llama-3.2-3B-R1-Zero-GRPO.ipynb教师模型蒸馏数据加工data_processing_code/DeepSeek-v4-API-distill.ipynb此外guidePDF/Qwopus3-5-27b-Colab_complete_guide_to_llm_finetuning.pdf 提供了从环境搭建、数据准备到训练优化的一步步完整 PDF 教程适合零基础读者对照学习。 一分钟选数指南你的目标推荐数据集提升通用推理能力Qwen3.5-reasoning-700x、LogosForge-scored-sft-v1强化数学解题DeepSeek-v3.1-reasoner-Distilled-math-samples、gpt-oss-120b-reasoning-STEM-5K训练代码/算法能力Competitive-Programming-python-blend、qwen3-coder-480b-distill-mini做大规模 SFTLogicMind-Chat-Reasoning-SFT-300K29.6 万条中文模型微调Chinese-Qwen3-235B-Thinking-2507-Distill-100k10 万条中文垂直业务落地IELTS-writing-feedback-reasoning、financial-economics-reasoning这 24 个高保真蒸馏数据集的最大意义在于它们把旗舰模型的思考过程变成了普通人也能拿走的训练原料。配合项目内的训练 Notebook 和 PDF 教程即使只有浏览器和免费云环境也能完整走通一条数据 → 微调 → 部署的大模型适配之路 赞分享【免费下载链接】Jackrong-llm-finetuning-guide项目地址https://gitcode.com/gh_mirrors/ja/Jackrong-llm-finetuning-guide点击查看免费下载相关推荐Windows虚拟光驱软件选哪个WinCDEmu让你告别光盘烦恼Windows虚拟光驱软件选哪个WinCDEmu让你告别光盘烦恼 还在为ISO、CUE、NRG等光盘镜像文件发愁吗每次需要安装软件或访问光盘内容时都要找物存储驱动开发Jackrong-llm-finetuning-guide完全指南零基础也能跑通的LLM大模型微调知识库Jackrong llm finetuning guide完全指南零基础也能跑通的LLM大模型微调知识库 Jackrong llm finetuning gu三步极速蒸馏 DeepSeek R1基于 PaddleNLP 的数据蒸馏、SFT 微调与高性能推理部署全流程指南三步极速蒸馏 DeepSeek R1基于 PaddleNLP 的数据蒸馏、SFT 微调与高性能推理部署全流程指南 本篇技术指南以 PaddleNLP 仓库中人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站