3比特逼近BF16原模Qwen3.8-Flash-Next-GSQ-RCO-GGUF的AIME25与GPQA基准数据深度解析【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF这是一份关于Qwen3.8-Flash-Next-GSQ-RCO-GGUF量化模型的基准数据解读。该仓库使用 ISTA-DASLab 的 GSQ-RCO 非均匀量化方法把一个 512 专家 MoE 多模态模型压缩到2.4~3.5 比特bpw却在 AIME25 数学基准上打出100.00 满分在 GPQA-Diamond 科学推理基准上还以92.93反超 BF16 原模的 91.92。本文将带你逐项拆解 AIME25 与 GPQA 的得分曲线、体积与内存开销帮你判断该选哪个量化档。这是什么模型GSQ-RCO 量化 GGUF 是什么GSQ-RCO是两阶段混合精度量化方案产出的是标准 GGUF 文件可直接在llama.cpp、Ollama、LM Studio 中运行GSQ低比特标量量化通过 Gumbel-Softmax 松弛学习每个坐标的网格分配在 2~3 比特区间把标量量化与向量量化的差距压到最小RCO预算约束搜索在总体积预算下为每一个张量单独挑选量化类型——而不是像传统量化那样全模型统一一种格式。以 IQ3_S 的分配文件 为例1223 个张量中混用了 Q6_K、Q4_K、IQ3_S、IQ2_S、BF16、F32 等十多种类型敏感的专家矩阵按层分配低比特格式输出头保留 Q6_K归一化等小张量维持 F32/BF16 不动。这正是3 比特平均宽度却几乎不损失能力的关键——比特被精确花在了刀刃上。四个量化档位一览体积、精度、定位每个档位均为两个分片shard 2 是 28.8 GB 的 n-gram 查表层所有档位完全相同档位目录平均比特数总大小定位Q2_0/2.40 bpw66.4 GB极速档避免查表型格式IQ2_XS/2.50 bpw68.0 GB同质量下最小IQ3_XXS/3.00 bpw75.8 GBAIME25 追平原模省内存之选IQ3_S/3.50 bpw83.6 GB官方推荐全任务追平/超越原模mmproj-Qwen3.8-Flash-Next-BF16.gguf16 bpw0.91 GB视觉编码器 投影器多模态 相对 354 GB 的 BF16 原模最小的 Q2_0 也只有其 1/5.3 的大小。AIME25 数学基准3.0 比特即满分AIME25 是难度极高的数学竞赛基准BF16 原模得分为100.00基线虚线。各档位表现档位AIME25与原模差距Q2_02.40 bpw96.67-3.33IQ2_XS2.50 bpw96.67-3.33IQ3_XXS3.00 bpw100.000.00✅IQ3_S3.50 bpw100.000.00✅从曲线看2.5 bpw 以下得分停留在 96.67跨过 3.0 bpw 后直接跃升至满分并封顶。这说明数学推理能力对比特宽度存在明显的阈值效应——而 GSQ-RCO 在 3.00 bpw75.8 GB仅为原模 4.7 分之一就精确命中了该阈值。GPQA-Diamond 科学推理IQ3_S 反超原模 1 分GPQA-Diamond 考察博士级科学问答BF16 基线为91.92IQ3_S92.93比原模高 1.01 分——官方 README 也注明这属于基准波动范围内的追平/小幅超越并非量化模型真的比原模更强IQ3_XXS91.41仅落后 0.51 分有趣的现象IQ2_XS87.37反而低于更小的 Q2_089.39。两者任务均分只差 0.09但量化类型分配不同导致 GPQA 上各有胜负——Q2_0 强在科学推理IQ2_XS 强在代码LCB v6 上 83.43 对 81.14。LiveCodeBench v6 代码基准低比特档的失分点代码生成是对量化最敏感的基准基线 87.43档位LCB v6差距Q2_081.14-6.29IQ2_XS83.43-4.00IQ3_XXS86.29-1.14IQ3_S86.86-0.57曲线在 2.5→3.0 bpw 之间出现最大涨幅约 2.8 分3.0 之后进入平缓区。如果你主要用模型写代码3.0 bpw 是性价比拐点IQ3_S 则把差距压到 0.57 分以内。速度对比Q2_0 提示词吞吐快 3.4 倍速度党的答案是 Q2_0。官方用llama.cpp在 55 条提示、11 类任务上实测指标Q2_0IQ2_XS提示词吞吐t/s367.49108.19解码速率t/s93.7970.30平均延迟6.70 s12.68 s两者文件大小仅差 1.6 GB差距完全来自量化格式IQ2_XS 依赖大查表解码耗时随负载内容波动49.4~94.5 t/s而 Q2_0 解码速率稳定在 92.5~94.5 t/s。长提示场景RAG、写作、代码下 Q2_0 的预填充优势最大可达9.6 倍。内存要求与快速上手核心技巧shard 1 必须常驻显存/内存shard 2n-gram 查表只需按行稀疏读取可用内存映射留在 SSD 上直接省掉 28.8 GB 常驻占用档位必须常驻可留在磁盘下载总量Q2_037.6 GB28.8 GB66.4 GBIQ2_XS39.2 GB28.8 GB68.0 GBIQ3_XXS47.0 GB28.8 GB75.8 GBIQ3_S54.8 GB28.8 GB83.6 GB最小可运行的命令行示例详见 README.mdllama-cli -m IQ3_XXS/Qwen3.8-Flash-Next-GSQ-RCO-IQ3_XXS-00001-of-00002.gguf \ -lm mmap --lazy-mode on -p 解释混合精度量化。 -ngl 99多模态使用时再加载 mmproj-Qwen3.8-Flash-Next-BF16.gguf四个量化档共用同一份视觉投影器。怎么选一张决策表 你的需求推荐档位依据极限速度 / 长提示 RAGQ2_0367 t/s 吞吐延迟减半内存紧张≤76 GBIQ3_XXSAIME25 满分75.8 GB综合最强推荐IQ3_S全任务追平原模GPQA 反超代码生成为主IQ2_XS / IQ3_SLCB v6 领先同体积档位每个量化档还附带 tensor-allocation/ 下的分配清单例如 IQ3_XXS 分配文件可以逐张量审计量化决策复现性拉满。结论3 比特确实足以逼近 BF16 原模——IQ3_XXS 在 75.8 GB 体积下拿到 AIME25 满分与 99.4% 的任务平均分而 IQ3_S 用不到原模四分之一的体积就在 GPQA-Diamond 上超越了 16 比特基线。对大多数用户IQ3_S 是能力与体积的最优交点Q2_0 是速度的王者。【免费下载链接】Qwen3.8-Flash-Next-GSQ-RCO-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?