首页 / 资讯中心 / 文章详情

GEV-26B-Decide 自适应思维指南:只在需要时思考,准确率显著提升

GEV-26B-Decide 自适应思维指南:只在需要时思考,准确率显著提升 ★ FEATURED ARTICLE
GEV-26B-Decide 自适应思维指南只在需要时思考准确率显著提升【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-DecideGEV-26B-Decide是一个开源的决策模型decision model基于 Gemma-4-26B-A4B-it 底座约 26B 总参数、每 token 约 4B 活跃参数。它的核心能力是自适应思维adaptive thinking先用系统 1快速直答只有当答案不够确定时才触发系统 2深度推理把推理结论折回最终概率。在 6 个公开推理数据集上这种只在需要时思考的策略把整体准确率从73.3% 提升到 83.4%而平均只有约48% 的题目真正动用了思考——既拿了高准确率又省下了大量推理时间。什么是自适应思维GEV-26B-Decide 把回答分成了两层类似人类直觉与深思的区别模式工作方式速度系统 1快一次前向传播直接给每个选项输出校准概率约 45 ms自适应思维系统 1 先答置信度低于阈值默认 0.8时系统 2 开始思考结果按比例融合思考时可达秒级系统 2慢完整的 Gemma-4 思考模式逐步推理约 250 tokens/秒三步走流程详见 README.md 的Adaptive thinking章节快速分布系统 1 一次性给出概率分布 p1仅在不确定时思考若最高选项概率低于阈值 0.8系统 2 针对同一问题推理思考长度由think_budget控制融合结果p ½·p1 ½·p2。等权混合既保留了推理的准确性又保留了系统 1 的概率校准。实测效果1754 道题73.3% → 83.4%项目作者在 6 个公共数据集AQuA-RAT、LogiQA、StrategyQA、MedMCQA、OpenBookQA、CommonsenseQA共 1754 题上验证了该策略数据集系统 1自适应思维动用思考的题量AQuA-RAT数学应用题68.189.053.9%LogiQA逻辑推理55.380.363.7%StrategyQA多跳问答68.078.771.0%MedMCQA医学66.771.752.3%OpenBookQA科学94.396.314.7%CommonsenseQA常识86.785.032.0%总计73.383.447.8%关键结论自适应模式达到了永远思考上限收益83.8%的96%却只思考了不到一半的题目概率校准性保持不变ECE 均为 0.035输出概率依然可信思考长度中位数约 2282 tokens90 分位 7573 tokens。完整数据见 reports/adaptive_validation_summary.json。看它思考扫雷 21% → 86%仓库内置了演示视频videos/目录展示系统 1 答错、自适应思维答对的谜题过程扫雷哪个隐藏格子一定安全系统 1 只有 21%低于 25% 的瞎猜水平开启思考后达到86%。四子棋哪一列能赢或能挡54% →99.5%。同样的测试还覆盖 Wordle52% → 100%、数独76% → 99.5%、24 点游戏89% → 100%。明细数据在 reports/thinking_games.json。Decision Index知识推理领域 0.429 → 0.602开启自适应思维后Knowledge Reasoning 领域十个基准33,856 次评分请求的代表性提升基准系统 1自适应备注GPQA Diamond42.978.6思考比例 87%MMLU-Pro65.084.6思考比例 78%BBH75.092.0思考比例 60%CRUXEval代码67.590.7思考比例 42%GSM8K数学97.699.1仅 5% 题目需思考模型整体 Decision Index 0.2.1 得分62.48平衡技能超过榜单上的 TypeSafe Jev 1.1357.91。完整结果见 reports/decision_index_adaptive.json。何时该关思考——分类、检索别开自适应思维并非越开越好。作者在另外五个基准上验证工具调用BFCL 94.4→96.0、意图分类有小幅提升但BANKING77 分类反而从 88.0 掉到 85.0——未参与训练的系统 2 会用过度自信的错答案推翻系统 1 的正确判断。因此官方建议推理类问题开auto分类/检索/工具路由保持off。样本数据见 reports/adaptive_other_areas_sample.json。延迟与调参速度与准确率的权衡思考是有代价的不思考时约 0.05 s8192 token 的完整思考在单卡 B200 上最多约 33 s十个基准整体中位 13.4 s。使用推测解码MTP1可把思考速度从 247 提升到约 438 tokens/秒中位延迟降到 7.7 s。参数作用建议threshold系统 1 低于该置信度才思考默认 0.8调低多思考更准但更慢think_budget思考 token 上限按延迟预算调整thinkingoff/auto/on推理任务用auto延迟汇总见 reports/adaptive_latency_summary.json。快速上手两行命令即可启动vLLM 服务单卡需 80GB 显存hf download autotrust/GEV-26B-Decide --local-dir GEV-26B-Decide bash GEV-26B-Decide/serve.sh之后调用POST /v1/decide接口传入thinking: auto即开启自适应思维。服务脚本与路由实现在 serve_decide.py 和 serve.sh推理阈值、融合比例等默认值可通过GET /v1/decide/info查看。核心文件导航文件说明README.md完整文档基准成绩、使用方式、限制说明adapter_vllm/vLLM 用的系统 1 LoRA 决策头head.safetensors24 槽决策头fp32calibration.json各类别的温度校准默认judge_config.json槽位布局与读出配置reports/自适应思维验证、延迟、游戏等全部实验数据小结GEV-26B-Decide 展示了一种实用主义思路让模型先凭直觉快速作答只在没把握时才慢思考。它用不到一半题目的思考成本换来了 10 个点的整体准确率提升并且保留了可校准的概率输出——对需要置信度门槛的自动化决策场景如机器人操作、意图分类、知识推理来说这是又快又准的完整开源方案。【免费下载链接】GEV-26B-Decide项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/GEV-26B-Decide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站