自己出题自己练Ornith 两个月狂涨 11% 反超 Opus 4.8全网炸锅【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF2026 年 8 月 19 日DeepReinforce 团队正式发布 Ornith-1.5 系列开源模型一条消息在 AI 社区迅速炸开模型开始自己出题、自己造考试环境、自己答卷并在编码能力上追平乃至局部反超 Claude Opus 4.8。36 氪以两个月狂涨 11%、编码自测反超 Opus 4.8为题报道IT之家、至顶网、知乎、CSDN 乃至抖音的实测视频接连跟进讨论热度从又一个开源模型升级成训练范式是否要变天。这篇深度拆解我们从仓库源码出发README.md把三件事讲透自我出题的训练机制到底怎么运转、11% 的涨幅与反超 Opus 4.8的成色几何以及这对开源模型的竞争格局意味着什么。一、从自脚手架到自我出题自我改进闭环的运转原理Ornith 家族的路线一直很明确。Ornith-1.0 基于 Qwen3.5 与 Gemma 4 继续预训练CPT、mid-training 和 post-training并提出自脚手架self-scaffolding框架——模型不只是生成答案还负责优化解决问题的脚手架与推理展开rollout。而 Ornith-1.5 把这条路线推向了更完整的闭环。README.md 的原话是Ornith-1.5 extends Ornith-1.0 by expanding the self-improvement loop from scaffold and rollout optimization to jointly optimizing task generation, scaffold construction, and solution rollouts.翻译过来就是训练循环中同时优化任务生成、脚手架构建、解决方案展开三件事不再依赖固定的人工题目库和手工设计的评测框架。三段式训练循环每一轮训练循环分三步走出题Task Generation给定一个环境或代码库、任务类型的高层指令以及模型此前解题的历史记录系统持续提出比当前能力更进一步的新任务暴露能力缺口把训练前沿往外推。搭脚手架Scaffold Construction针对每个任务模型生成或精化一套考试环境——包括指令、工具、任务分解策略与编排方式即怎么解这道题的完整流程设计。答卷与反馈Solution Rollout GRPO在任务与脚手架条件下策略产出解决方案 rolloutrollout 的奖励反向传播到三个阶段让系统不仅学会答得更好还学会出更有用的题、搭更有效的脚手架。三个阶段全部通过 GRPO一种基于群体的强化学习算法联合优化构成一个封闭的自我改进回路更强的策略 → 生成更难更有信息量的任务 → 更好的脚手架 → 更高质量的学习信号 → 更强的策略。三道奖励闸门有效、恰当、不重复关键在于任务奖励的设计官方定义为三因子乘积$$R_{task} V(q,s) \times D(q,s,{\tau_i}) \times N(q)$$V(q,s)——有效性/可验证性检查脚手架能否正确执行、高置信度答案能否通过、明显错误答案是否被拒绝、评测是否与任务说明一致。V 是一个硬门V0直接令总奖励为 0防止看起来难但根本没法验证的畸形任务白拿奖励。D(q,s,{τ})——前沿难度Frontier Difficulty对每个任务采样 N 条 rollout 计算经验成功率 p然后奖励那些成功率接近目标前沿 p*设为 0.2的任务形式为高斯函数exp(-(p-p*)²/2σ²)。p* 取 0.2 意味着挑战性足够、但仍能拿到足够多成功轨迹供强化学习使用。当模型变强、任务被稳定解决时其奖励自动衰减出题器被迫转向更难的题目——这就是课程会随能力自动演进的机制。N(q)——新颖性N(q) 1 - max sim(q, q_j)对已生成或已训练过的题目缓冲池取最大相似度惩罚重复出题只作为次级信号减少冗余而非奖励猎奇。脚手架奖励同样三道闸门R_harness C(q,h) × F(h,{τ}) × H(h)分别度量任务对齐评测是否忠实反映任务说明、奖励保真奖励是否真实跟踪候选解质量、抗作弊能否抵抗评测器短路与 reward hacking。rollout 奖励则直接由生成的脚手架打分R_rollout(τ_i) h(q,τ_i)。这套设计的精髓是难度不是由人类标注的而是由模型自身 rollout 的成功率动态标定的——它精准地贴着当前能力的边界出题既不做无用功也不被简单题喂饱。二、11% 从哪来数据拆解与反超 Opus 4.8的成色两个月狂涨 11%并非营销话术而是有明确数据支撑的Ornith-1.0 发布于 2026 年 6 月前后1.5 在 8 月 19 日登场相隔约两个月期间旗舰 397B 在Terminal-Bench 2.1Terminus-2 框架从 77.5 分跃升至 86.1 分相对提升约 11.1%SWE-bench Verified 也从 82.4 涨到 86.0。这还不算最炸裂的——在同一基准的 Claude Code 评测轨道上Ornith-1.5-397B 拿下85.2 分反超 Opus 4.8 的 78.9 分SWE-bench Verified 以 86.0 对 85.8 险胜Terminus-2 轨道 86.1 对 85.0 也实现压制。但把分数摊开看叫板 Opus 4.8与全面反超 Opus 4.8是两回事。DeepSWE 上 397B 得 56 分Opus 4.8 是 59 分SWE-bench Pro 65.1 对 68HLEno tools44.6 对 49.8GPQA Diamond 92.8 对 93.6。社区里Ornith-1.5 叫板 DeepSeek V4但仔细看分数事情没那么简单的讨论正是看到了这层复杂性——反超发生在编码自测类基准综合推理与长程 Agent 任务仍有差距。此外397B 以 86.1/56.0 对 DeepSeek-V4-Flash-0731 的 82.7/54.4、GLM-5.2 的 82.7/46.2在同规模开源阵营里确实是头部。35B-A3B激活 3B 参数的越级选手我们仓库里托管的是家族中段成员Ornith-1.5-35B-A3B总参数约 350 亿的混合专家MoE架构每个 token 只激活约 30 亿参数BF16 权重约 70GB。它的横向成绩单源自 README.md 的完整基准表如下基准Ornith-1.5-35B-A3BOrnith-1.0-35B-A3BQwen3.6-35B-A3BGemma-4-31BMuse-Glimmer-30BQwen3.5-397BTerminal-Bench 2.1 (Terminus-2)67.864.252.542.151.753.5Terminal-Bench 2.1 (Claude Code)68.562.849.2——48.6SWE-bench Verified79.075.673.452.076.076.4SWE-bench Pro59.650.449.535.751.251.6DeepSWE22.00.00.0——1.0Frontier-Bench v0.15.11.41.4——1.4NL2Repo46.234.629.415.5—36.8GPQA Diamond89.286.286.084.383.588.4MCP-Atlas70.264.462.855.075.572.3ClawEval72.569.868.748.5—70.7三个值得细读的看点对同代同规模全面压制Terminal-Bench 2.1 上 67.8 对 Qwen3.6-35B 的 52.5高出约 29%Claude Code 轨道 68.5 对 49.2SWE-bench Verified 79.0 对 73.4。对稠密模型以大欺小被逆转只激活 3B 参数的模型在 SWE-bench Verified 上超过稠密 Gemma-4-31B52.0和 Meta Muse-Glimmer-30B76.0Terminal-Bench 2.1 上 67.8 对 42.1/51.7 更是断档式领先——脑子接近 27B 密集模型的社区实测说法不算夸张。能力跃迁最陡的是长程 Agent 任务DeepSWE 从 1.0 的 0 分直接干到 22 分Frontier-Bench 从 1.4 到 5.1NL2Repo 从 34.6 到 46.2——这类需要自主规划、长上下文、工具调用的任务恰好是自我出题自搭脚手架训练收益最大的地方。当然MCP-Atlas 上 70.2 仍落后 Muse-Glimmer-30B 的 75.5说明 Agentic 能力的跃升也非全面。需要强调的评测严谨性官方所有 Ornith-1.5 成绩均为5 次独立运行的平均值SWE-bench 系列评测做了反作弊处理删除仓库 Git 历史防抄袭、禁用网络防外取信息NL2Repo 阻断了对指定 GitHub 仓库与 pip 包的访问以防 reward hackingHLE 与 MCP-Atlas 部分任务使用 Claude 系列模型做裁判。这些细节意味着官方数字不是裸奔的但模型自己出题评价自己的方法论本身仍需要第三方复测与社区实测来交叉验证——这正是下文的落地章节要做的。三、35B-A3B 的落地图景从 70GB BF16 到消费级显卡这个仓库就是为人人可跑准备的根目录下是 Ornith-1.5-35B-BF16.gguf约 71GB与四档量化 Q4_K_M、Q5_K_M、Q6_K、Q8_0外加约 900MB 的 mmproj-Ornith-1.5-35B-BF16.gguf 多模态投影文件。配合 llama.cpp / Ollama一条命令即可拉起服务# llama.cpp在 8000 端口起 OpenAI 兼容 API256K 上下文 llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144 # Ollama 一行拉取运行 ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF注意这是个推理模型默认回答前会先输出think.../think思考块服务端需开启推理解析器把思维链放到独立的reasoning_content字段工具调用则解析为 OpenAI 风格的tool_calls。官方对运行时有硬性要求Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9推荐采样参数为temperature0.6, top_p0.95, top_k20复现基准成绩则用temperature1.0。在 2×80GB GPU 上可以起完整服务保留 256K 上下文余量vllm serve ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tensor-parallel-size 2 \ --max-model-len 262144 \ --gpu-memory-utilization 0.90 \ --enable-prefix-caching \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-code对超长上下文需求官方验证过 YaRN 缩放在config.json中加rope_scalingrope_type: yarn, factor: 4.0即可把有效窗口扩到约 100 万 tokenvLLM 与 SGLang 都内置支持——但只建议在真正需要长窗口时开启因为开源运行时是静态缩放可能轻微损伤常规长度输入的质量。正是激活 3B、总参 35B的稀疏结构让社区实测频频出现小显存惊喜有博主在 4070Ti 12G 上流畅跑起 35B-A3B评价是跑起来像 3B、脑子接近 27B 密集模型CSDN 上 16G 显存的 4-bit/5-bit 量化部署对比、Ollama 实测系列也验证了 Q4_K_M 在 16GB 下是性价比平衡点。再加上 OpenAI 兼容 API 可以直接对接 OpenCode、Hermes、OpenClaw 等编码 Agent 工具链一个消费级显卡上的 Opus 级编码助手的图景基本成立——这在此前几乎是大厂闭源 API 的专利。四、格局之变当开源模型开始自己出题、自己考自己把机制与数据放回竞争坐标里Ornith-1.5 带来的冲击是结构性的至少体现在三个层面。第一训练范式从投喂数据转向自演进课程。传统强化学习如 GRPO 的标准用法是给定固定题库与评测器模型在框内找答案Ornith 把出题器、脚手架、答题器都变成可学习对象并以前沿成功率 p*0.2动态锚定难度。这意味着开源模型第一次可以不依赖人工标注规模的军备竞赛用算力换课程生成能力——方法论上这是对数据是护城河假设的一次正面挑战。当然这也带来新的拷问当模型给自己出题并自评分数是否仍可信官方的防作弊评测删 git 历史、断网、5 次均值是正面回应但第三方基准复测与社区实测才是最终裁判这也是本轮讨论里最健康的张力。第二稀疏 MoE 把旗舰性能的硬件门槛打穿。35B 总参/3B 激活的结构配合 GGUF 量化全家桶让原本需要双卡 80GB 的编码 Agent 体验下沉到 12~16G 消费级显卡而 9B 稠密版及量化移动版 Ornith-1.5-9B-Mobile 可直接跑在 iPhone 17 与安卓手机上还显著超过 Gemma-4-31B、Qwen3.6-35B 等更大的模型。开源阵营第一次同时占据性能天花板397B 对 DeepSeek-V4-Flash、GLM-5.2与部署地板手机端两个生态位。第三编码 Agent 的竞争从模型能力扩展到自我改进速度。从 Ornith-1.0 到 1.5 的约两个月里旗舰在 Terminal-Bench 2.1 上完成 77.5 → 86.1 的跃升35B 把 DeepSWE 从 0 拉到 22——如果这种自我出题-自我训练的飞轮能持续滚动那么每次版本迭代的效率将成为新的竞争变量。对 Qwen、GLM、DeepSeek 等开源阵营玩家而言比下一版更强更重要的是强得更快。回到仓库本身这个 GGUF 镜像仓库的使命很纯粹——README.md 用一张完整的 35B 基准表、vLLM/SGLang 双引擎部署配方、YaRN 长上下文方案和 Agent 生态接入指南把论文级能力翻译成了人人可跑。无论自我出题的分数在第三方复测中最终打几折Ornith-1.5 都已经证明了一件事开源模型的下一轮竞赛可能不再比谁喂的数据多而是比谁更会给自己出难题。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?