Harness 驱动训练首次落地NeoHorse 的 RSI 路径和主流 RL 路线差在哪【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B递归自我提升Recursive Self-Improvement, RSI这一概念被反复讨论多年但一直缺少一个可落地的机制一个 AI 系统究竟通过什么渠道观察自己的能力又如何把观察到的证据转化为下一轮学习的输入2026 年 9 月 8 日基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布的技术报告给出了一个具体的工程答案——NeoHorse-14B / 9B。这家由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办的公司此前已开源了用于 Agent 执行时模型调度的 Routing Harness 系统 OpenSquillaNeoHorse 把这条调度路线直接延伸进了模型训练让部署层每天产生的执行轨迹反过来决定模型下一轮学什么。本文结合技术报告与本地仓库源码拆解三条主线Harness 究竟是什么、NeoHorse 的 RSI 闭环如何运转、以及它与当下主流的 R1 式 GRPO、传统 RLHF 路线在本质上差在哪。Harness 是什么从执行调度层到训练数据工厂Harness 是 Agent 的执行层负责管理上下文、工具调用和与环境的交互——用户看到的Agent 会调工具、会看反馈、会改错本质上是 Harness 与模型共同协作的结果。在此基础上引入路由Routing执行层便获得了一项新能力根据请求内容和交互状态从模型池中选择最合适的模型来服务。NeoHorse 技术报告将这条链路称为harness-native data flywheel一个部署中的路由 Harness 除了交付任务输出还会留下执行轨迹与模型能做什么、还做不到什么的可观测证据。NeoHorse 的关键动作是把这些原本只服务于线上调度的记录重构成训练语料。正如仓库 README.md 中 Highlights 所描述的routing harness 将任务分配给异构模型池、记录工具交互与结果、估计能力需求并用能力层面的反馈塑造下一轮训练混合更新后的模型回到 harness 中继续执行从而闭合一个评估—选择—更新的原型循环。此前 LLM 路由的研究如成本感知的模型级联、基于偏好的学习式路由关注的是如何以更低成本获得更好回答NeoHorse 则第一次系统性地把路由行为本身当作训练信号——这是它与所有先训练好模型、再上线路由方案的出发点差异。RSI 闭环如何运转预测—行动—结果三件套NeoHorse 的 RSI 路径可以拆成四个可验证的环节第一数据侧生产轨迹的工业化清洗。主语料是约 10^5–10^6 条 harness 生成的执行轨迹辅以公开指令、推理、工具与偏好数据。数据组织为三级粒度trajectory完整交互→ user turn基本训练单元→ subscene共享局部目标的相邻轮次组。每个轨迹先过结构化校验验证消息顺序、工具调用/结果闭环、因果事件次序产出完整可复用 / 部分可恢复 / 隔离三种结果再经六维语义评估目标达成、指令遵循、工具使用、证据一致性、错误恢复、终止质量每条轨迹保留结构状态、质量维度与证据覆盖而非压缩成单一启发式分数。第二路由信号把能力需求预测变成课程排序的依据。Harness 的路由器在每个 user turn 预测能力需求并把请求分配到四个服务层级C0 处理有界低风险请求C1 是通用默认C2 支持多步推理与执行C3 提供最高能力与可靠性。语料为每一轮同时保留路由器原始预测、策略调整后的决策与实际服务层级——预测、策略、行动三者独立可分析。论文特意强调排序用的是预测的能力需求可区分同层样本的软分数为各层级得分的加权期望而非实际服务模型的身份因为后者会被用户覆盖、服务可用性等部署因素污染。第三方法侧路由引导的课程 SFT 与 on-policy 蒸馏。训练分为三个阶段按路由分数由低到高渐进引入样本同时把部分低分样本保留到后期避免训练末期被高能力需求样本独占。SFT 只学习记录中 assistant 的响应为弥合训练分布与部署分布的差距同一套三阶段调度被扩展到 on-policy distillation学生模型在记录的真实上下文上生成响应固定教师模型在学生访问过的前缀上提供 next-token 分布用 top-K 候选加剩余概率桶的粗化 reverse-KL 目标监督。路由组织学习材料on-policy 监督跟随学生行为演化。第四反馈侧capability-guided allocation 闭合数据循环。每一轮训练后当前 checkpoint 在去污染后的分层评测集上评估结果按属性、质量维度、结局状态与路由层级聚合为能力缺陷画像驱动下一轮训练混合向弱项倾斜同时保留广泛覆盖。更新后的 checkpoint 回到 harness 池产生的新轨迹揭示下一批能力缺口——这就是论文所称的 evaluation–selection–update 循环。需要严格区分的是论文明确将其定位为初始原型目前只跑通了单轮循环跨模型代际的增益能否持续累积仍待验证。和主流 RL 路线差在哪三条岔路理解 NeoHorse 的价值最好的参照是把当下两条主流路线摆出来R1 式 GRPOrule-based RLDeepSeek-R1 确立的范式。奖励来自规则验证器格式合规 答案正确性策略用 GRPO 以组内相对优势替代 critic 模型。其 Agent 延伸如 Search-R1、ReTool、RAGEN 等把环境反馈当作奖励来源做多轮强化学习。传统 RLHF用人类偏好数据训练奖励模型再以 PPO 优化策略。Llama 3 的 iterative SFT rejection sampling DPO 属于这一谱系的轻量变体。NeoHorse 的 harness 驱动路线既不用奖励模型也不构造规则验证器而是用生产 harness 记录的结局outcome与路由预测来组织监督信号——训练目标不是策略梯度而是课程化 SFT 加 on-policy 蒸馏。差异可以从五个维度拆开看维度R1 式 GRPO传统 RLHFPPORMNeoHorse harness 驱动奖励/信号来源规则验证器格式、答案可验证人类偏好训练的 RMharness 记录的结局 路由预测优化方法策略梯度GRPO组内相对优势PPO需 critic课程 SFT on-policy 蒸馏reverse KL训练数据模型自身 rollout人类偏好对生产 harness 的执行轨迹难度刻画隐式探索与奖励驱动无路由预测能力需求C0–C3 三阶段反馈闭环可验证任务上可自我进化无capability-guided allocation 重塑下一轮混合这三点是最本质的分野其一信号可信度来源不同。GRPO 依赖答案可验证一旦任务没有客观对错开放任务、长程交互规则奖励就失效RLHF 依赖 RM 的质量与泛化。NeoHorse 不要求任务可验证它信任的是harness 里真实发生的交互及其结局——代价是结局质量要靠六维语义评估去保证评估本身引入了 judge 模型的噪声。其二难度信息从哪来。R1 路线靠策略在探索中自行发现难度NeoHorse 则把路由层预测能力需求这一部署时已有的副产品直接用作课程排序信号这是它最独特的一点。其三闭环的粒度。GRPO 的自我进化以单个可验证任务为界NeoHorse 的闭环发生在训练混合这一层系统学到什么能力决定它下一轮从哪类数据中学习。源码证据一个为 harness 而生的模型仓库中实际发布的权重与配置恰好能印证harness-native不是报告里的修辞。chat_template.jinja 是观察训练信号形态最直接的窗口模板完整支持think推理块、tool_call/function工具调用、tool_response工具结果回填且在处理多轮消息时保留当前轮的推理、将历史推理省略而保留可见响应与工具交互——这与论文 4.1 节以 user turn 为训练单元、保留交错推理与工具调用、历史推理不作为监督目标的描述逐条对应。换言之模型从后训练一开始就在学习带工具、带反馈、带上下文的交互这一种文本形态而非纯对话。config.json 显示 model_type 为qwen3_5_text32 层中每 4 层插入一个 full attention其余为 linear attention原生上下文 262,144model.safetensors.index.json 记录约 17.9GB 的 BF16 权重分片。架构完全继承上游 Qwen3.5-9B、未做改动意味着报告中的能力增益全部来自后训练方法本身——这反过来让路由轨迹数据 vs 公开数据的对照实验更有说服力同一训练配置下harness 轨迹训练出的 checkpoint 在五个基准上的平均分比使用公开工具 Agent 数据Toucan高出 6.26 分其中 HumanEval 8.54、τ²-Bench 11.31。评测结果同样可在仓库中复核。README 的九项基准表中NeoHorse-1-9B 对 Qwen3.5-9B 的十项宏平均提升为 3.4465.60 → 69.044B 版本从 58.94 升至 64.87把 4B 模型与 9B 基线的聚合差距压缩到不足 1 分提升最集中的是 Agentic 能力区QwenClawBench 4.69、PinchBench 7.70、τ²-Bench 2.78与报告交互式执行能力受益最大的结论一致。轨迹级分析提供了更细的证据在 PinchBench 的数据分析任务中面对 pandas 依赖不可用这一环境约束4B 模型反复尝试安装、手工解析 CSV、打补丁均告失败9B 模型则识别出原路径被阻塞切换至 Python 标准库完成分析模型请求数、执行时间与 token 消耗分别下降约 70.8%、76.7% 和 83.6%。这组数据说明训练带来的不只是答案质量还有把执行反馈纳入后续决策、及时终止无效轨迹的行为变化。可行性评估真突破还是概念包装必须承认这一路径有扎实的支撑面其一信号真实性。训练数据来自真实生产 harness 而非合成对话prediction–action–outcome 三件套彼此独立可核验其二有消融证据。同配置下 harness 数据显著优于公共合成 Agent 数据说明增益来自数据源的生态位而非课程算法本身其三规模有效。在嵌套子集实验中开发集平均分随 harness 监督量增大从 69.31 稳步升至 71.45其四与主流 RL 兼容。on-policy 蒸馏本身可作为后续 RL 阶段的热启动R1 式路线与 harness 路线并非互斥。但保留意见同样不容回避这决定了它目前仍是原型而非范式闭环只转了一圈。论文明确承认结果反映的是单次 evaluation–selection–update 循环跨代累积尚未验证。严格意义上RSI 要求每一代都贡献于下一代NeoHorse 目前做到了被使用 → 产生轨迹 → 改进自身的半个循环。收益高度集中在 Agentic 区。IFBench 持平0.00、IFEval 微降-0.37、LiveCodeBench v6 持平0.00——交互式执行能力提升明显而静态指令遵循与前沿编程基本未动说明该方法擅长的是把交互过程变成能力而非无中生有地拔高知识上限。难度信号是预测而非事实。路由分数是估计的能力需求本身受用户覆盖、服务可用性影响论文也承认未来需要用预测—行动—结果的分离来校准难度与缺陷估计。名实之辨。当前实现是带能力反馈的数据分配 课程化后训练与模型自动修改训练流程/研究流程的强 RSI 还有本质距离。把它称作RSI 的机制原型是准确的若称作已实现自我提升则过度。结语NeoHorse 的真正贡献不在于又刷新了几个 Agent 基准而在于回答了 RSI 的第一个工程问题反馈从哪里来。它给出的答案是——不需要为训练专门构造验证器或奖励模型部署中每天产生的路由轨迹本身就是反馈。当 4B 模型通过被使用就能把与 9B 基线的差距压缩到不足 1 分这条路径的价值已经部分被证明。下一步的关键变量只有一个把单轮循环扩展到多代看增益能否像复利一样累积。在此之前对Harness 驱动训练首次落地最恰当的评价是——机制成立终点未到。【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?