首页 / 资讯中心 / 文章详情

RSI双环首次跑通:『AI自己给自己找教练』终于不是口号

RSI双环首次跑通:『AI自己给自己找教练』终于不是口号 ★ FEATURED ARTICLE
RSI双环首次跑通『AI自己给自己找教练』终于不是口号【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B2026 年 9 月 8 日基元律动TokenRhythm联合无问芯穹、清华、北大、阿里巴巴等机构发布 Agent-Native 模型 NeoHorse-14B 与 9B 两个版本并在 arXiv 2609.08183 技术报告中给出一个明确的判断一个部署中的路由 Harness执行层本身就包含着递归自我改进RSI所需要的机制——它天然记录了模型会做什么、还不会做什么的证据而这些证据可以直接决定下一轮训练该学什么。随报告放出的 4B 权重即本仓库把这件事从 PPT 变成了可下载的 safetensors模型被后训练后十个基准的宏平均分从 58.94 提升到 64.875.93并且更新后的模型可以回到 Harness 中重新服务为下一轮训练产出新数据——社区所说的RSI 双环首次跑通指的就是这条执行—反馈内环与评估—选择—更新外环组成的闭环第一次以一个可自托管的开源模型为载体被完整演示了一遍。本文基于技术报告全文与本仓库源码级文件README.md、config.json、chat_template.jinja 等拆解双环各自如何运转、4B 跑通的证据与边界、它与业界AI 自动化 AI 研究路线的异同以及目前应当保留的质疑点。一、RSI 是什么双环指哪两环RSIRecursive Self-Improvement最早可追溯到 I. J. Good 1966 年对超智能机器的推演其现代含义是AI 系统用自身产生的经验、评估结果或生成物参与改进自身的模型、脚手架或训练流程。它之所以被视为结构性机会在于一旦改进模型这件事本身被部分自动化每一代模型都在参与生产下一代数据与人力监督不再是硬边界。但这条路径长期卡在一个具体问题上系统如何观察自己的真实能力并把这种观察转化为下一轮学习的输入Benchmark 分数太粗一个标量人工标注太贵纯自生成数据又缺乏哪里弱的方向性信号。NeoHorse-1 的回答是把 RSI 的机制下沉到服务链路本身拆成两个嵌套的环内环服务时执行—反馈环Harness 环。系统由异构模型池 智能路由组成其中包含其开源路由系统 OpenSquilla。路由模块按用户轮user turn预测能力需求将请求分派到四个服务档位档位语义C0有界低风险请求C1通用默认档C2多步推理与执行C3最高能力/可靠性档可多提议者聚合器组合每个 turn 都会留下三元记录预测的能力需求router 原始预测— 策略调整后的决策 — 实际服务的档位连同完整的工具调用、环境观测、恢复尝试与最终结果。报告强调预测—行动—结果三者独立可分析实际服务的档位不代表难度可能反映用户覆盖、服务可用性、部署策略而预测的需求才用作能力需求的代理信号。这一环的意义在于模型在日常服务中自己给自己做体检体检结果以轨迹形式沉淀为训练语料。外环评估—选择—更新训练环。每一代 checkpoint 在一个与训练数据严格去污隔离的分层评测套件上评估结果按场景属性、质量维度、结果状态、路由档位聚合为一份模型缺陷画像model-deficiency profile该画像把下一轮训练配方的重心移向表现欠佳的区域同时保留广域覆盖。验证成功的轨迹提供正向监督信息量高的失败样本定位需要补强或再平衡的区域。训练完成后新模型回到 Harness 模型池继续服务产生新的轨迹、路由记录与能力反馈——系统学会做什么决定了它接下来学什么。README.md 的 Highlights 第一段就是对这条外环的官方表述routing harness assigns tasks to a heterogeneous model pool, records tool interactions and outcomes, estimates capability demand, and uses capability-level feedback to shape the next training mixture. Updated models can return to the harness, closing a prototype evaluation–selection–update loop. 所谓AI 自己给自己找教练准确说就是能力反馈来自模型自己在 Harness 中的真实执行表现训练配方的调整由这份反馈驱动而不是由人工挑数据集驱动。需要强调边界当前发布验证的是单趟single pass的完整闭环跨多代模型的迭代累积是报告自己列出的下一步。跑通是工程事实持续改进尚待证明。二、双环的机械结构数据侧、训练侧与仓库证据2.1 数据侧把执行轨迹变成可监督样本语料主部为1e5–1e6 量级的 Harness 生成轨迹辅以公开数据扩宽覆盖指令/对话、推理、工具、代码、偏好。组织粒度为三级完整轨迹trajectory→ 用户轮user turn基本序列化训练单元→ 子场景subscene共享局部目标的相邻 user turn用于语义刻画。进入训练集前每条轨迹要过三道闸去重与去污精确与近重复去重同一套匹配基础设施用全部评测集筛查训练候选命中评测题目的记录从训练侧剔除保证训练/评测不相交——这条在多轮自改进中尤为关键否则外环每转一圈都在背题。结构化校验规则化验证载荷可读性、因果事件顺序、tool-call/result 配对闭合、终态分支等产出三类操作结果完整直接进入语义评估、部分可恢复仅贡献因果闭合的子轨迹、隔离ambiguous不进入训练。六维语义评估目标达成、指令遵循、工具使用、证据一致性、错误恢复、终止行为每维给出 PASS / WARN / FAIL / NOT_EVALUATED且语义裁判被限制在轨迹内显式存在的证据范围内缺失证据从不折算为正向判定。此外还有子场景级的 Scene / Goal / Outcome 三轴标注用户做什么、期望什么、实际结果是什么与路由信号对齐后构成意图—分配—结果的联合分层空间供外环做能力导向分配。仓库里的 chat_template.jinja 就是这套监督约定的落地格式可以直接验证报告的说法工具结果以tool_response.../tool_response包裹、且 tool 角色消息被并入 user 轮渲染assistant 侧的tool_calls序列化为 【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站