首页 / 资讯中心 / 文章详情

从 SkillOpt 到 RSI:智能体变强的实验路线

从 SkillOpt 到 RSI:智能体变强的实验路线 ★ FEATURED ARTICLE
一、一个尴尬惊人的事实大模型不会给自己写有用的技能2026 年的大模型几乎什么都会写但有一个例外让它零样本、一次性地写出一个可泛化的技能skill仍然接近无效。SkillsBench 把这个尴尬量化了。这个由社区构建的基准包含 86 个专家验证、真实数据、可验证的专业任务。结果人类专家写的技能curated skills让模型平均提升16.2 个百分点——Claude Opus 4.5 从 22.0 分直接跳到 45.3 分而模型自己一次性生成的技能增益约等于零在部分配置下甚至是负的。SkillsBench灰色为无技能基线黄色为模型自生成技能蓝色为人类专家技能。黄色柱与灰色柱几乎一样高——这就是 2026 年最大的浪费。注意限定词问题不是大模型不能参与写技能而是不能一步到位。人类专家的技能好在哪里不是因为文笔而是因为它们沉淀了失败经验——这个 API 有坑这种文档要先用工具 X 解析。这恰恰是 LLM 一次性生成给不了的东西。于是问题自然变成能不能像训练神经网络一样迭代地训练一段文本让模型在 rollout 里摔跤、反思、修改用验证集防止过拟合——把写技能从一次性的提示工程变成一个有梯度、有门控、有预算的优化问题。2026 年 5 月以来这个问题迎来了一波密集的回答。而这波回答的最新结论相当反直觉。二、序章SkillOpt第一次把文本当参数训本文的技能是广义行为资产可编辑、可分发、可外部验证的文本工件包括技能文件、提示词、工具描述、控制流片段、wiki 条目与记忆策略。狭义的单文件技能只是其中一种形态。后文各处出现的技能都按此广义理解。2026 年 5 月Microsoft Research 放出 SkillOptarXiv 2605.23904。它的划时代意义不在成绩单而在于第一次让优化一段技能文本拥有了优化器的严谨形态。形式化很漂亮冻结 agent 的权重把一个紧凑的自然语言技能文档 StS_t 当作唯一可训练的参数。训练数据来自 rollout 轨迹梯度来自模型对自己轨迹的自我批评更新是加/删/替换的原子编辑编辑率相当于学习率——而每一步更新必须通过一个held-out 验证集的门控才能被接受。测试集则被锁到最后只为出报告。SkillOpt 官方项目页的完整管线图rollout → 分批优化器产生原子编辑 → 合并去冲突 → 编辑预算与学习率衰减 → 验证门控 → 接受或拒绝下方是 epoch 级的慢更新与反思。成绩也确实硬在 7 个目标模型 × 6 个基准 × 多种执行环境的52 个评测单元里SkillOpt 相对无技能基线全胜或打平GPT-5.5 直聊平均提升 23.5 分[1]。SkillOpt 项目主页52/52、7 个目标模型、6 个基准。注意这个数字的口径——它是相对无技能基线的全胜后文还会用到这个口径。工程化也做到了罕见的程度MIT 协议开源pip install skillopt即可使用7 月 2 日的 v0.2.0 加入了 SkillOpt-Sleep 夜间离线自进化引擎并集成了 Claude Code、Codex、Copilot、Devin、OpenClaw 等主流执行环境[2]。GitHub 收获约 1.67 万 star生产案例开始出现DAIR.AI 用 SkillOpt 优化多模态论文图表抽取技能准确率从 0.73 提升到 0.93——20 个百分点的生产环境实测[3]。到这里故事的常规走向应该是给这套优化器加更多机制——更好的语言梯度、更聪明的门控、更精细的动量。几乎所有人都这么预期。七周后有人证明这条路错了。错的不是验证而是自动验证的方式。三、主角登场SkillOpt-Lite 与苦涩教训7 月EvolvingLMMs-LabBo Li 组放出 SkillOpt-LitearXiv 2607.03451。标题里的副标题近乎挑衅One Line of Vibe。它给出的核心结论可以概括为一句话复杂优化器机制本质是为模型自我批评不够准设计的人类先验补偿。当模型足够强这些补偿的边际收益递减甚至变成噪声而让 agent 自己演化整个 harness 的组件——提示、工具描述、控制流——这种通用机制对强弱模型都有效。数字非常不给老师留面子。LiveMath 上GPT-5.5 配置 8.8 分GPT-5.4-nano 配置25.4分Spreadsheet、DocVQA 等基准同样全面超出。训练曲线图里蓝线Lite从第一批开始就压在红线SkillOpt上方并且差距随批次数稳定存在不是噪声[4]。SkillOpt-Lite 论文的训练曲线蓝色为 Lite红色为原版 SkillOpt。四个子图LiveMath-nano、LiveMath-5.5、Spreadsheet、DocVQA中蓝线全程压制红线。名场面发生在廉价配置掀翻旗舰配置GPT-5.4-nano 跑 HarnessOpt0.7758反超了 GPT-5.5 跑完整版 SkillOpt0.7620。请注意这个结果的正确读法。它不是弱模型不需要帮助——恰恰相反nano 的绝对提升25.4远大于强模型8.8。它说明的是通用演化机制是模型无关的而手工优化器先验只对自我批评不准的模型有价值。这正是机器学习史上反复上演的苦涩教训手工特征让位于表示学习手工结构先验让位于可微架构搜索如今轮到手工优化器管线让位于把 agent 组件当普通代码文件演化。为什么复杂管线会失效论文与后续讨论给出了三个互相加强的假说语言梯度的边际价值归零。自我批评信号的本质是让模型给文本打方向。强模型对自己的失败已经有足够准的诊断包装成梯度只是徒增 token 成本和格式约束。内部自动门控的信号在分布外是噪声。门控要判断这次编辑会不会泛化但它依据的仍是模型的自我评估——用同一个可能有偏的裁判去校正同一个裁判的判决。动量在长周期上放大早期错误。训练初期的一次幸运编辑会污染此后所有更新方向而文本空间没有等价于学习率 warmup 重置的可靠机制。Lite 把优化器做薄的同时把演化对象做宽了——这就是 HarnessOpt不只演化核心技能文件连工具描述、提示模板、控制流片段一起进入演化池。结果全组件演化优于仅演化核心循环说明在 Agent Model Harness Artifact 的坐标系里harness 层的能力密度被严重低估了[5]。这个发现已经走出论文Lite 的路线被接入了 VSCode Copilot。诚实的文章要交代局限Lite 仍依赖一个足够强的 critic 模型多轮长程任务没有经过充分验证整个演化过程没有理论保证为什么全组件演化更好目前只有经验证据。但方向已经变了。接下来值得看的不再是谁的优化器机制更精巧而是同样的思想在四种不同世界观下的展开。四、擂台同一问题下的四种答法先把丑话说在前面以下四位考生的成绩单来自不同论文、不同模型、不同评测设置用于路线定位不构成统一考场的排名。SkillOpt序章SkillOpt-Lite主角WikiSkillSkillAdam一句话定位优化器范式奠基精简管线 组件泛化持久化 wiki 知识层优化记忆 编辑预算战绩口径相对无技能基线 52/52 全胜相对 SkillOpt 平均分反超8.8 / 25.45 个模型上超既有方法 3.3~12 分5 个短任务基准 4 胜 1 平长任务 DP-Avg 6.7核心机制语言梯度 编辑率 held-out 门控 动量把 harness 组件当代码文件演化失败教训写入 wiki追加式、检索式跨周期优化记忆 波动驱动编辑预算知识存放单文件回滚式harness 目录回滚式wiki不回滚、只沉淀记忆 技能长期保持跨模型迁移弱中强主打卖点未主打token 成本基准更省中约 1/5工程化1.67 万 star集成最全已入 VSCode Copilot暂无可跑代码学术向4.1 WikiSkill把失败存下来而不是抹掉8 月 27 日Google Research 与 Virginia Tech 放出 WikiSkillarXiv 2608.27454。它和 Lite 的分歧是世界观级的Lite 依然回滚——坏编辑被拒绝、丢弃WikiSkill 则把每一次失败教训追加进一个持久 wiki技能本身变成知识检索 按需组装而不是一份越改越大的单文件。在 5 个模型上它的平均成绩超过 SkillOpt、EvoSkill、Trace2Skill 等所有既有方法 3.3~12 分[6]。WikiSkill 论文首页arXiv 2608.27454与其 Figure 1在 Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemini 3.5 Flash 上WikiSkill 曲线稳定高于 SkillOpt 与 EvoSkill。它最漂亮的数字是跨模型迁移小模型 Qwen-3.5-9B 配上从别处演化来的技能拿到 47.4%反超大模型 Qwen-3.6-27B 裸跑的 39.4%。技能第一次展现出可携带算力的属性——这也是为什么它值得单独关注。4.2 SkillAdam把账算到 token 上9 月 8 日的 SkillAdam 把问题换了个问法演化过程自己能不能更稳、更便宜它的两个组件直指痛点——优化记忆跨周期记住哪些编辑有效而不是每轮从零反思和波动驱动的编辑预算成绩波动大时多改平稳时少动。结果是 5 个短任务基准上 4 胜 1 平、长任务 DP-Avg 6.7 分而最扎眼的是成本达到同等技能质量只需要约五分之一的 token4M 对 20M[7]。SkillAdamarXiv 2609.08944的演化路径示意图初始技能经多轮改多少、改哪里的决策收敛到最优技能编辑由预设规则与波动信号共同驱动。当技能演化要从论文走向 7×24 小时的线上系统token 账就是生死账。SkillAdam 未必是终局但它指出的方向——把演化器自身的记忆与预算当作一等公民——大概率是对的。4.3 小结不是替代是四个侧面这四者拼起来才构成行为资产优化的完整版图SkillOpt 回答怎么训Lite 回答哪里值得训WikiSkill 回答知识放哪SkillAdam 回答怎么训得起。把它们放在同一张表里争论谁第一没有意义——它们的对手从来都不是彼此而是第一部分那张图里灰色的无技能基线。五、边界与邻居同源、竞争与可融合的路线把主角放进更大的坐标系——更新什么权重 / 上下文 / 外部工件×存多久单任务 / 跨任务 / 持久——技能进化只占其中一个格子。它的邻居们值得逐一划界因为读者迟早会问为什么不直接微调为什么不走 RLharness 演化又是什么5.1 对 微调/LoRA冻结权重换来四种自由技能路线对微调的核心卖点冻结权重、可 diff、可审计、跨模型复用。多数文本路线还支持回滚——WikiSkill 是例外它追加式、不回滚但失败教训同样可审计。这些属性在合规、多模型部署、快速迭代的场景里是微调给不了的。SkillsBench 里还有一张图值得全文引用带技能的 Haiku 4.527.7%v1.0 论文口径v1.1 榜单上该数字已更新为 30.1%反超不带技能的 Opus 4.522.0%——技能可以替代模型规模。对成本敏感的应用小模型 好技能是比换大模型便宜得多的升级路径。SkillsBench 的 Skills Substitute for Model Scale蓝线为带技能成绩灰线为无技能成绩。Haikuskills 反超裸跑 Opus 4.5。技能承载的是真实能力而非提示词噪音——有一个很聪明的判别实验Skill-GRPO 把记忆库清空成绩从 80.5 断崖跌到 60.2证明学进去的东西确实存在于工件里不是模型的错觉[5]。但边界正在移动。2026 年出现的 SIA 这类元 Agent已经让模型每轮自主决策这一轮该改 harness还是该打 LoRA 补丁——两个动作空间被放进同一个循环里[5]。更妙的反衬来自 PostTrainBench让 agent 自主做后训练自动改权重目前并不可靠——最强的 agent 也只能达到官方微调模型的 23.2% 水平。注意这个例子的正确用法不可靠的是自主改权重不是改权重本身恰恰是官方权重的强大反衬出改外部工件这条路在现实世界里的务实[8]。5.2 对 RL 技能共进化同一缺口的两条补给线与文本空间平行的是把技能库当作 RL 动态组件的一条线SkillRL 让 agent 演化自己的技能目录在 EvoAgentBench 上比静态技能库高 31%[9]SkillGraph 把技能图拓扑和下游策略联合训练让技能关系随任务持续适应[10]Skill-R1 则干脆把技能优化解耦成 recurrent RL 问题——它的卖点恰恰是对闭源任务模型友好与文本空间路线殊途同归。两条线的分野清晰RL 线信号更密、能直接进权重但依赖可验证环境和大量交互样本文本空间线样本效率高、对闭源模型友好、天然可审计。但它们的共同宿命在 SkillsBench 的灰色柱子上都在补同一个缺口。也因此可以预测两条线终将在可验证性这个瓶颈上汇合——谁能拿到更便宜、更防作弊的验证信号谁就能定义下一代方法。5.3 对 Harness 演化不是邻居是已经跨入的领地最后这个邻居最特殊因为 Lite 的 HarnessOpt 已经实质跨过了线——harness 演化不是赛道外的对照组而是主角已经踏入的领地。真正需要划清的是问题层优化对象是行为资产skill 文件、工具描述还是优化器本身演化管线的代码跨线之前值得先看看 harness 自进化的前车之鉴benchmark memorization把测试集特征背下来、随机噪声锁死胜者单次幸运跑分决定演化方向、复杂度膨胀 evolved harness 的 token 消耗翻倍——这些病理正是 Lite 精简管线的隐性论据[11]。这里需要做一个关键区分Lite 精简的是 meta 层的优化器管线并没有禁止 object 层的 harness 组件变多。在经验上它靠小步编辑、预算约束和外部验证这三道闸把 object 层的膨胀压在了可接受的范围内。microsoft/skills 仓库的架构示意领域技能、MCP 服务器、上下文注入正被组织成可分发的基础设施——技能分发层已经从设想变成仓库。于是可以给出一个本文自己的判断技能与harness的边界本质上是产品决策而非技术本质——技能就是可分发、可版本化、可签名的 harness 切片。这个判断有现实的注脚Microsoft 已经把 skills、MCP 服务器、Agents.md 组织进官方仓库技能分发的基础设施正在成形。当分发层成熟技能作者可能会像今天的 HuggingFace 模型作者一样成为一个职业。六、升格这不是 RSI但这是离 RSI 最近的产品化形态6.1 先校准概念2026 年文献的共识是克制的有界自精炼bounded self-refinement已经例行化而开放式的 RSIrecursive self-improvement递归自我改进在公开文献中尚未被证明[12]。技能进化属于前者——它有明确的人类设定边界任务分布、预算、验证集。6.2 边界在哪验证权归谁那么边界画在哪2026 年最有锋芒的一句话来自 Hugging Face 的 Philipp Schmidagent 可以拥有自己的 prompt、skill、tool 和 harness code但评测必须留在人类手里——如果 agent 能修改评测器分数就不再是证据[13]。回头看这正是第二部分伏笔的回收。SkillOpt 系真正的遗产不是那套语言梯度加动量的管线Lite 已经把它拆了而是把泛化验证变成优化器的一等公民——held-out 验证门控就是评测权留在人类手里这个原则最早的工程实现。Lite 去掉的是内部自动门控保留的是验证权外置。整条演化谱系从 SkillOpt 到 SkillAdam变的是优化技巧不变的是这条宪法。所以技能进化不是 RSI但它是目前距离 RSI 最近的产品化形态它已经把模型改自己的闭环跑通只是谨慎地把裁判席留给了人类。这个闭环往后每扩张一步——验证信号自动化、技能跨组织流转、演化目标从单任务走向开放世界——都会重新触碰这个问题。6.3 三个前瞻基于以上脉络给出三个可检验的预测收敛预测文本空间优化与 RL 权重空间将在一到两年内融合为分层自进化——权重内能力、权重外知识、外部验证门控各司其职而 SIA 式的元 Agent 负责调度。单一赛道的方法会显得过时分层的不会。基础设施预测技能仓库将成为新的分发层类比 HuggingFace 之于权重。随之而来的必然是签名、版本治理、供应链审计——microsoft/skills 仓库已经是这个方向的早期形态。安全预测技能注入与投毒会成为下一个安全热点。当技能可以跨模型、跨组织流转一条被污染的技能就是一次跨系统的供应链攻击届时验证权外置就不只是对齐原则而是安全刚需。七、实践指南现在该选谁你的处境建议要成熟生态、快速上手SkillOptpip install skillopt集成最全生产案例最多用 VSCode Copilot要泛化能力SkillOpt-Lite / HarnessOpt全组件演化已进产品多模型共用技能资产关注WikiSkill路线跨模型迁移是目前最强卖点长任务、成本敏感关注SkillAdam约 1/5 token 成本 长程稳定有可靠的 verifier 环境考虑SkillRL / Skill-R1的 RL 线信号密度更高需要合规审计文本空间路线整体优于微调可 diff、可回滚、可签名结语回到开头那张图灰色的柱子是没有技能的大模型蓝色的是有技能的。2026 年的技能进化浪潮本质上是在给那根灰色柱子装上外部记忆与肌肉——不碰权重却让同一个模型变成另一个物种。而整场浪潮里最有分量的遗产可能既不是 52/52也不是 25.4而是一个朴素的原则模型可以改自己的一切除了裁判席。谁先想明白验证权该怎么安放谁就能定义下一阶段的自进化基础设施。参考截至 2026-09-27SkillOpt (arXiv 2605.23904)、SkillOpt-Lite (arXiv 2607.03451)、WikiSkill (arXiv 2608.27454)、SkillAdam (arXiv 2609.08944)、SkillsBench (skillsbench.ai)、microsoft/skills、EvoSkill、Trace2Skill、SkillRL、SkillGraph、Skill-R1、SIA、PostTrainBench。引用来源[1]: SkillOpt 论文arXiv:2605.2390452/52 评测单元结果https://arxiv.org/abs/2605.23904[2]: microsoft/SkillOpt GitHubv0.2.0 ReleaseSkillOpt-Sleep 与多环境集成https://github.com/microsoft/SkillOpt[3]: DAIR.AI 创始人 Xavier Amatriainomarsar0分享的 SkillOpt 生产实践多模态图表抽取技能 0.73→0.93[4]: SkillOpt-Lite 论文arXiv:2607.03451https://arxiv.org/abs/2607.03451 代码https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite[5]: 2026 年自进化方法分类综述Agent Model Harness Artifact 框架Skill-GRPO 记忆清空消融SIA 元 Agent 工作[6]: WikiSkill 论文arXiv:2608.27454Google Research Virginia Techhttps://arxiv.org/abs/2608.27454[7]: SkillAdam 论文arXiv:2609.08944https://arxiv.org/abs/2609.08944[8]: PostTrainBenchagent 自主后训练 vs 官方微调模型的系统性对比最佳 agent 23.2% vs 官方模型 51.1%[9]: SkillRL基于 EvoAgentBench 的技能目录共进化研究较静态技能库 31%[10]: SkillGraph技能图拓扑与下游策略联合 RL 训练的工作[11]: Agentic Harness Engineering 相关综述中列出的 harness 自进化病理清单benchmark memorization、噪声锁死、复杂度膨胀等[12]: RSI 综述《From Bounded Self-Refinement to Autonomous Research Loops》有界自精炼已例行化开放式 RSI 公开文献未证明[13]: Philipp SchmidHugging Face关于 self-evolving agents 边界条件的博客agent 可拥有 prompt/skill/tool/harness评测必须留在人类手里创作不易禁止抄袭转载请附上原文标题及其链接
阅读完成 · 觉得有帮助?
咨询建站