做 Agent 应用的人最近应该都有同一个感受模型不贵上下文贵。一个 Agent 跑复杂任务每调一次工具可能就带回来一整页网页、一份文件、一长串执行日志。这些新内容要重新做预填充历史记录还越攒越长。跑一个像样的深度研究任务上下文轻松冲到几十万 Token。钱不是花在模型思考上是花在模型反复读材料上。9 月 24 日小米 MiMo 负责人罗福莉公布了 MiMo-V3 的核心架构 HySparse2就是冲着这个痛点来的。官方数据很直接在 100 万 Token 长度下预填充计算量降低 5.02 倍KV 缓存缩小 4.5 倍。换成具体数字80B-A3B 的 MoE 模型跑百万上下文KV Cache 从大约 12GB 压到 2.7GB。为什么 Agent 的负载和普通聊天完全是两回事普通对话场景里上下文是线性增长的你一句我一句长度可控。Agent 不一样。它每往前走一步都要处理一大段新输入同时还要从不断变长的历史里捞出下一步真正需要的信息。这就把三个问题同时顶到了关键路径上预填充成本、KV 缓存容量、长上下文检索准确率。只优化其中一个没用三个得一起解。罗福莉的判断是智能体推理是一种截然不同的工作负载值得为它单独设计架构而不是在聊天架构上打补丁。这个判断我是认同的。今年各家都在卷 Agent但底层架构大多还是为对话优化的那套。小米这次算是把话挑明了。HySparse2 做了什么架构上把模型切成前后两半。前半部分叫 Self-Decoder用全注意力加滑动窗口注意力的混合结构后半部分叫 Cross-Decoder用全注意力加稀疏注意力的混合结构。在这个骨架上做了三件事。第一件KV 桥接。借鉴 YOCO 的思路Cross-Decoder 里的全注意力层不自己算 KV直接用 Self-Decoder 的隐藏状态构建。所有 Cross-Decoder 的 KV 缓存都来自 Self-Decoder意味着预填充在 Self-Decoder 跑完时就能收工后面不用再算。第二件KV 重用。每个混合块内部所有稀疏层直接复用前一层全注意力层的 KV 缓存和 Token 选择索引。一份缓存大家用不重复开房间。第三件两个精度升级。用 Token 级选择替代块级选择长文本里捞关键信息更灵活用近期 Token 的强制窗口替代独立的滑动窗口分支让局部和全局 Token 共享同一份 KV 缓存缓存管理逻辑更简单。效果方面除了成本数字长上下文评测 MRCRv2 和 RULER-v2 得分更高衡量 Agent 推理流畅度的 AgentPPL 和长文本稳定性的 LongPPL 也更低。也就是说省钱的同时没有牺牲准头这一点比单纯的压缩技巧重要。对做应用的人意味着什么我的看法是这类架构创新比榜单刷分实在得多。Agent 应用能不能跑通商业模式核心就是成本结构。一个任务烧掉几毛钱的上下文费和烧掉几分钱决定了这个产品是玩具还是生意。HySparse2 这类把预填充和缓存成本压一个数量级的方案等于把 Agent 应用的毛利空间直接撑开了。另外一个信号值得注意国内大模型的竞争重心正在从堆参数、刷榜单转向抠效率、抠场景适配。小米从 V2 的混合滑动窗口架构到 V2.6 用强化学习拉能力再到 V3 直接为 Agent 负载重做架构路线很清楚就是奔着让 Agent 跑得起去的。罗福莉从 DeepSeek 带着光环加入小米之后这是交出的第一份架构级答卷成色不错。当然架构公布和模型落地是两回事。MiMo-V3 什么时候发、开不开源、实际推理价格能不能同步降下来才是开发者最后真正关心的。在那之前先记住这个方向为 Agent 负载专门设计的稀疏架构大概率是接下来一年各家基础模型团队的标配动作。参考资料罗福莉官宣 MiMo-V3 架构凤凰网科技https://tech.ifeng.com/c/8wfBW2vRWW1IT 之家附 HySparse2 官方详解https://baijiahao.baidu.com/s?id1877201109580693963Agent 开始啃长任务小米把大模型架构改了智源社区https://baijiahao.baidu.com/s?id1877231510076848722我平时追踪这类 AI 模型和工具动态会用 ai345https://www.ai345.info/?refcsdnAI 工具导航加中文 AI 资讯日报找工具和追新动态都不用翻墙
阅读完成 · 觉得有帮助?