首页 / 资讯中心 / 文章详情

从 Jev 到 Kev 再到 SemIf:小决策模型生态一夜升温

从 Jev 到 Kev 再到 SemIf:小决策模型生态一夜升温 ★ FEATURED ARTICLE
从 Jev 到 Kev 再到 SemIf小决策模型生态一夜升温【免费下载链接】kevJev-like family of decision models built on top of Qwen3.5/3.8 you can train and run on your own项目地址: https://gitcode.com/gh_mirrors/kev2/kev2026 年 9 月下旬到 10 月初小决策模型这个赛道在一周内完成了一次密集的生态扩围闭源的 TypeSafe Jev 迎来了开源重建版 Kev其四个档位模型以 Kev 1.0 的名义整体版本化同底座的重训竞争者 AutoJev 进入横向对比视野第三方人工标注基准 SemIf 被 Kev 正式收录进评估套件中文社区则在几天内涌现出从入门到实战、从选型到 LoRA 微调的连载教程。这不是单一项目的一次发布而是一个品类从单点服务走向开源生态的临界时刻。本文结合社区情报与 Kev 仓库源码拆解四者关系、升温动因与心智卡位。一张生态图谱血缘、定位与差异社区教程把 Jev、Kev、Laya 并称为三类决策模型而实际上围绕 Kev 展开的生态图谱比这更完整——它由四类角色构成。JevTypeSafe闭源托管的决策模型对外暴露 System One API。它定义了决策模型的基本形态——输入一段文本state和若干类型化问题返回的不是文本而是每个选项的校准概率。按社区教程的说法Jev 高性能但权重不可得、不可自训且在中国大陆访问受限。在仓库的对照数据里它始终是被追赶的基线out-of-domain 开发集准确率 0.857、Brier 0.211见 docs/kev-family-summary.jsonbreadth-v1 社区决策指数 54.0。Kev本仓库Jev 的开源重建版。它基于 Qwen3.5 / Qwen3.8 底座用LoRA 适配器 指针头复刻了 Jev 的架构思路API 与 TypeSafe SDK 完全兼容。关键差异在于权重开放Apache-2.0、四档可扩展0.8B 笔记本可跑、27B 单卡数据中心级、并且可以自训——这正是 Jev 给不了的能力。Kev-27B 在从未见过的数据源上准确率 0.851对 Jev 的 0.857 仅差 1 个点breadth-v1 指数 52.3 对 54.0。Kev 的每个检查点都内置拟合温度概率默认校准可直接设阈值做自动化决策。AutoJev-27Bdenis-pplx/autojev-27b另一个基于同一 Qwen3.8-27B 底座的全权重微调模型在 Kev-27B 的模型卡里与 Jev、Kev 同场竞技——breadth-v1 指数 50.0低于 Kev-27B v2 的 52.3。它的出现说明决策模型的技术路线已经公开到可以多人独立复现的程度Kev 也因此必须在一个拥挤的横截面上证明自己。SemIfTheoLeeCJ一个由 144 条人工编写的决策记录构成的中立基准被 Kev 收录为外部评测集evals/external/semif-v1/manifest.json另有 108 条扰动记录。在这个基准上Jev 达到 0.965Kev-9B 为 0.917。但 Kev 对它的定位非常冷静SemIf 已接近饱和Kev-27B 每个版本都能答对 144 条中的 130 条它是个 sanity check而不是用来给模型排名的工具。中立裁判入局意味着这个生态开始有第三方标尺了。四者构成一条完整的食物链Jev 是原版与基线Kev 是开源重建与闭环AutoJev 是同底座的重训竞争者SemIf 是试图保持中立的度量衡。它们共享同一个 API 语汇——noul是非判断、choice多选一、score有序打分三原语这正是 TypeSafe System One 定义的事实标准也是 Kev 得以drop-in 替换的接口基础。一夜升温九月底到十月初发生了什么把时间线拉直这轮升温的节奏非常紧凑2026-09-24Kev 当前家族首次组装完成Kev-27B v1、Kev-9B v1 及 4B/0.8B。2026-09-28中文社区开始出现类 Jev 项目 Kev 从入门到实战系列连载第一篇即点明核心卖点不开权重也能自训的决策模型。2026-09-30Kev-27B v2全权重微调 0.85/0.15 权重平均与 Kev-9B v2 发布同一天Kev 基于标签审计剔除了三套不可靠的外部评测scienthoon 模板化数据、WANLI 标注分歧、TypeSafe 公开评测样本量不足并把训练数据分区公开。2026-10-01Kev 1.0 正式版本化——四个 Hub 仓库统一打v1.0标签发布带 SHA-256 校验和的权重资产docs/claims.json让 README 与模型卡里的每个数字都能回溯到提交记录并被 CI 校验docs/releases/kev-1.0.md。2026-10-03 ~ 10-06社区教程密集涌现——KevLoRA 微调适配器的轻量级 HTTP 服务框架、Jev / Laya / Kev 对比、决策模型选型从 Jev、Kev、Laya 分层到 LoRA 微调实践海外侧则出现TypeSafe 的 Jev 已有开源克隆版免费即可在 RTX 3090 上运行的报道。这轮爆发的标志性信号是话题的转移9 月底之前社区讨论的是怎么调 Jev 的 API10 月初讨论变成了该选 Jev、Laya 还是 Kev微调前要先验证什么哪种信号才值得触发微调。生态的话语权正在从谁的服务更好用迁移到谁能被注入业务规则、语言和类别体系。为什么 2026 年决策模型密集出现决策模型的密集出现是三个技术前提与一个市场契机的合流。第一生成式模型的缺陷被业务方确认。工单分诊、内容审核、策略判定这类任务要的是确定性的概率分布而不是可能幻觉、可能随机漂移的自然语言回答。Kev 的设计对此非常彻底模型只做 prefill-only 推理用指针头对每个选项的/opt隐藏状态与decidetoken 打分softmax 后直接输出概率——完全不生成文本见 kev/model.py 与 kev/api.py。推理路径上每个问题以独立行row形式从共享 state 继续状态缓存复用问题之间互相隔离选项顺序扰动、伪造分隔符注入都在接口层被处理。这是把决策从对话里彻底剥离出来的工程范式。第二混合架构底座把成本打了下来。Qwen3.5 / Qwen3.8 引入 Gated DeltaNet 线性注意力层配合开源权重让小模型做长文本决策成为可能。Kev-4B 处理六问短文本H100 上模型时间仅 18.1ms同一份 2,200 token 文本反复问问题时服务端靠状态前缀缓存把成本压到只付问题本身README.md 的 Serving Performance 表。训练端更便宜rank-16 LoRA 适配器 指针头Kev-0.8B 用 4GB 显卡即可训练Kev-4B 在 H100 上训练一次约1 美元。第三从训到用的闭环被产品化成了一条流水线。这可能是 2026 年决策生态最本质的变化。Kev 把访谈式收集问题 → 扫描现有代码里的 Jev 调用点 → 生成或转换标注数据 → 微调 → 校准 → 评估 → 部署 HTTPS 端点 → 用完即拆封装进两个 skillskills/kev-finetune/README.md 与 skills/kev-deploy/。真实效果是可度量的在示例客服负载上微调把 Kev-4B 的准确率从 67.7% 提到 73.6%把 5% 错误预算下可自动化的决策占比从 34% 提到 48%。一个模型品类要起势靠的不是一篇论文而是业务的人今天下午就能自己训一个并部署上线。第四竞争本身在加速演化。Jev 闭源 → 催生 Kev 开源重建 → 同底座出现 AutoJev → 第三方基准 SemIf 被收录。每出现一个闭源缺口开源生态就补上一块每补上一块就又有一批新玩家入场。Kev 甚至在训练声明里反复强调没有使用任何 Jev 的输出进行训练模型卡与 README 均有此句把竞争边界划得很干净。生态早期红利谁能先占住「决策模型」心智早期红利的争夺本质是三件事的卡位接口标准、可训性与诚实边界。接口标准是最先被占住的。Kev 用 TypeSafe System One 的同一套请求/响应结构连置信度公式都逐条对照参考适配器实现见 kev/api.py 中system-one-adapter 0.2.1的注释使得换服务商不换代码成为可能。TypeSafe 客户端直接指向本地 Kev 服务器即可工作——这在开源生态里是教科书级的兼容性打法你不必说服用户换 SDK只需说服他换后端。可训性是 Kev 对 Jev 的绝对差异化。社区教程的总结非常犀利选型关键不在于零样本性能而在于能否将业务规则、语言和类别体系注入模型。Kev 为此提供了--init_from机制从已发布检查点继续训练LoRA 适配器与指针头保留已学知识只在其上叠加领域数据基准模型从头训在作者的一次实测里只有 0.33 分而--init_from路线在同一数据上保持 0.83 并在新领域达到 0.88README 的 Fine-Tune 章节。同时微调还会在留出数据上重拟合温度——置信度这一产品特性本身就变成了可微调的。诚实边界则是防止红利反噬的关键。Kev 在自己的 README.md Limitations 里把短板列得毫不含糊域外迁移仍落后 Jevbreadth-v1 指数 52.3 对 54.0小尺寸差距更大知识水平由底座决定MMLU-Pro 上 Kev-27B 0.675 对 Jev 0.840日期算术是全家最弱项单一温度无法重排置信度5% 错误预算下自动化决策占比仍低于 JevKev-27B 的长合同场景比 v1 过自信。这份克制本身就是竞争资产——在决策模型心智尚未定型、大家都在喊能力的阶段愿意把已验证上下文长度和能力边界做成可追溯数字每个模型卡都给出从 8k 到 64k token 的分桶测量的项目更容易赢得工程用户的长期信任。回到开头的问题为什么说一夜升温因为这一周里接口标准、开源权重、微调闭环、第三方基准这四块拼图同时到位了。Jev 定义了问题Kev 用开源把问题做成了生态SemIf 让生态有了可复核的标尺而社区教程的密集程度则表明——工程师们已经准备好把决策模型当成一个正经的选型品类来对待。对后来者而言红利窗口期比拼的不是谁的口号更响而是谁能同时给出兼容的 API、可训的权重、可复现的数据管线以及一张不回避短板的能力清单。在 Kev 的 Playgroundplayground/src/components/playground.tsx里你可以用打包/分题两种模式实测问题隔离用 6 种选项顺序实测排列敏感性——甚至可以在象棋演示中把棋盘直接作为 state、把合法走法作为 Choice 选项、用 Score 问题给局面打分playground/src/app/chess/page.tsx。把一个品类的门槛降到浏览器里就能体验这或许才是小决策模型生态真正开始升温的注脚。【免费下载链接】kevJev-like family of decision models built on top of Qwen3.5/3.8 you can train and run on your own项目地址: https://gitcode.com/gh_mirrors/kev2/kev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站