首页 / 资讯中心 / 文章详情

GPT-5.5以93.16分居首:2026-09-28 Smoke快测数据简报

GPT-5.5以93.16分居首:2026-09-28 Smoke快测数据简报 ★ FEATURED ARTICLE
2026-09-28 赢政指数 Smoke 快测覆盖 11 个模型GPT-5.5 以 93.16 分位居当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为 0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1GPT-5.593.169590.9pass#2Claude Sonnet 4.691.8110081.8pass#3Grok 491.8110081.8pass#4Qwen3 Max91.7892.590.9warn#5Claude Opus 4.782.167590.9pass#6GPT-o380.7872.590.9pass#7DeepSeek V4 Pro70.917565.9warn#8Gemini 3.1 Pro68.6378.356.8pass#9豆包 Pro68.167065.9warn#10Gemini 2.5 Pro64.067056.8pass#11GLM-4.651.912090.9pass数据解读今日主榜前三中GPT-5.5以代码执行95、材料约束90.9组合获得93.16Claude Sonnet 4.6与Grok 4则均以代码执行100、材料约束81.8的搭配并列91.81显示头部模型在两项能力上的强弱互补各有侧重。Qwen3 Max代码执行92.5、材料约束90.9主榜91.78紧随其后而Claude Opus 4.7与GPT-o3均呈现代码执行偏低、材料约束90.9的结构主榜分值分别落在82.16与80.78区间。异常信号方面Claude Opus 4.7主榜暴跌-13.9分、GPT-o3主榜暴跌-15.2分、豆包 Pro主榜暴跌-14.8分且诚信由pass转为warnGLM-4.6代码执行暴跌-47分这些单日变化可能源于题目抽样波动也可能反映真实退化需后续同口径run复核确认。Smoke快测样本量有限上述数字仅为当日观察不宜外推模型整体表现。主要变化GPT-o3主榜下降15.2分代码执行-24.5分豆包 Pro主榜下降14.8分代码执行-22分材料约束-6.1分诚信pass→warnGPT-5.5主榜上升14.4分代码执行23分Claude Opus 4.7主榜下降13.9分代码执行-22分Grok 4主榜下降5.8分材料约束-13分需要关注的信号Claude Opus 4.7主榜暴跌 -13.9 分GPT-o3主榜暴跌 -15.2 分豆包 Pro主榜暴跌 -14.8 分GLM-4.6代码执行暴跌 -47 分读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。数据来源赢政指数 (YZ Index) | Run #341本文首发于赢政天下获取更多深度技术内容与资源欢迎访问官网。
阅读完成 · 觉得有帮助?
咨询建站