本地模型跑得快不快用Locally Uncensored基准测试对比速度、成本与正确性【免费下载链接】locally-uncensoredThe all-in-one local AI studio for your desktop: chat, image and video generation and a coding agent in one free, open source app. Windows and Linux. No Docker, no terminal, no cloud required.项目地址: https://gitcode.com/gh_mirrors/lo/locally-uncensored你装好了一个本地大模型却说不清它到底快不快、贵不贵、答得准不准Locally Uncensored内置的基准测试Benchmark就是为这件事而生它在你的显卡上用同一组题目测多个本地模型对比速度每秒 token 数、成本花掉多少 token和正确性答案对不对最后输出一张按有效吞吐量排序的排行榜。无需 Docker、无需命令行点一下按钮就能跑。为什么只看每秒 token 数会骗人很多对比工具只测一件事每秒生成多少 tokentok/s。但真实世界里速度相同 ≠ 体验相同。作者给过一个真实案例两台机器各跑一个 9B 模型量化和设置都一样测出来一个 44 tok/s、一个 41 tok/s——纯看速度几乎打平。但真正拉开差距的是另外两点成本同样回答同一批问题蒸馏版花了5480个 token基础版花了8975个。便宜的那个更省。正确性有一道推理题基础版把正确答案算在了内心思考里却因为用光 token 预算根本没把答案写出来——用户看到的是一句没说完的话。所以 Locally Uncensored 的基准测试一次记录三类数据而不是一个孤零零的速度数字。它的三组题目和判定逻辑都写在这一处三组标准题与判分。三步跑完一次本地基准测试整个过程全程在图形界面里完成适合第一次玩本地模型的人。第 1 步装好并选一个文本模型打开应用后模型管理器会标出哪些模型装得进你的显卡一键下载即可。基准测试只对文本模型生效图像/视频模型不参与。第 2 步点顶栏的 Benchmark 页签顶部导航依次是 Chat、Create、Compare、Benchmark、Models、Settings。进入后每个文本模型右侧都有一个Run Benchmark按钮如果还有没测过的模型顶部会出现Benchmark N remaining一键排队全测。第 3 步读排行榜的三个维度点一次 Run Benchmark模型会按顺序做三道题结果记入顶部的Leaderboard排行榜。每个模型一行同时显示有效吞吐、平均 tok/s、平均 token 数、思考占比、正确率等。界面与排序逻辑见 BenchmarkView。三组标准题到底在测什么每次运行固定打同一套题这样不同模型之间才可比。三道题分别对应速度、推理、代码题目类型问什么怎么判对Speed Test速度把 1 到 50 每个数字单独一行列出来答案里要同时出现 1、25、50Reasoning推理农夫有 17 只羊除了 9 只都跑掉了剩几只最后一个数字必须是9经典陷阱是 17−98Code Generation代码用动态规划写一个 Python 的fibonacci函数必须出现def fibonacci(关键在于判定只看模型写出来的可见答案不看它心里想的推理过程。这正是速度榜永远发现不了的那类失误——想对了却没说出口照样判错。判定函数见 check 判分逻辑。排行榜怎么算分有效吞吐量才是硬指标排行榜不是按裸速度排的而是按有效吞吐量有效吞吐量 平均 tok/s × 正确率这样就不会出现答错的快模型压在答对但慢一点的模型上面的尴尬。举例10 tok/s × 100% 正确率 1020 tok/s × 50% 正确率 也是10两者并列。这个排序公式就一行有效吞吐量算法 rankingScore。速度本身也测得很讲究首 token 时间TTFT单独记录、不算进生成速率避免加载/连接时间拉低真实数字后端如 Ollama 会优先采用服务器上报的权威 token 数。整套测量引擎见 测量引擎 measureRun。成本与正确性两个被多数工具忽略的维度成本表格里有平均 token 数一列包含思考 token。同样的答案花得越少越省——这就是那个 5480 vs 8975 的差距。正确性正确率按答对次数 / 参与判分次数统计低于 100% 会用平静色提示等于 100% 才标绿。它把答得准不准从一句口号变成了可测量的数字。防跑偏的保险丝有些模型会上头陷入循环疯狂输出。基准测试内置了一个紧急制动单次运行超过8000 个 token或5 分钟就自动中止并直接判错——既不会让显卡空转也不会把失控的输出当成一次有效成绩。这两个阈值见 紧急制动保险丝。把结果导出来测完想留档或发给别人看点右上角Export整张排行榜会被导成一个 Markdown 文件lu-benchmark.md列包含排名、模型、分数、平均/最新 tok/s、token 数、思考占比、正确率、运行次数还被截断/被制动跑偏的运行都会标出来。导出实现见 导出 Markdown。适合谁如果你手里同时装了好几个本地模型纠结到底该用哪个这个基准测试能在一屏内用速度、成本、正确性三个维度给你答案——而且测的是你自己的显卡数字才真正属于你的机器。想更细地了解各功能模块可翻 官方手册 What it is 章节。【免费下载链接】locally-uncensoredThe all-in-one local AI studio for your desktop: chat, image and video generation and a coding agent in one free, open source app. Windows and Linux. No Docker, no terminal, no cloud required.项目地址: https://gitcode.com/gh_mirrors/lo/locally-uncensored创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?