首页 / 资讯中心 / 文章详情

voxtral.c 跨平台编译指南:MPS Metal GPU 与 BLAS CPU 后端该怎么选

voxtral.c 跨平台编译指南:MPS Metal GPU 与 BLAS CPU 后端该怎么选 ★ FEATURED ARTICLE
【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载voxtral.c 是一个用纯 C 语言实现的 Mistral Voxtral Realtime 4B 语音转文本模型推理引擎支持流式转写麦克风语音或音频文件。编译时它提供两种后端**MPSApple Silicon 的 Metal GPU 加速**和BLASCPU 加速macOS 用 Accelerate、Linux 用 OpenBLAS。本文用最短路径帮你完成跨平台编译并讲清楚两个后端的性能差距和选型逻辑。一张表看懂两个后端怎么选对比项make mpsmake blas平台要求仅 macOS Apple Siliconarm64macOSIntel/Apple 均可、Linux依赖无Metal 框架系统自带macOS 系统自带 AccelerateLinux 需安装 OpenBLAS速度最快约 23.5 ms/token慢 10 倍以上约 335 ms/token适用场景Mac 本地实时转写、流式 APIIntel Mac、Linux 服务器、交叉验证结果结论先行在 Apple Silicon 的 Mac 上用make mps其它环境一律make blas。第一步确认你的机器支持哪个后端直接运行make不带参数它不会盲目编译而是先打印当前平台可用的后端列表make # 等价于 make help展示可用后端 make info # 查看平台、编译器与可用后端配置这些目标的定义见 Makefile平台检测通过uname -s/uname-m判断非 arm64 的 macOS 或 Linux 上不会显示 mps 选项避免你误入歧途。最快编译Apple Silicon 上执行 make mpsmake mps这一步会完成以-DUSE_METAL宏编译全部 C 源码voxtral_encoder.c、voxtral_decoder.c 等CPU 与 GPU 双路径共存热路径走 GPU把 Metal 计算着色器 voxtral_shaders.metal 用xxd -i嵌入为 C 数组——运行时编译着色器无需 Xcode Metal 工具链只需命令行编译器编译 Objective-C 文件 voxtral_metal.m 并链接 Metal、MetalPerformanceShaders 等框架。⚠️ 注意在 Linux 或 Intel Mac 上执行make mps会直接报错退出Error: MPS backend requires macOS / Apple Silicon (arm64)这是 Makefile 有意做的防御不是环境损坏。CPU 编译Intel Mac 与 Linux 上执行 make blasmacOS无需任何额外安装系统自带 Accelerate 框架make blasLinux需要先安装 OpenBLAS 开发包编译时会定义-DUSE_OPENBLAS并链接-lopenblas# Ubuntu / Debian sudo apt install libopenblas-dev # Fedora sudo dnf install openblas-devel make blasBLAS 后端的核心是 voxtral_kernels.c 里的多线程矩阵乘法BF16 权重在计算时现场转换为 F32——这也是它比 MPS 慢的主要原因。为什么要选对后端性能差距实测官方在 Apple M3 Max40 核 GPU上的基准数据后端编码器3.6s 音频Prefill解码器MPS284 ms252 ms23.5 ms/stepBLAS~8 s~1.2 s335 ms/stepMPS 后端每个 token 用单个 Metal 命令缓冲跑完整个解码器注意力、RoPE、KV 缓存管理都是自定义 GPU kernel权重在加载时一次性预转为 GPU 上的 f16BLAS 则靠 CPU 多线程 sgemm且持续做 BF16→F32 转换。更详细的迭代优化记录见 SPEED.md——如果你的目标是听多少转多少的实时转写MPS 几乎是唯一选择。编译常见问题排查现象原因解决make mps报 requires macOS平台不支持 Metal 后端改用make blasLinux 链接报cannot find -lopenblas未装 OpenBLAS 开发包见上一节安装命令切换后端后行为异常残留旧目标文件make clean后重新编译两个后端目标本身也会先 clean想确认当前配置—make info查看平台与可用后端验证编译成功跑一条真实音频./download_model.sh # 下载 ~8.9GB 模型权重到 ./voxtral-model/ ./voxtral -d voxtral-model -i samples/test_speech.wav看到 Hello, this is a test of the voxtral speech to text system. 逐词流出说明编译成功。如果输出开头显示Metal GPU: xxxx MB如演示图中的 8428 MB说明 MPS 后端已生效。仓库还自带回归测试make test # 较慢需要较快的 GPU模型文件下载脚本为 download_model.sh获取的权重会被内存映射mmap加载因此启动几乎是瞬间完成的——这也是纯 C 实现零 Python 运行时、零 CUDA 工具链的底气。小结Apple Silicon Mac →make mps速度快 10 倍以上实时转写首选Intel Mac / Linux →make blasLinux 先装 OpenBLAS功能完整但偏慢拿不准就跑make info看可用后端编完用samples/test_speech.wav做冒烟验证。完整命令行用法--from-mic、--stdin、-I处理间隔等请查阅 README.md。赞分享【免费下载链接】voxtral.cPure C inference of Mistral Voxtral Realtime 4B speech to text model项目地址https://gitcode.com/gh_mirrors/vo/voxtral.c点击查看免费下载相关推荐Umi-OCR离线 OCR 文字识别3 步跑通从截图到双层可搜索 PDFUmi OCR离线 OCR 文字识别3 步跑通从截图到双层可搜索 PDF 扫描 PDF 里的文字看得见却选不中几百页文献想找一句话只能一页页翻Umi OOCR桌面应用Paddle-Lite Metal 后端实战iOS/macOS 平台 ARM GPU 推理库编译与部署Paddle Lite Metal 后端实战iOS/macOS 平台 ARM GPU 推理库编译与部署 本文聚焦 Paddle Lite 的 Metal 后端人工智能推理引擎深度学习边缘计算嵌入式模型优化从一堆教案到可查询的知识图谱教育数据的 GraphRAG 快速上手从一堆教案到可查询的知识图谱教育数据的 GraphRAG 快速上手 课程大纲在教务系统作业在批阅平台试卷扫描件躺在共享盘。你的搜索引擎跨不过这三个地方。G人工智能RAG知识图谱数据工程大模型创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站