人工智能大模型语音音频微调本地部署【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址https://gitcode.com/gh_mirrors/se/SenseVoice点击查看免费下载本文以仓库 README_zh.md 为主线系统讲解 SenseVoice 音频基础模型的多语言语音识别ASR、语种识别LID、情感识别SER与声学事件检测AED能力并逐项拆解环境安装、四种推理路径、FastAPI/Docker/llama.cpp 部署、微调数据准备与训练脚本。读完本文你可以独立完成从模型加载、长音频识别、服务化部署到基于业务数据的微调定制这一完整链路并理解其非自回归架构在底层是如何运行的。一、模型定位与核心能力SenseVoice是 FunAudioLLM 家族中的音频理解基础模型一个模型同时覆盖四项任务ASR自动语音识别将语音转写为文本LID语种识别识别音频所属语种SER语音情感识别输出高兴、悲伤、愤怒等情感标签AEC/AED声学事件分类/检测检测音乐、掌声、笑声、哭声、咳嗽、喷嚏等常见人机交互事件。1.1 研究范围与已发布 checkpoint 的边界阅读本项目文档时需要先明确一个关键边界README 开篇即以引用块强调更广泛的 SenseVoice 研究工作训练数据超过40 万小时覆盖50 多种语言当前已发布的 SenseVoiceSmall checkpoint支持中文、粤语、英文、日文和韩文Mandarin / Cantonese / English / Japanese / Korean的 ASR 与语种识别并输出情感与音频事件标签说话人分离Diarization并非 SenseVoiceSmall checkpoint 本身的输出而是 FunASR 组合独立 FSMN-VAD 与 CAM 模型的 pipeline 能力详见下文说话人标注组合路径。因此下文所有 benchmark 对比都只对应已发布 checkpoint 所涉及的任务与语种。1.2 核心功能亮点能力维度说明富文本识别情感识别效果在测试数据上可达到、超过目前最佳情感识别模型支持 BGM、掌声、笑声、哭声、咳嗽、喷嚏等常见事件的检测高效推理非自回归端到端框架低延迟具体速度对比见性能评测章节微调定制提供便捷微调脚本与策略可修复业务长尾样本问题服务部署完整部署链路支持多并发请求客户端语言覆盖 Python、C、HTML、Java、C# 等1.3 关键版本动态从仓库 README 的最新动态可以观察模型的演进脉络2026/07FunASR 1.3.29恢复 SenseVoice 的VAD 分段时间戳——当模型没有 token 时间戳且未配置标点模型时sentence_timestampTrue会通过sentence_info返回每个 VAD 语音区域让字幕与智能剪辑客户端获得可用分段边界。安装命令pip install -U funasr1.3.29。2026/07FunASR 1.3.27为 SenseVoice 增加检测语种元数据——OpenAI 兼容接口在verbose_json.language中返回检测到的zh、en、yue、ja或ko。安装命令pip install -U funasr1.3.27。2026/06SenseVoice 支持llama.cpp / GGUF可在 CPU/边缘端以单个自包含二进制运行类似 whisper.cpp内置 VAD运行时无需 Pythonq8 模型约 254 MB精度保持一致。代码位于 runtime/llama.cpp/GGUF 模型由官方仓库发布。2026/05FunASR 可将 SenseVoiceSmall 与独立 FSMN-VAD、CAM、标点模型组合生成逐句说话人标签需从源码安装 FunASR。2024/07新增导出 ONNX 与 libtorch 功能以及 Python 版 runtimefunasr-onnx、funasr-torch。2024/07SenseVoice-Small 多语言音频理解模型开源支持中、粤、英、日、韩语的多语言语音识别、情感识别和事件检测推理延迟极低。同期生态动态CosyVoice自然语音生成、FunASR基础语音识别工具包涵盖 ASR、VAD、标点恢复、说话人分离等。二、性能评测一览README 在多个开源基准上与 Whisper 等模型做了对比下面是各项结论对应已发布 checkpoint 的任务与语种范围。2.1 多语言语音识别在 AISHELL-1、AISHELL-2、Wenetspeech、LibriSpeech 和 Common Voice 上对比 SenseVoice 与 Whisper 的多语言识别性能与推理效率在中文和粤语识别上 SenseVoice-Small 具有明显效果优势。2.2 情感识别由于缺乏被广泛使用的情感识别测试指标与方法README 说明其在多个测试集、多种指标上做全面对比测试集同时包含中英文以及表演、影视剧、自然对话等多种风格。在不进行目标数据微调的前提下SenseVoice 能够在测试数据上达到和超过目前最佳情感识别模型的效果其中 SenseVoice-Large 几乎在所有数据上达到最佳SenseVoice-Small 也在多数数据集上超越其他开源模型。2.3 事件检测尽管 SenseVoice 只在语音数据上训练它仍可作为独立事件检测模型使用。在环境音分类 ESC-50 数据集上与业界常用的 BEATS、PANN 模型对比SenseVoice 能取得较好效果但受限于训练数据与训练方式与专业事件检测模型相比仍有一定差距README 如实说明并未夸大。2.4 推理效率SenseVoiceSmall 采用非自回归端到端架构参数量与 Whisper-Small 相当推理速度比 Whisper-Small快 5 倍以上、比 Whisper-Large快 15 倍。从源码层面印证这一点SenseVoiceSmallmodel.py 中注册为model_classes只包含Encoder CTC 头没有自回归解码器。其inference()方法直接对编码器输出的 CTC logits 做argmax、去连续重复并去掉 blank一次性输出整句 token 序列详见下文 4.5 节这正是非自回归、低延迟的架构来源。三、环境安装pip install -r requirements.txtrequirements.txt 的核心依赖如下含注释要点torch2.12.1 torchaudio2.11.0 modelscope huggingface huggingface_hub funasr1.3.26 numpy1.26.4 gradio fastapi0.111.1注意两点仓库刻意把 torch 版本保持在已知 Dependabot 告警范围之外若需要 CUDA 专属 wheel应先安装匹配的 torch/torchaudio 组合SenseVoiceSmall 示例与 FunASR 组合说话人分离路径需要funasr1.3.26。如果之前安装过本仓库依赖请先执行pip install -U funasr1.3.26再重新运行 demo。四、推理实践四种路径仓库为不同场景提供了四条推理路径本节逐一展开。4.1 路径一FunASR AutoModel VAD推荐默认支持常见格式音频输入。长录音必须先分段再送入编码器下例使用 FSMN-VAD 完成分段from funasr import AutoModel from funasr.utils.postprocess_utils import rich_transcription_postprocess model_dir iic/SenseVoiceSmall model AutoModel( modelmodel_dir, trust_remote_codeTrue, remote_code./model.py, vad_modelfsmn-vad, vad_kwargs{max_single_segment_time: 30000}, devicecuda:0, ) # en res model.generate( inputf{model.model_path}/example/en.mp3, cache{}, languageauto, # zh, en, yue, ja, ko, nospeech use_itnTrue, batch_size_s60, merge_vadTrue, merge_length_s15, ) text rich_transcription_postprocess(res[0][text]) print(text)上述示例可以直接参考 demo1.py依次演示 en / zh / yue / ja / ko 五个语种的推理而 demo2.py 对应不使用 VAD 的直接推理写法。参数详解README 参数说明的完整继承参数作用与取值model_dir模型名称如iic/SenseVoiceSmall或本地磁盘中的模型路径trust_remote_codeTrue表示模型代码实现从remote_code处加载支持绝对路径、相对路径及网络 URL此时修改本仓库 model.py 会生效False表示加载 FunASR 内部集成版本修改本地model.py不会生效remote_code指定模型代码位置例如./model.pyvad_model开启 VAD 长音频分段开启后推理耗时 VAD SenseVoice 总链路耗时如需单独测试 SenseVoice 耗时应关闭 VADvad_kwargs.max_single_segment_timeVAD 最大切割音频时长单位毫秒ms示例为 30000use_itn输出结果中是否包含标点与逆文本正则化Inverse Text Normalizationbatch_size_s动态 batchbatch 内总音频时长单位秒smerge_vad是否将 VAD 切出的短音频碎片合并合并后长度为merge_length_s秒ban_emo_unk禁用emo_unk标签禁用后所有句子都会被赋予情感标签默认Falselanguage可选auto/zh/en/yue/ja/ko/nospeechbatch_size非动态 batch 时的批大小短音频批量场景使用见 4.44.2 路径二不使用 VAD 的长音频推理把一小时波形直接传给一次model.generate会使编码器内存远大于音频文件本身。当业务不能接受 VAD 时可使用有界内存参考脚本 long_audio_no_vad.pypython long_audio_no_vad.py meeting.mp3 \ --output meeting.txt \ --window-seconds 30 \ --overlap-seconds 2脚本实现原理结合源码ffmpeg 解码ffmpeg_pcm_stream()调用 ffmpeg 将任意容器音频解码为单声道 16 kHz little-endian int16 PCM 流long_audio_no_vad.py 第 24-62 行ffmpeg 不在 PATH 时会抛出明确错误滑窗切分iter_overlapping_windows()以默认 30 秒窗口、2 秒重叠滑动切分窗口样本数 sample_rate × window_seconds步长 窗口 − 重叠校验逻辑要求重叠必须大于 0 且小于窗口第 65-116 行有界内存逐窗口调用 SenseVoice不配置 VAD 模型模型通过AutoModel(..., disable_updateTrue)构建第 15-21 行避免整段录音一次性进入编码器造成 OOM合并去重merge_transcripts()只删除相邻窗口边界处完全相同的重复文字大小写不敏感重叠长度区间 4~200 字符第 118-141 行传入--no-dedupe可连完全匹配的去重也关闭无损保留meeting.chunks.jsonl保留每个窗口的原始模型输出raw_text、清洗文本及窗口偏移start_ms/end_ms不匹配的内容不会被静默丢弃输出通过原子写入发布先写临时文件再os.replace第 144-168 行时间语义窗口偏移是输入窗口边界并非逐词时间戳。README 明确提醒此路径避免 OOM但固定切点仍可能影响边界附近的识别业务允许按内容分段时仍推荐上面的 VAD pipeline。仓库在 tests/test_long_audio_no_vad.py 中对该脚本做了单元验证可交叉印证其行为模型构建不带 VAD 与 remote_codetest_model_is_created_without_vad_or_remote_code窗口覆盖输入且不发出仅重叠的尾部test_windows_cover_input_and_do_not_emit_overlap_only_tail输入 11 个样本在 6 窗口/2 重叠下切出起始点 [0, 4, 8]非法重叠参数0、等于窗口、大于窗口被拒绝test_window_validation_rejects_invalid_overlap合并仅删除精确边界重叠test_merge_only_removes_exact_boundary_overlap。4.3 路径三短音频批量推理无 VAD如果输入均为短音频小于 30s且需要批量化推理可以移除 VAD 模型并设置batch_size提速model AutoModel(modelmodel_dir, trust_remote_codeTrue, devicecuda:0) res model.generate( inputf{model.model_path}/example/en.mp3, cache{}, languageauto, # zh, en, yue, ja, ko, nospeech use_itnTrue, batch_size64, )4.4 路径四直接调用 SenseVoiceSmall不经过 AutoModel 封装支持任意格式音频输入输入音频时长限制在 30 秒以下from model import SenseVoiceSmall from funasr.utils.postprocess_utils import rich_transcription_postprocess model_dir iic/SenseVoiceSmall m, kwargs SenseVoiceSmall.from_pretrained(modelmodel_dir, devicecuda:0) m.eval() res m.inference( data_inf{kwargs [model_path]}/example/en.mp3, languageauto, # zh, en, yue, ja, ko, nospeech use_itnFalse, ban_emo_unkFalse, **kwargs, ) text rich_transcription_postprocess(res [0][0][text]) print(text)4.5 从源码看懂 SenseVoiceSmall 的推理链路打开 model.py 可以完整还原非自回归推理的实现查询 token 注入inference()在特征序列前拼接 4 个特殊 token——语种查询lid_dict映射如auto: 0, zh: 3, en: 4, yue: 7, ja: 11, ko: 12, nospeech: 13、事件与情感查询、以及 ITN 风格查询textnorm_dict {withitn: 14, woitn: 15}分别通过self.embed得到 query 向量后与 speech 特征拼接第 825-849 行编码器前向特征送入 SAN-M 编码器SenseVoiceEncoderSmall由EncoderLayerSANM堆叠而成层内为MultiHeadedAttentionSANM注意力 FSMN 记忆 前馈网络输出encoder_outCTC 解码ctc_logits self.ctc.log_softmax(encoder_out)随后对每个样本做argmax → torch.unique_consecutive去连续重复→ 过滤 blank → tokenizer.decode一次性得到整句文本第 857-882 行ban_emo_unk的实现当该参数为True时直接把情感未知 tokenemo_dict[unk]id 25009对应的 CTC logit 置为-inf从而强制每个句子都被赋予情感标签第 858-859 行output_timestamp可选通过 utils/ctc_alignment.py 中的ctc_forced_align做 CTC 强制对齐输出逐 token 时间戳第 886-918 行。此外inference()支持直接传入 tensor/batch 数据data_in为列表、tensor 或文件路径均可这为下面的 FastAPI 服务接口提供了底层支撑。五、服务部署5.1 ONNX 与 Libtorch 导出导出与测试代码位于 demo_onnx.py 与 demo_libtorch.py底层导出逻辑见 export.py 与 export_meta.py。ONNX需要pip3 install -U funasr funasr-onnxfrom pathlib import Path from funasr_onnx import SenseVoiceSmall from funasr_onnx.utils.postprocess_utils import rich_transcription_postprocess model_dir iic/SenseVoiceSmall model SenseVoiceSmall(model_dir, batch_size10, quantizeTrue) # inference wav_or_scp [{}/.cache/modelscope/hub/{}/example/en.mp3.format(Path.home(), model_dir)] res model(wav_or_scp, languageauto, use_itnTrue) print([rich_transcription_postprocess(i) for i in res])备注ONNX 模型导出到原模型目录中。Libtorch需要pip3 install -U funasr funasr-torchfrom pathlib import Path from funasr_torch import SenseVoiceSmall from funasr_torch.utils.postprocess_utils import rich_transcription_postprocess model_dir iic/SenseVoiceSmall model SenseVoiceSmall(model_dir, batch_size10, devicecuda:0) wav_or_scp [{}/.cache/modelscope/hub/{}/example/en.mp3.format(Path.home(), model_dir)] res model(wav_or_scp, languageauto, use_itnTrue) print([rich_transcription_postprocess(i) for i in res])备注Libtorch 模型导出到原模型目录中。5.2 CPU / 边缘端llama.cpp / GGUF无需 GPU、无需 PythonSenseVoice 可以作为单个自包含二进制运行类似 whisper.cpp但在中文与粤语场景下更适合 SenseVoice运行时内置 FSMN-VAD无需 Python 环境bash runtime/llama.cpp/download-funasr-model.sh sensevoice ./gguf llama-funasr-sensevoice -m ./gguf/sensevoice-small-f16.gguf --vad ./gguf/fsmn-vad.gguf -a audio.wav从 runtime/llama.cpp/README.md 可以看到完整的工程细节架构SenseVoiceSmall SAN-M 编码器文档描述完整 checkpoint 约 70 层 CTC 头Linear 512→25055词表 25055——无 LLM、无自回归整条 pipeline 全部在 C 中完成音频16k 单声道→ kaldi 80 维 mel-fbank LFR特征维度 560→ 拼接 4 个 query token → SAN-M 编码器ggml 计算→ CTC 贪心解码argmax、去重、去 blank→ SentencePiece 解码构建cmake -B build -DCMAKE_BUILD_TYPERelease cmake --build build -j产物为build/bin/llama-funasr-*权重转换python runtime/llama.cpp/export_sensevoice_gguf.py --model_pt model/model.pt --mvn model/am.mvn --out sensevoice-small.gguff32 约 936 MB--wtype f16减半--wtype q8_0可得到约 254 MB 的 q8 模型运行参数--keep-tags保留|lang|/|emotion|/|event|标签--ids输出原始 CTC idVAD 支持内置 FSMN-VAD长音频无需 Python 前端VAD 权重可通过export_vad_gguf.py单独导出。5.3 FastAPI 服务启动命令export SENSEVOICE_DEVICEcuda:0 fastapi run --port 50000服务实现位于 api.py要点如下设备通过环境变量SENSEVOICE_DEVICE指定默认cuda:0服务启动时直接调用SenseVoiceSmall.from_pretrained并eval()第 28-30 行接口为POST /api/v1/asr支持多文件并发上传表单参数fileswav 或 mp3 音频16 kHz支持一次多份keys每个音频的名称逗号分隔可选缺省用文件名lang枚举auto/zh/en/yue/ja/ko/nospeech默认autouse_itn是否应用逆文本正则化默认False内部通过torchaudio.load读取、非 16 kHz 自动重采样torchaudio.transforms.Resample并取均值转单声道第 63-71 行返回结构中每条结果同时包含raw_text原始带标签文本、clean_text正则\|.*\|去掉标签与text经rich_transcription_postprocess富文本后处理根路径/返回 API 信息页/docs提供 Swagger 接口文档FastAPI 内置亦可直接python api.py以 uvicorn 运行host 0.0.0.0, port 50000。5.4 Docker 部署构建镜像docker build -t sensevoice .Dockerfile 基于pytorch/pytorch:2.12.1-cuda12.6-cudnn9-runtime安装了 ffmpeg、libsndfile1 等系统依赖先拷贝 requirements.txt 安装 Python 依赖利用层缓存再拷贝仓库代码容器内设置SENSEVOICE_DEVICEauto、MODELSCOPE_CACHE/models并通过 HEALTHCHECK 每 30 秒探测根路径超时 5s、启动宽限 5 分钟。注意构建工作流也会发布ghcr.io/qwenaudio/sensevoice容器包但该包当前为 private匿名拉取会返回 HTTP 401在容器包页面显示 Public 之前请使用上面的本地构建。运行GPU默认docker run --rm --gpus all -p 50000:50000 -v sensevoice-models:/models sensevoice运行仅 CPUdocker run --rm -e SENSEVOICE_DEVICEcpu -p 50000:50000 -v sensevoice-models:/models sensevoice容器健康后访问http://127.0.0.1:50000/docs查看接口文档。-v sensevoice-models:/models将模型缓存持久化到命名卷重启后无需重新下载多服务编排可参考 docker-compose.yaml。六、微调定制6.1 安装训练环境git clone https://github.com/modelscope/FunASR.git cd FunASR pip3 install -e ./6.2 数据准备微调数据为 jsonl 格式每行是一条样本字段如下示例可直接参考 data/train_example.jsonl 与 data/val_example.jsonl{key: YOU0000008470_S0000238_punc_itn, text_language: |en|, emo_target: |NEUTRAL|, event_target: |Speech|, with_or_wo_itn: |withitn|, target: Including legal due diligence, subscription agreement, negotiation., source: /cpfs01/shared/Group-speech/beinian.lzr/data/industrial_data/english_all/audio/YOU0000008470_S0000238.wav, target_len: 7, source_len: 140} {key: AUD0000001556_S0007580, text_language: |en|, emo_target: |NEUTRAL|, event_target: |Speech|, with_or_wo_itn: |woitn|, target: there is a tendency to identify the self or take interest in what one has got used to, source: /cpfs01/shared/Group-speech/beinian.lzr/data/industrial_data/english_all/audio/AUD0000001556_S0007580.wav, target_len: 18, source_len: 360}字段说明字段含义key数据唯一 IDsource音频文件的路径source_len音频文件的 fbank 帧数target音频文件标注文本target_len音频文件标注文本长度text_language音频文件的语种标签emo_target音频文件的情感标签event_target音频文件的事件标签with_or_wo_itn标注文本中是否包含标点与逆文本正则化从 scp/txt 生成 jsonl可以用指令sensevoice2jsonl从train_wav.scp、train_text.txt、train_text_language.txt、train_emo_target.txt和train_event_target.txt生成准备过程如下。train_text.txt左边为数据唯一 ID需与train_wav.scp中的 ID 一一对应右边为标注文本BAC009S0764W0121 甚至出现交易几乎停滞的情况 BAC009S0916W0489 湖北一公司以员工名义贷款数十员工负债千万 asr_example_cn_en 所有只要处理 data 不管你是做 machine learning 做 deep learning 做 data analytics 做 data science 也好 scientist 也好通通都要都做的基本功啊那 again 先先对有一些 也许对 ID0012W0014 he tried to think how it could betrain_wav.scp左边为数据唯一 ID右边为音频文件路径BAC009S0764W0121 https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/BAC009S0764W0121.wav BAC009S0916W0489 https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/BAC009S0916W0489.wav asr_example_cn_en https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/asr_example_cn_en.wav ID0012W0014 https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/asr_example_en.wavtrain_text_language.txt语种标签支持|zh|、|en|、|yue|、|ja|、|ko|BAC009S0764W0121 |zh| BAC009S0916W0489 |zh| asr_example_cn_en |zh| ID0012W0014 |en|train_emo.txt情感标签支持|HAPPY|、|SAD|、|ANGRY|、|NEUTRAL|、|FEARFUL|、|DISGUSTED|、|SURPRISED|BAC009S0764W0121 |NEUTRAL| BAC009S0916W0489 |NEUTRAL| asr_example_cn_en |NEUTRAL| ID0012W0014 |NEUTRAL|train_event.txt事件标签支持|BGM|、|Speech|、|Applause|、|Laughter|、|Cry|、|Sneeze|、|Breath|、|Cough|BAC009S0764W0121 |Speech| BAC009S0916W0489 |Speech| asr_example_cn_en |Speech| ID0012W0014 |Speech|生成指令完整标注# generate train.jsonl and val.jsonl from wav.scp, text.txt, text_language.txt, emo_target.txt, event_target.txt sensevoice2jsonl \ scp_file_list[../../../data/list/train_wav.scp, ../../../data/list/train_text.txt, ../../../data/list/train_text_language.txt, ../../../data/list/train_emo.txt, ../../../data/list/train_event.txt] \ data_type_list[source, target, text_language, emo_target, event_target] \ jsonl_file_out../../../data/list/train.jsonl生成指令自动打标若无train_text_language.txt、train_emo_target.txt和train_event_target.txtsensevoice2jsonl会自动使用 SenseVoice 模型对语种、情感和事件打标# generate train.jsonl and val.jsonl from wav.scp and text.txt sensevoice2jsonl \ scp_file_list[../../../data/list/train_wav.scp, ../../../data/list/train_text.txt] \ data_type_list[source, target] \ jsonl_file_out../../../data/list/train.jsonl \ model_diriic/SenseVoiceSmall6.3 启动训练bash finetune.sh注意需要修改 finetune.sh 中train_tool为你安装 FunASR 路径下funasr/bin/train_ds.py的绝对路径。结合 finetune.sh 源码看训练配置要点分布式启动CUDA_VISIBLE_DEVICES0,1指定 GPU通过torchrun启动支持WORLD_SIZE、RANK、MASTER_ADDR、MASTER_PORT环境变量参与多机多卡数据路径train_data${workspace}/data/train_example.jsonl、val_data${workspace}/data/val_example.jsonl即上文生成的 jsonldeepspeed配置指向 deepspeed_conf/ds_stage1.json同时支持use_deepspeedfalse关闭关键超参dataset_conf.batch_typetoken、batch_size6000按 token 计、sort_size1024、num_workers4train_conf.max_epoch50、validate_interval2000、save_checkpoint_interval2000、keep_nbest_models20、avg_nbest_model10optim_conf.lr0.0002模型加载modeliic/SenseVoiceSmalltrust_remote_codetrue即直接基于已发布 checkpoint 微调。七、WebUI 快速体验python webui.pywebui.py 基于 Gradio 构建模型默认使用iic/SenseVoiceSmall FSMN-VADmax_single_segment_time30000若联网失败则回退到~/.cache/modelscope/hub/...本地缓存路径并以disable_updateTrue保持离线第 17-35 行语言下拉框支持auto/zh/en/yue/ja/ko/nospeech内置标签→emoji 映射字典emo_dict/event_dict/emoji_dict如|HAPPY|→、|Laughter|→、|BGM|→format_str_v3将原始富文本标签渲染为带 emoji 的可读文本事件标签放在句首、情感标签放在句尾内置中英粤日韩及情感、事件、长音频共 16 个示例音频便于一键体验。八、生态与优秀三方工作README 记录了多个围绕 SenseVoice 的第三方集成可直接用于评估选型TritonGPU部署Triton TensorRT 方案官方文档记载在 V100 GPU 上 FP32 测试加速比 526FP16 支持进行中sherpa-onnx 部署支持在 10 种编程语言C、C、Python、C#、Go、Swift、Kotlin、Java、JavaScript、Dart中使用 SenseVoice并支持 iOS、Android、Raspberry Pi 等平台Orca通过 sherpa-onnx 集成本地离线语音识别支持 macOS、Linux、Windows自动识别中英日韩和粤语SenseVoice.cpp基于 GGML 的纯 C/C 推理支持 3/4/5/8 位量化无第三方依赖流式 SenseVoice通过分块推理实现伪流式采用截断注意力机制牺牲部分精度支持 CTC 前缀束搜索与热词增强OmniSenseVoice轻量化推理库支持 batch 推理SenseVoice Hotword神经网络热词增强方案。九、许可证说明本仓库源码采用 MIT License模型权重单独发布以各模型卡标注的条款为准官方 SenseVoiceSmall 模型卡链接至 FunASR 模型开源协议其他制品和转换版本可能标注不同条款使用前请核对对应模型卡维护者已针对 FunASR 模型开源协议发布官方许可澄清遵守模型协议时允许商业使用官方 SenseVoiceSmall 权重协议第 3 节属于责任和风险免责声明不构成额外的禁止商用限制微调后的衍生权重可以保持私有使用、复制、修改或分享模型时仍需遵守协议第 2.2 节的署名和模型名称要求。该澄清仅适用于官方权重第三方转换版本和打包制品需分别核对其条款。十、联系我们使用中遇到问题可以在仓库 GitHub 页面提交 IssueREADME 同时提供了 FunASR 钉钉社区群二维码欢迎语音爱好者加入社区交流。总结SenseVoice 的价值在于一个非自回归模型同时输出转写文本、语种、情感与事件标签且推理延迟极低。本文沿 README 主线覆盖了从环境安装、四条推理路径、ONNX/libtorch/llama.cpp/FastAPI/Docker 部署到 jsonl 数据准备与finetune.sh微调的全部实操细节并结合 model.py、api.py、long_audio_no_vad.py、finetune.sh、runtime/llama.cpp/README.md 等源码与测试如 tests/test_long_audio_no_vad.py做了实现级印证。建议按先跑 demo、再对业务音频评估 VAD 与长音频路径、最后微调定制的顺序上手。赞分享人工智能大模型语音音频微调本地部署【免费下载链接】SenseVoiceOpen-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.项目地址https://gitcode.com/gh_mirrors/se/SenseVoice点击查看免费下载相关推荐FunASR 中 SenseVoice 多语言语音理解模型推理、导出、服务部署与工业数据微调实战指南FunASR 中 SenseVoice 多语言语音理解模型推理、导出、服务部署与工业数据微调实战指南 SenseVoice 是 FunASR 生态中的音频理解语音音频人工智能大模型模型推理服务本地部署CANN/cann-bench版本变更记录版本变更记录 V0.2.0 2026 05 07 评分体系切换为 hardware anchored 公式 对齐 bench.tex 评分公式改版单用例性能得人工智能模型评测AI 评测Agent 评测CANNAscend如何快速部署AiSOC从零开始搭建你的AI驱动安全运营平台如何快速部署AiSOC从零开始搭建你的AI驱动安全运营平台 AiSOC是一款开源的AI驱动安全运营平台它集成了告警融合、紫队演练、智能辅助分诊和MITRE人工智能AI Agent安全应用安全AI 应用后端前端MCP 服务RAG威胁情报SIEM上一篇MinDoc离线部署终极指南Draw.io本地化与资源包完整配置方案下一篇Tachyon延迟初始化示例lazy/模块与单例模式实现创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?