首页 / 资讯中心 / 文章详情

VoiceStudio 新手指南:10 分钟免费本地语音克隆,合成第一条 AI 声音

VoiceStudio 新手指南:10 分钟免费本地语音克隆,合成第一条 AI 声音 ★ FEATURED ARTICLE
VoiceStudio 新手指南10 分钟免费本地语音克隆合成第一条 AI 声音【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio不用注册账号、不用 API 密钥、没有按量计费——VoiceStudio 把 ElevenLabs 那套能力开源并搬进了你的电脑语音克隆、声音设计、视频配音、转写、有声书创作全在本地完成覆盖 646 种语言。照这篇走一遍10 分钟后你手里就有一条用自己的音色说话的语音。先看效果这条语音最终长什么样最终产物是一段用你的声音说出来的音频把任意文字丢进去换回对应的语音还能继续拿它给视频换声、产出有声书。背后是 16 个 TTS 引擎加 11 个 ASR 引擎组成的目录软件按 AGPL-3.0 免费开源你付出的只有硬件成本。上机前检查你的电脑够不够格维度要求系统Windows 10 x64 / macOS 13.3Apple 芯片/ Linux x86_64glibc 2.39内存最低 8 GB16 GB 以上更从容磁盘最低 10 GB 空闲20 GB 的 SSD 体验更好显卡可选NVIDIA CUDA 或 Apple Silicon 明显提速一句话结论最低配置也能完整跑通纯 CPU 只是合成偏慢有独显或 Apple 芯片速度会顺很多。装起来一条推荐路径加两个备选新手直接走官方安装包去项目 Releases 页面对应平台下载。macOS 是 DMG首次启动要右键 → 打开Windows 是 MSI可以选当前用户版不需要管理员权限Linux 用 AppImage。三套平台的细节分别在 macOS 安装指南、Windows 安装指南 和 Linux 安装指南。Intel Mac 不支持本地后端、只能连远程服务原因见 macOS 那篇。装好后第一次启动别急应用会自己搭好 Python 运行环境再下载约 2.4 GB 的默认模型。启动页会逐个亮出进度等它走完就行——这是整个安装里最耗时的一段。备选一Docker 一行拉起仅 Linux/AMD64GPU 配置见 docs/install/docker.mddocker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data --name voicestudio palashdeb/omnivoice-studio:stable备选二源码启动适合想改动的开发者git clone https://gitcode.com/GitHub_Trending/om/VoiceStudio cd VoiceStudio bun install bun run desktop主流程从声音到成片拿到你的声音三选一先定个标准手里有干净的自录人声选克隆不想暴露真声选设计想省一切事直接去画廊挑。A. 克隆自己的音色。首页点 Voice Clone 卡片进工作台——左栏是克隆列表中间写文本右侧是素材区。在右侧 Voice Source 拖入 WAV、MP3 或 M4A也可以点 Record 现录。素材讲究就三条单人、无 BGM、无明显混响3 秒就能用5~15 秒效果最稳。暂时没有素材的话点上方提示条里的 Try the demo voice先用内置示例声音把流程完整走一遍。B. 一句话设计一个声音。切到 By design 模式写一句描述比如温暖、有表现力的英国男声适合读有声书就能捏出一个全新音色。内置 The Librarian、The Anchor、The Helpdesk 等现成角色模板点 Use this design 直接生效默认引擎 OmniVoice 的更多能力写在 docs/engines/omnivoice.md。C. 从声音画廊直接领。侧边栏 Gallery 里按性别、年龄、口音、语言过滤现成声音点 Use voice 存成本地档案立即可用。输入内容并生成声音就绪后把要说的话打进中间 Prompt 文本区。底部语言选择器留在 Auto 也行手动指定目标语言也行Steps 滑杆往上拖合成更精细只是慢一些。最后点 Synthesize Audio等音频出来。回放、保存与微调生成结束后右侧 History 里会多出一条带播放条的记录点一下听效果。这次克隆好的音色会自己存进左侧 Voice Clones 列表下次挑出来接着用不用重传录音。想让语气更像真人用上文本框下方那组内置表情标签[laughter] 笑、[sigh] 叹息、[question-en] 疑问语气、[confirmation-en] 确认语气、[surprise-ah] 惊讶、[dissatisfaction-hmm] 不满。全部标签和各自的引擎支持情况翻 docs/expressive-speech.md 就够。卡住了按这个顺序排查引擎提示不可用或 GPU 没有生效去 Settings → Engines兼容性矩阵直接标出每个引擎在当前机器能不能跑、GPU 是否打开。默认的 OmniVoice 引擎600 语言、零样本克隆在首次启动时就装好了一般不用动想换引擎照 引擎目录 逐个看要求。合成太慢是不是坏了多半不是。本地推理的速度由硬件说了算CPU 上慢是常态。有显卡的话先回上面那张矩阵确认 GPU 状态是 ACTIVE再谈其他。整条流程跑不通怎么办跑一次完整自检Settings → About →Run self-check它会逐项检查依赖和模型并给出失败点配合 docs/install/troubleshooting.md 对照处理大部分问题在这一步就能定位。接下来可以玩什么视频配音丢一个视频进去它会把台词转写出来、翻译成目标语言、按说话人逐一换声最后导出成片流程与导出选项见 docs/dubbing/export.md。听写助手全局快捷键唤起实时把语音变成文字详见 docs/features/dictation.md。开发者接口本地 REST/SSE API外加一个 OpenAI 兼容的音频接口方便接进你自己的程序完整能力清单在 docs/feature-catalog.md。现在就去录一段 15 秒的干净人声吧10 分钟后你自己的 AI 声音就上岗了。【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?
咨询建站