abogen 完整指南把 EPUB、PDF 和纯文本变成带同步字幕的音频【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen想把一本书或长文章变成带同步字幕的视频配音手工做起来要三步提取文本、合成语音、再手动对字幕。abogen 把这三步合并成一条流水线拖入 EPUB、PDF 或纯文本选好声音和字幕粒度输出的就是音频和时间轴匹配的字幕文件。合成默认用本地 Kokoro-82M 模型8200 万参数跑速度取决于自己的硬件。能力全景一份文档能产出什么保留章节结构可按章拆成独立音频它不是单纯的朗读工具。abogen 先把文档解析成文本再在章节开头插入不可见的章节标记你可以按章导出独立音频也可以合并成一个文件纯文本同样能手动加这种标记。好处是某章合成出错时只重跑那一章不用整本重来。多个声音加权混合出新音色语音混合器做的是多个发音模型的加权叠加而不是简单调参数。拖动每条声音的权重、实时试听把混好的结果存成配置档案反复使用档案还支持导入导出。下图示例用 4 个美式英语声音按约 39%、39%、14%、8% 的权重混合。图语音混合器。左侧是已保存的配置档案右侧是每个声音的权重滑块顶部百分比是归一化后的最终权重。字幕粒度可选到词级字幕时间轴直接取自 TTS 引擎合成时输出的时间戳对齐本身是准的。粒度从 Line、Sentence、Sentence Comma 一直到 1、2、3 词的词级输出 SRT 或 ASS 两种格式。边界要说清词级只有英文可用因为 Kokoro 只对英文输出词级时间戳其他语言退回按音频时长估算的句子级。句子切分可选项用 spaCy避免把 Mr. 这类缩写误切成句号。关键设计为什么把引擎拆成插件第一个决策是 TTS 引擎走插件接口。主程序只依赖 tts_plugin/ 里的抽象plugins/ 下的 Kokoro 和 Supertonic 各自是独立包。加一个新引擎包括云端 API只需按固定入口写一个包主程序在加载时校验它声明的能力。取舍在于接口刻意做小引擎只负责建会话和合成流式输出、可取消这些高级特性做成可选能力不支持就不实现。第二个决策是双界面共享同一核心。桌面端是 PyQt6命令 abogen 启动Web 端是 Flaskabogen-web端口 8808可打成 Docker 容器部署。Web 端功能更多——Supertonic、LLM 文本清洗、推送 Audiobookshelf——但两端功能不同步桌面端滞后这是明说的取舍。用起来什么样从一份书到成片桌面端流程三步拖文件、设置、开始。官方演示数据RTX 2060 Mobile 上约 3000 字符耗时 11 秒产出 3 分 28 秒音频。音频可选 WAV、FLAC、MP3、OPUS 或带章节的 M4B字幕选 SRT 或 ASS。批量处理用队列模式每个文件保留入队时的设置也可以统一用当前设置覆盖。图abogen-web 任务仪表盘。顶部卡片是任务总量与转换中数量中部区域是新建有声书任务的入口。跑服务器就用 abogen-web上传文档、点一下创建任务后台 worker 按顺序执行浏览器实时刷新进度和日志。成品还能直接推送到 Audiobookshelf 或 Calibre OPDS省掉手动拷贝这一步。图队列管理器。多个文本文件在列表中排队待转每项标注字符数顶部可勾选用当前设置覆盖全部条目。收尾它适合谁适合需要批量产出带字幕的有声内容、视频配音的人以及想自托管的人仓库直接带 compose 文件。不适合非英文的词级字幕目前仅英文、扫描件 PDF 的文字识别OCR 在路线图上但还没做、Windows 上的 AMD 显卡用户ROCm 仅 Linux 支持。想上手pip install abogen 后运行 abogen 就行想深入代码读 docs/tts-plugin-architecture.md 了解插件契约再跑一遍 tests/contracts/ 下的契约测试就能验证你写的引擎是否达标。【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
阅读完成 · 觉得有帮助?