文本转语音(TTS)工具的需求现在是越来越多,尤其是在生成高质量有声书、配音和同步字幕的场景中。传统TTS工具要么依赖云端API,存在隐私风险,要么生成速度慢、语音不自然。
Abogen是最近刚开源的一款新型 TTS 工具,通过Kokoro-82M模型,能在5秒内将3000字符(约1分钟音频)转化为自然流畅的语音,并生成精准同步的字幕。

以其离线运行、跨平台支持和多语言能力脱颖而出。无论是将ePub小说转为有声书、为YouTube视频生成配音,还是为视障人士提供无障碍内容,Abogen都能通过简单的拖拽界面或CLI实现高效转换。
其内置语音混合器允许用户自定义声音风格,批量队列功能则支持一次性处理多个文件,生成时间比传统工具快2-3倍。

Abogen的主要优势包括:
速度:快速生成音频(例如,3000字符的文本在普通硬件上只需11秒即可转换为3.5分钟的音频)质量:由Kokoro-82M驱动的自然声音便捷性:拖放界面,直观操作多功能性:支持ePub、PDF和纯文本源
主要功能
•多格式文档支持:支持 ePub、PDF、TXT 等多种输入文件格式 •章节处理:从书籍中处理特定章节,单独保存或合并为一个文件 •批量处理:排队处理多个文件 •元数据支持:自动提取元数据并包含在音频文件中 •多种语言:支持美式英语、英式英语、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和普通话 •语音混合:通过调整不同语音模型的权重创建自定义语音 •语速调整:从0.1x到2.0x的速率调整 •输出格式:选择WAV、FLAC、MP3、OPUS或带章节的M4B格式 •自动字幕生成:自动创建时间同步的字幕文件,按句子、逗号停顿或特定字数(1字、2字、3字等)生成字幕
快速上手
选择最适合您操作系统的安装方法。
Windows:
① 下载仓库 ZIP 文件
下载地址:https://github.com/denizsafak/abogen/archive/refs/heads/main.zip
② 解压,通过双击运行 WINDOWS_INSTALL.bat(如果提示,需要安装espeak-ng)
这种方法可以自动处理所有内容——在自包含的环境中安装所有依赖项,包括CUDA,而无需单独安装Python。
当然也可以在环境准备充足的情况下,可以使用pip命令一键安装:
pip install abogen Mac:
# Install espeak-ng
brew install espeak-ng
# Create a virtual environment (recommended)
mkdir abogen && cd abogen
python3 -m venv venv
source venv/bin/activate
# Install abogen
pip3 install abogen Linux:
# Install espeak-ng
sudo apt install espeak-ng # Ubuntu/Debian
sudo pacman -S espeak-ng # Arch Linux
sudo dnf install espeak-ng # Fedora
# Create a virtual environment (recommended)
mkdir abogen && cd abogen
python3 -m venv venv
source venv/bin/activate
# Install abogen
pip3 install abogen
# For NVIDIA GPUs:
# Already supported, no need to install CUDA separately.
# For AMD GPUs:
# After installing abogen, we need to uninstall the existing torch package
pip3 uninstall torch
pip3 install --pre torch torchvision torchaudio --index-url https://download.pytorch.org/whl/nightly/rocm6.4 使用方法
转换文件(只需3步)
第1步:添加您的文本
您有三种输入文本的方式:
拖放一个文件(.txt、.epub或.pdf)到输入框 点击输入框打开文件浏览器并选择您的文件 使用文本框按钮直接输入或粘贴文本
对于EPUB和PDF文件,Abogen会提示您选择要包含的章节或页面。
第2步:配置设置
在开始转换之前,调整以下基本设置:
速度:使用滑块设置语音速率,从0.1x(非常慢)到2.0x(非常快) 语音:从下拉菜单中选择一个语音 第一个字母表示语言(例如,'a'表示美式英语,'b'表示英式英语) 第二个字母表示性别('m'表示男性,'f'表示女性) 生成字幕:选择您希望生成字幕的方式(按句子、按单词等) 输出语音格式:选择您偏好的音频格式(.WAV、.FLAC、.MP3、.OPUS) 输出字幕格式:选择字幕样式(SRT、ASS宽/窄) 保存位置:指定输出文件的保存位置
第3步:开始转换
点击开始按钮 观看进度条,Abogen将处理您的文本 完成后,使用按钮: •打开文件:播放生成的音频 •转到文件夹:浏览输出目录 •新转换:开始新项目
写在最后
Abogen 以其基于 Kokoro-82M 的强大TTS能力和同步字幕生成,有效简化了有声书和配音内容的创作流程。
支持ePub、PDF、TXT输入,5秒生成1分钟音频+字幕,效率远超传统工具。其语音混合器和多语言支持(中文、英文、日语等)满足多样化需求,Windows一键安装和Docker部署也进一步降低了使用门槛。
对于经常从事自媒体创作的人很是适宜,有兴趣的小伙伴可以去下载安装尝试。
