文本转语音(TTS)工具的需求现在是越来越多,尤其是在生成高质量有声书、配音和同步字幕的场景中。传统TTS工具要么依赖云端API,存在隐私风险,要么生成速度慢、语音不自然。

Abogen是最近刚开源的一款新型 TTS 工具,通过Kokoro-82M模型,能在5秒内将3000字符(约1分钟音频)转化为自然流畅的语音,并生成精准同步的字幕。


以其离线运行、跨平台支持和多语言能力脱颖而出。无论是将ePub小说转为有声书、为YouTube视频生成配音,还是为视障人士提供无障碍内容,Abogen都能通过简单的拖拽界面或CLI实现高效转换。

其内置语音混合器允许用户自定义声音风格,批量队列功能则支持一次性处理多个文件,生成时间比传统工具快2-3倍。


Abogen的主要优势包括:

  • 速度:快速生成音频(例如,3000字符的文本在普通硬件上只需11秒即可转换为3.5分钟的音频)
  • 质量:由Kokoro-82M驱动的自然声音
  • 便捷性:拖放界面,直观操作
  • 多功能性:支持ePub、PDF和纯文本源

主要功能

  • •多格式文档支持:支持 ePub、PDF、TXT 等多种输入文件格式
  • •章节处理:从书籍中处理特定章节,单独保存或合并为一个文件
  • •批量处理:排队处理多个文件
  • •元数据支持:自动提取元数据并包含在音频文件中
  • •多种语言:支持美式英语、英式英语、西班牙语、法语、印地语、意大利语、日语、巴西葡萄牙语和普通话
  • •语音混合:通过调整不同语音模型的权重创建自定义语音
  • •语速调整:从0.1x到2.0x的速率调整
  • •输出格式:选择WAV、FLAC、MP3、OPUS或带章节的M4B格式
  • •自动字幕生成:自动创建时间同步的字幕文件,按句子、逗号停顿或特定字数(1字、2字、3字等)生成字幕

快速上手

选择最适合您操作系统的安装方法。

Windows:

① 下载仓库 ZIP 文件

下载地址:https://github.com/denizsafak/abogen/archive/refs/heads/main.zip

② 解压,通过双击运行 WINDOWS_INSTALL.bat(如果提示,需要安装espeak-ng)

这种方法可以自动处理所有内容——在自包含的环境中安装所有依赖项,包括CUDA,而无需单独安装Python。

当然也可以在环境准备充足的情况下,可以使用pip命令一键安装:

pip install abogen

Mac:

# Install espeak-ng
brew install espeak-ng

# Create a virtual environment (recommended)
mkdir abogen && cd abogen
python3 -m venv venv
source venv/bin/activate

# Install abogen
pip3 install abogen

Linux:

# Install espeak-ng
sudo apt install espeak-ng # Ubuntu/Debian
sudo pacman -S espeak-ng # Arch Linux
sudo dnf install espeak-ng # Fedora

# Create a virtual environment (recommended)
mkdir abogen && cd abogen
python3 -m venv venv
source venv/bin/activate

# Install abogen
pip3 install abogen

# For NVIDIA GPUs:
# Already supported, no need to install CUDA separately.

# For AMD GPUs:
# After installing abogen, we need to uninstall the existing torch package
pip3 uninstall torch 
pip3 install --pre torch torchvision torchaudio --index-url https://download.pytorch.org/whl/nightly/rocm6.4

使用方法

转换文件(只需3步)

第1步:添加您的文本

您有三种输入文本的方式:

  • 拖放一个文件(.txt、.epub或.pdf)到输入框
  • 点击输入框打开文件浏览器并选择您的文件
  • 使用文本框按钮直接输入或粘贴文本

对于EPUB和PDF文件,Abogen会提示您选择要包含的章节或页面。

第2步:配置设置

在开始转换之前,调整以下基本设置:

  • 速度:使用滑块设置语音速率,从0.1x(非常慢)到2.0x(非常快)
  • 语音:从下拉菜单中选择一个语音
    • 第一个字母表示语言(例如,'a'表示美式英语,'b'表示英式英语)
    • 第二个字母表示性别('m'表示男性,'f'表示女性)
  • 生成字幕:选择您希望生成字幕的方式(按句子、按单词等)
  • 输出语音格式:选择您偏好的音频格式(.WAV、.FLAC、.MP3、.OPUS)
  • 输出字幕格式:选择字幕样式(SRT、ASS宽/窄)
  • 保存位置:指定输出文件的保存位置

第3步:开始转换

  • 点击开始按钮
  • 观看进度条,Abogen将处理您的文本
  • 完成后,使用按钮:
    • •打开文件:播放生成的音频
    • •转到文件夹:浏览输出目录
    • •新转换:开始新项目


写在最后

Abogen 以其基于 Kokoro-82M 的强大TTS能力和同步字幕生成,有效简化了有声书和配音内容的创作流程。

支持ePub、PDF、TXT输入,5秒生成1分钟音频+字幕,效率远超传统工具。其语音混合器和多语言支持(中文、英文、日语等)满足多样化需求,Windows一键安装和Docker部署也进一步降低了使用门槛。

对于经常从事自媒体创作的人很是适宜,有兴趣的小伙伴可以去下载安装尝试。

GitHub:https://github.com/denizsafak/abogen