大学生
 
- 金币
- 1418
- 好评
- 6
- 信誉
- 101
|
Voicebox
Voicebox 是一个以本地为优先(local-first)的语音克隆工具,可以看作是类似 ElevenLabs 的开源替代方案。
https://pan.baidu.com/s/1HpJPOAzXq7VS8H4k_vezQg?pwd=6666
你可以:
用几秒音频进行零样本语音克隆
使用 50+ 预设声音
在 7 个 TTS 引擎之间切换
支持 23 种语言生成语音
添加音效并制作多角色语音内容(时间轴编辑)
核心特性
隐私优先
所有模型和语音数据仅在本地运行
不上传、不依赖云
多引擎语音合成(7种)
可按需切换不同引擎:
Qwen3-TTS:高质量多语言克隆,支持语气控制(如“慢一点”“低声说”)
Qwen CustomVoice:9种预设声音,支持自然语言控制,无需参考音频
LuxTTS:轻量(约1GB显存),CPU可跑,超快(150倍实时)
Chatterbox Multilingual:语言最广(23种)
Chatterbox Turbo:支持情绪标签(如 [laugh])
TADA(HumeAI):长语音一致性强(700秒+)
Kokoro:超小模型(82M),50种预设声音,CPU友好
情绪与语气标签
仅 Chatterbox Turbo 支持
用于增强表达(其他模型会当普通文本读)
后期音效处理
支持:
音高(Pitch)
混响(Reverb)
延迟(Delay)
合唱 / 镶边(Chorus / Flanger)
压缩(Compressor)
增益(Gain)
高通 / 低通滤波
内置预设:
机器人音
广播音
回声室
深沉音
无限长度生成
自动分句 + 拼接(带交叉淡入)
支持最长 50,000 字符
可调:
分段长度(100–5000)
交叉淡化(0–200ms)
多版本生成管理
每次生成都有版本系统:
原始版本
加效果版本
多次重生成(不同随机种子)
来源追踪
收藏标记
异步生成队列
非阻塞生成
队列防止 GPU 冲突
实时状态反馈(SSE)
崩溃后自动恢复任务
语音配置管理
从音频创建语音
支持多样本增强质量
导入 / 导出
每个语音可设置默认音效
故事编辑器(时间轴)
适合:
对话
播客
旁白
功能:
多轨道编辑
拖拽操作
音频裁剪
同步播放
录音与转录
内置录音(带波形)
系统音频录制(Win/macOS)
自动转文字(Whisper)
多格式导出
模型管理
支持卸载模型释放显存
自定义模型路径(VOICEBOX_MODELS_DIR)
模型迁移
下载管理(暂停/取消)
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
x
|