jamiepine/voicebox
The open-source AI voice studio. Clone, dictate, create.
深度介绍
它是什么
Voicebox 是一个开源的 AI 语音工作室,集语音克隆、听写转录与语音生成于一体。基于 TypeScript 构建,支持 CUDA 与 Apple MLX 双后端,MIT 协议开源。
核心亮点
- 三合一工作流:克隆音色、语音转文字、文字转语音在同一界面完成
- 多引擎驱动:集成 Qwen3-TTS 与 Whisper,兼顾合成质量与识别精度
- 本地优先:支持 CUDA / MLX 本地推理,数据不出设备
- 现代化 UI:Qwen3-TTS 可视化界面,开箱即用
为什么火
5.4 万 Star、单日新增 400+,踩中了「开源 ElevenLabs 替代」的强需求。语音克隆长期被闭源 SaaS 垄断,Voicebox 把模型、UI、推理后端一次性打包,且 MIT 协议商用友好,开发者迁移成本极低。
适合谁用
播客与视频创作者、需要批量配音的内容团队、做语音 Agent 的开发者,以及关注隐私、希望本地部署语音能力的个人用户。
快速上手
git clone https://github.com/jamiepine/voicebox
cd voicebox && pnpm install
pnpm dev
首次运行会自动拉取模型权重,建议配备 NVIDIA GPU 或 Apple Silicon 设备。
