voicebox

一站式克隆、转写、合成声音,打造你的 AI 语音工作室

voicebox 是一个开源的 AI 语音工作室,旨在提供一站式的声音克隆、语音转写和语音合成能力。它解决了个人开发者和小团队难以高效构建高质量语音 AI 应用的问题,将复杂的音频处理流程封装为易用的工具。核心能力包括:基于先进模型(如 Qwen3-TTS)的语音克隆,能够快速复制特定音色;集成 Whisper 实现高精度语音转写;提供直观的 UI 界面,降低使用门槛。项目支持 CUDA 和 MLX 加速,兼容多种硬件环境,技术栈以 TypeScript 为主,便于前端集成。无论是创作者制作配音、开发者构建语音交互应用,还是研究者进行实验,voicebox 都提供了灵活、可扩展的开源解决方案。

开源 freemium 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 55453
维护状态 维护中
是否开源 是
定价模式 freemium

项目数据

分类音频音乐
开发团队jamiepine
所属国家
定价模式freemium
价格说明开源项目,提供在线语音工作室,基础功能免费,高级功能或额度需付费。具体价格未明确,需访问官网查看。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型ai,cuda,mlx,qwen3-tts,qwen3-tts-ui,voice-ai,voice-clone,whisper
GitHub 星标★ 55453
30天Star增速
HF 下载量
上线时间2026-01-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数8

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • just(任务运行器,可通过 brew install just 或 cargo install just 安装)
  • Bun 运行时
  • Rust 工具链(rustup)
  • Python 3.11+
  • Tauri 前置依赖;macOS 上还需安装 Xcode

安装与启动步骤

  1. 1安装 just

    just 用于执行仓库内置的 setup / dev 等任务命令,macOS 用 brew 安装,其他环境可用 cargo 安装。

    brew install just
  2. 2准备前置依赖

    按 README 要求准备 Bun、Rust、Python 3.11+ 与 Tauri Prerequisites;macOS 还需安装 Xcode,缺一项后续 setup 会失败。

  3. 3克隆仓库

    把 voicebox 源码克隆到本地,README 中的 setup 命令需在仓库目录内执行。

    git clone https://github.com/jamiepine/voicebox.git
  4. 4进入项目目录

    切换到克隆下来的 voicebox 目录,后续所有 just 命令都在此目录执行。

    cd voicebox
  5. 5初始化环境

    该命令会创建 Python 虚拟环境并安装全部依赖,首次执行耗时较长,请保持网络畅通。

    just setup
  6. 6启动应用

    同时启动后端与桌面应用;README 指出 dev 应用运行后,仓库根目录预置的 .mcp.json 会被 Claude Code 自动识别。

    just dev
  7. 7查看全部命令

    列出仓库提供的所有 just 任务,方便按需执行其他子命令。

    just --list

关键配置

配置项必填说明示例
.mcp.json否仓库根目录预置的 MCP 配置,在该 checkout 内运行 Claude Code 时自动加载 Voicebox MCP 工具/your/path/voicebox/.mcp.json

如何确认成功

执行 just dev 后终端无依赖或编译报错,后端与桌面应用均正常启动并出现界面,即表示启动成功。

常见问题

Q:提示 just 命令不存在怎么办?

A:说明未安装 just。macOS 可执行 brew install just,其他环境可执行 cargo install just,安装完成后重新运行 just setup。

Q:Windows 或 Linux 可以安装吗?

A:README 仅说明需准备 Tauri Prerequisites,并特别指出 macOS 需要 Xcode,未给出其他平台的专属步骤,建议按 Tauri 官方前置要求配置。

Q:有哪些可用的构建或运行命令?

A:在项目根目录运行 just --list,即可查看仓库提供的全部 just 任务。

Q:MCP 工具没有生效?

A:需先在本仓库目录内运行 just dev 启动开发版应用,然后在同一个 checkout 中启动 Claude Code,才能自动读取根目录的 .mcp.json。

注意事项

  • README 未给出端口、API Key 等配置项说明,需要时请查阅官方文档 docs.voicebox.sh 与仓库中的 troubleshooting.mdx。
  • 运行 just setup 前务必确认 Python 版本不低于 3.11,并已安装 Bun、Rust 与 Tauri 前置依赖。
  • 本项目为 Tauri 桌面应用形态,首次编译依赖较多,构建时间可能较长。

核心亮点

  • 集成 Qwen3-TTS 和 Whisper,克隆与转写能力开箱即用
  • 提供图形界面,非程序员也能快速上手
  • 支持 CUDA/MLX 加速,兼顾性能与硬件兼容性

不足之处

  • 文档/社区待观察
  • 依赖较多 AI 模型,部署体积可能较大

适用场景

  • 内容创作者快速生成个性化配音
  • 开发者构建语音交互或语音助手应用
  • 企业批量生成多音色语音内容

替代项目

Coqui TTS、Bark、OpenVoice

项目介绍

voicebox 是音频音乐领域的开源项目,由 jamiepine 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(55,453)位列前 1%,在音频音乐分类的 738 个项目里位列前 1%。

近 42 天,它的 GitHub 星标从 50,154 增加到 55,453,净增 5,299。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。提供在线语音工作室,基础功能免费,高级功能或额度需付费。具体价格未明确,需访问官网查看。从国内网络环境看,可直接访问。

它主要面向的使用场景是:内容创作者快速生成个性化配音。同类可对比的替代方案包括 Coqui TTS、Bark、OpenVoice。

上一篇:FluidAudio

下一篇:youtube-auto-dub

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09