VoiceStudio

开源语音全能工作站,克隆、配音、转录一站式搞定

VoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编排等核心功能。项目基于 Python 构建,充分利用了 HuggingFace 生态、CUDA 和 MLX 等加速技术,支持多种语音 AI 任务。它解决了商业语音服务价格高昂、数据隐私受限和定制化困难的问题,让开发者可以本地部署并构建自定义的语音应用。核心能力包括:高保真语音克隆、多语言翻译与配音、实时语音转文字、批量有声书生成,以及可视化的工作流设计器,方便用户将语音能力嵌入到更复杂的自动化流程中。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 34308
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队debpalash
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型ai,audiobook,cuda,dubbing,elevenlabs-alternative,huggingface,local-first,mlx,omnivoice-studio,speech-to-text,tauri,text-to-speech,transcription,translate,tts,voice-ai,voice-cloning,voice-generation,voicestudio,workflow
GitHub 星标★ 34308
30天Star增速
HF 下载量
上线时间2026-04-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 15 分钟 部署方式:本地安装 8 步

环境要求

  • Node 20+ 与 Bun(从源码运行时需要)
  • Python 3.11+(从源码运行时需要;首次启动自动通过 uv 配置依赖)
  • Docker(使用容器方式运行时需要)
  • 系统要求:macOS 13.3+ / Windows 10 或 11 / Linux AppImage 需 x86_64 且 glibc 2.39+
  • 首次启动需联网,用于创建托管 Python 环境并下载默认模型

安装与启动步骤

  1. 1选择部署方式

    README 提供四种方式:桌面安装包、Docker 镜像、源码运行、远程后端。按你的系统任选一种即可。

  2. 2下载桌面安装包

    到最新 Release 页面下载:macOS 用 Apple Silicon DMG,Windows 用 x64 MSI(可选当前用户版免管理员),Linux 用 AppImage。

  3. 3Docker 一键启动

    官方镜像仅支持 linux/amd64。命令会后台启动容器、映射本机 3900 端口并挂载数据卷 omnivoice-data。

    docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data --name voicestudio palashdeb/omnivoice-studio:stable
  4. 4克隆源码仓库

    从源码运行前先装好 Node 20+/Bun 与 Python 3.11+,再克隆仓库并进入目录。

    git clone https://github.com/debpalash/VoiceStudio.git
    cd VoiceStudio
  5. 5安装依赖

    使用 Bun 安装前端依赖;桌面启动器会在首次运行时自动通过 uv 配置 Python 依赖。

    bun install
  6. 6启动桌面应用

    运行桌面启动器,首次启动会自动创建 Python 环境并下载默认模型,耗时较长请耐心等待。

    bun run desktop
  7. 7改用浏览器界面

    如果不想用桌面窗口,可用浏览器 UI 模式启动同一套服务。

    bun run dev
  8. 8排查启动失败

    在应用内执行 设置 → 关于 → 运行自检,或直接跑诊断命令定位问题。

    uv run python backend/main.py --diagnose --deep

如何确认成功

Docker 方式执行 docker ps 看到 voicestudio 容器为 Up 且映射 3900 端口,即可访问本机 3900。

常见问题

Q:macOS 首次打开没反应或被拦截?

A:首次启动需要在应用上右键点击一次,再选择“打开”完成一次性授权,之后即可正常启动。

Q:Intel 芯片的 Mac 能运行吗?

A:不能运行本地 Python 后端,README 建议改用远程后端方式部署,详见 macOS 安装文档。

Q:Apple Silicon 上能跑 Docker 镜像吗?

A:发布镜像仅 linux/amd64。Apple Silicon 上建议使用原生 macOS 应用以获得 GPU 加速;ARM64 主机拉镜像前需先阅读架构要求。

Q:生成速度很慢怎么办?

A:可对照官方实测基准文档调整性能设置,也可先运行自检确认模型与环境是否正常加载。

Q:安装失败该提供什么信息?

A:在应用内保存脱敏后的诊断包,连同问题一起提交 issue,并参考 install 故障排查文档。

注意事项

  • 项目正在进行 Electron 重写,请勿提交桌面应用相关的 issue 和 PR。
  • 本地工作流无需账号、API key、订阅或用量计量。
  • 首次启动会创建托管 Python 环境并下载默认模型,后续启动直接复用。
  • 发布镜像仅提供 linux/amd64,ARM64 主机使用前请确认架构要求。

核心亮点

  • 集成语音克隆、配音、转录、有声书生成等全流程能力,开箱即用
  • 支持本地部署,数据隐私可控,且兼容 CUDA 和 Apple MLX 加速
  • 基于 HuggingFace 生态,模型可替换,扩展性强

不足之处

  • 项目较新,文档和社区支持仍在完善中
  • 语音克隆和生成质量可能受限于底层模型,与商业产品有差距

适用场景

  • 内容创作者批量生成多语言有声书或播客配音
  • 企业构建内部语音助手或客服系统,需本地化部署
  • 开发者快速搭建语音转写或翻译的自动化工作流

替代项目

Coqui TTS、Bark、OpenVoice

项目介绍

VoiceStudio 是音频音乐领域的开源项目,由 debpalash 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(34,308)位列前 2%,在音频音乐分类的 738 个项目里位列前 1%。

近 44 天,它的 GitHub 星标从 9,779 增加到 34,308,净增 24,529。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:内容创作者批量生成多语言有声书或播客配音。同类可对比的替代方案包括 Coqui TTS、Bark、OpenVoice。

上一篇:Advanced-RVC-Inference

下一篇:sea-g2p

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09