SoniTranslate

上传视频,自动生成多语言配音,轻松出海

SoniTranslate 是一个开源的视频同步翻译与配音工具,专注于将视频中的语音自动翻译成其他语言,并生成与画面同步的配音。它解决了视频内容跨语言传播时人工配音成本高、字幕翻译不自然的问题。核心能力包括:自动语音识别(ASR)、说话人分离(diarization)、文本翻译、语音合成(TTS)以及音视频同步。用户只需输入视频,即可获得带翻译配音的新视频,支持多种语言。项目基于 Python 构建,集成了多个先进的 AI 模型,提供命令行和 Web 界面,适合个人创作者、教育机构等快速制作多语言视频内容。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1416
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队R3gm
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和自行部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型asr,audio-processing,automatic-dubbing,diarization,document-translator,dubbing,speech-to-text,stt,subtitle-to-speech,text-to-speech,translate-audio,translate-video,translation,tts,video-dubbing
GitHub 星标★ 1416
30天Star增速
HF 下载量
上线时间2023-06-27 00:00:00
最近更新2026-09-20 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Linux 系统(README 注明安装仅在 Linux 下测试通过)
  • 已安装 Anaconda / Miniconda
  • Python 3.10(conda 环境 sonitr)
  • NVIDIA GPU + CUDA 11.8 运行环境(PyTorch 使用 pytorch-cuda=11.8)
  • 已安装并可用的 FFmpeg

安装与启动步骤

  1. 1创建 conda 环境

    新建名为 sonitr 的 Python 3.10 环境并激活,随后升级 pip 与 setuptools 到 README 指定版本。

    conda create -n sonitr python=3.10 -y
    conda activate sonitr
    python -m pip install pip==23.1.2 Setuptools==80.6.0
  2. 2安装 PyTorch

    通过 conda 的 pytorch 与 nvidia 频道安装 README 指定版本的 PyTorch 2.5.1 及配套 CUDA 11.8。

    conda install pytorch==2.5.1 torchvision==0.20.1 torchaudio==2.5.1 pytorch-cuda=11.8 -c pytorch -c nvidia
  3. 3克隆仓库

    从 GitHub 拉取 SoniTranslate 源码并进入项目目录,后续命令都在该目录执行。

    git clone https://github.com/r3gm/SoniTranslate.git
    cd SoniTranslate
  4. 4安装依赖包

    依次安装基础依赖、额外依赖以及 onnxruntime-gpu,安装耗时较长请耐心等待。

    pip install -r requirements_base.txt -v
    pip install -r requirements_extra.txt -v
    pip install onnxruntime-gpu
  5. 5安装 FFmpeg

    FFmpeg 用于处理音视频,README 推荐用 conda 安装;装完用 ffmpeg -h 确认已加入 PATH。

    conda install -y ffmpeg
    ffmpeg -h
  6. 6可选安装 TTS

    按需安装 Piper TTS 或 Coqui XTTS,用于本地语音合成与声音克隆;不需要可跳过。

    pip install -q piper-tts==1.2.0
    pip install -q -r requirements_xtts.txt
    pip install -q TTS==0.21.1  --no-deps
  7. 7设置 HF Token

    README 要求在 Linux 下把 Hugging Face token 设为环境变量,把示例值替换成你自己的 token。

    export YOUR_HF_TOKEN="YOUR_HUGGING_FACE_TOKEN"
  8. 8启动应用

    在项目目录运行 app_rvc.py,终端出现 local URL 后即可在浏览器中打开使用。

    conda activate sonitr
    python app_rvc.py

关键配置

配置项必填说明示例
YOUR_HF_TOKEN是Hugging Face 访问令牌,README 要求在运行前设置为环境变量hf_xxxxxxxxxxxxxxxxxxxxxxxxx

如何确认成功

终端打印出 local URL http://127.0.0.1:7860,用浏览器打开该地址能看到 SoniTranslate 的 Gradio 界面即为成功。

常见问题

Q:ffmpeg 安装后提示找不到命令怎么办?

A:README 建议用 conda install -y ffmpeg 安装,并在终端执行 ffmpeg -h 检查是否已加入 PATH;报错则需将 ffmpeg 加入环境变量 PATH。

Q:Windows 或 macOS 可以按这个流程装吗?

A:README 明确说明安装步骤仅在 Linux 下测试,未提供 Windows/macOS 的安装说明,其他系统可能遇到额外问题。

Q:可以不用本地安装吗?

A:可以,README 提供了 Colab Notebook 和 Hugging Face Spaces 在线 DEMO 两种免安装运行方式。

Q:Piper TTS 和 Coqui XTTS 必须装吗?

A:不是,README 把它们列为可选安装项(Optional install),只在需要对应语音合成能力时再安装。

Q:浏览器打不开 7860 端口?

A:确认启动日志中的 local URL 是否为 http://127.0.0.1:7860,并检查本地防火墙或端口是否被其他程序占用。

注意事项

  • README 中的 Hugging Face token 为占位符,务必替换成自己的真实 token 再执行。
  • 安装说明基于 Linux 环境测试,其他操作系统不保证可用。
  • PyTorch 安装命令带 pytorch-cuda=11.8,需要匹配的 NVIDIA 驱动和 CUDA 环境。
  • TTS 相关包为可选项,不安装也可启动主程序。

核心亮点

  • 全自动流程:从语音识别到配音生成一条龙,无需人工干预
  • 支持说话人分离,保留原视频不同说话人的音色特征
  • 提供 Web 界面,降低使用门槛,非技术用户也能上手

不足之处

  • 依赖多个外部 AI 模型,安装配置复杂,对硬件有一定要求
  • 翻译质量受限于底层模型,专业术语或口音可能出错
  • 文档/社区待观察

适用场景

  • 视频创作者将内容翻译成多语言,扩大海外受众
  • 教育机构将课程视频配音成学生母语,提升学习效果
  • 企业将产品演示视频本地化,进入国际市场

替代项目

VideoLingo、pyvideotrans、WhisperDubbing

项目介绍

SoniTranslate 是音频音乐领域的开源项目,由 R3gm 开发,2023 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,416)位列前 30%,在音频音乐分类的 738 个项目里位列前 13%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-20。Apache-2.0 许可证,可免费使用和自行部署。

它主要面向的使用场景是:视频创作者将内容翻译成多语言,扩大海外受众。同类可对比的替代方案包括 VideoLingo、pyvideotrans、WhisperDubbing。

上一篇:Speech-AI-Forge

下一篇:soprano

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09