pyvideotrans

上传视频,一键生成多语言配音和字幕,轻松出海。

pyvideotrans 是一个开源的视频翻译与配音工具,能够将视频中的语音识别为文字,翻译成目标语言,并自动生成配音和字幕,最终嵌入视频中。它解决了视频内容跨语言传播的痛点,让创作者无需专业视频编辑技能即可完成视频的本地化。核心能力包括:基于多种语音识别引擎(如 Whisper)的语音转文字,支持数十种语言的互译,集成多种 TTS 引擎生成自然语音,以及字幕烧录和音轨替换。用户可通过简单的图形界面操作,也可使用命令行批量处理。项目采用模块化设计,支持自定义插件,适应不同场景需求。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 19115
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队jianchang512
所属国家
定价模式free
价格说明开源免费,可自行部署,官网提供在线使用说明。
访问状态
是否开源是
开源协议GPL-3.0
主要语言Python
技术栈/模型speech-to-text,stt,subtitle-translation,text-to-speech,tts,video-transition
GitHub 星标★ 19115
30天Star增速
HF 下载量
上线时间2023-10-02 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 15 分钟 部署方式:本地安装 8 步

环境要求

  • Windows 10/11 可直接使用预打包 exe 版,无需 Python 环境
  • 源码部署需安装 uv 包管理工具,并克隆 GitHub 仓库
  • 源码部署支持 macOS / Linux / Windows 开发者
  • 若需 GPU 加速,需 NVIDIA 显卡并安装 CUDA 12.8 与 cuDNN 9.11
  • 使用 WebUI 容器方式需本机已安装 Docker

安装与启动步骤

  1. 1下载 Windows 预打包版

    Windows 10/11 用户可直接下载官方预打包版,无需配置 Python 环境,适合新手快速体验。

  2. 2解压到纯英文路径

    解压到不含中文和空格的路径,例如 D:pyVideoTrans,不要直接在压缩包内运行。

  3. 3双击运行程序

    进入解压后的目录,双击 sp.exe 启动图形界面;使用 GPU 加速前需确认已装 CUDA 12.8 与 cuDNN 9.11。

  4. 4安装 uv

    源码部署推荐使用 uv 做依赖管理与环境隔离,请按官方文档先安装 uv;未安装时后续 uv 命令无法执行。

  5. 5克隆仓库

    从 GitHub 拉取 pyvideotrans 源码到本地,默认克隆到当前目录下的 pyvideotrans 文件夹。

    git clone https://github.com/jianchang512/pyvideotrans.git
  6. 6同步项目依赖

    进入项目目录后用 uv sync 安装依赖;默认不会在本地安装 whisper.net 和 WebUI 这两个可选组件。

    cd pyvideotrans
    uv sync
  7. 7按需安装可选组件

    需要 whisper.net 用 --extra dotnet,需要 WebUI 用 --extra webui,全部可选通道用 --all-extras。

    uv sync --extra dotnet
    uv sync --extra webui
    uv sync --all-extras
  8. 8Docker 启动 WebUI

    README 给出的容器启动命令,映射 7860 端口并以后台方式运行名为 pyvideotrans 的容器。

    docker run -d -p 7860:7860 --name pyvideotrans pyvideotrans-webui

关键配置

配置项必填说明示例
7860否WebUI 容器对外映射的访问端口7860:7860

如何确认成功

Docker 方式访问 http://127.0.0.1:7860 能看到 WebUI 界面;Windows 版双击 sp.exe 后正常出现主界面。

常见问题

Q:Windows 预打包版解压后无法运行或报错?

A:检查解压路径是否含中文或空格,建议解压到 D:pyVideoTrans 这类纯英文路径,并且不要直接在压缩包内双击运行。

Q:想用 GPU 加速需要什么环境?

A:需要 NVIDIA 显卡,并确保已安装 CUDA 12.8 和 cuDNN 9.11,README 中明确以这两个版本为例。

Q:uv sync 之后为什么没有 WebUI 或 whisper.net?

A:默认同步不安装 whisper.net 和 WebUI,需额外执行 uv sync --extra dotnet、uv sync --extra webui 或 uv sync --all-extras。

Q:AMD 显卡如何加速?

A:README 提供了 AMD GPU 通过 Whisper.NET 加速的说明文档 docs/whisper_net_setup.md,可按该文档配置。

注意事项

  • README 中 Docker 部分只给出了运行命令,构建镜像的完整步骤未包含在节选内容里,实际部署前请以官方文档为准。
  • 源码部署推荐使用 uv 而非 pip,以获得更快的安装速度和更好的环境隔离。
  • 克隆与解压路径尽量避免中文和空格,可减少运行时报错。
  • WebUI 容器默认通过 7860 端口访问,请确认该端口未被占用。

核心亮点

  • 支持多种语音识别和翻译引擎,如 Whisper、Google 翻译,准确度高
  • 集成多种 TTS 引擎,配音自然,支持音色定制
  • 提供图形界面和命令行,适合不同用户群体,操作简单

不足之处

  • 处理长视频时耗时较长,依赖外部 API 可能产生费用
  • 文档/社区待观察

适用场景

  • 视频创作者将内容翻译成多语言,拓展海外观众
  • 教育机构将课程视频本地化,方便非母语学习者
  • 企业将产品宣传视频翻译为多语言,用于国际市场推广

替代项目

VideoLingo、Seamless、Subtitle Edit

项目介绍

pyvideotrans 是视频领域的开源项目,由 jianchang512 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(19,115)位列前 3%,在视频分类的 473 个项目里位列前 1%。

近 41 天,它的 GitHub 星标从 18,664 增加到 19,115,净增 451。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源免费,可自行部署,官网提供在线使用说明。从国内网络环境看,可直接访问。

它主要面向的使用场景是:视频创作者将内容翻译成多语言,拓展海外观众。同类可对比的替代方案包括 VideoLingo、Seamless、Subtitle Edit。

上一篇:Maestro

下一篇:YouDub-webui

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09