VideoChat

3秒低延迟,自定义形象音色,快速搭建你的实时数字人。

VideoChat 是一个基于 Python 的实时交互数字人开源项目,旨在解决传统数字人开发门槛高、交互延迟大的问题。它允许用户自定义数字人的形象和音色,并支持音色克隆功能,从而快速打造个性化的虚拟助手或直播主播。项目采用端到端技术栈,整合了 ASR(语音识别)、多模态大语言模型(对话生成)、唇形同步(Lip-Sync)和数字人渲染(如 MuseTalk)等模块,实现了从语音输入到数字人回复的完整闭环。其核心优势在于对话延迟低至 3 秒,提供了接近实时的交互体验。项目内置了 Gradio 界面,方便用户快速部署和测试,降低了使用门槛。

开源 unknown 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1313
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类音频音乐
开发团队Henry-23
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型asr,dialogue-systems,digital-human,end-to-end,gradio-python-app,lip-sync,multimodal-large-language-models,musetalk,real-time,streaming,talking-head,tts
GitHub 星标★ 1313
30天Star增速
HF 下载量
上线时间2024-10-18 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • 操作系统:Ubuntu 22.04
  • Python 3.10(建议用 conda 创建独立环境)
  • CUDA 12.2
  • 显存:级联方案约 8G,端到端 MLLM 方案约 20G
  • 需安装 Git LFS 用于拉取权重文件

安装与启动步骤

  1. 1安装 Git LFS 并克隆

    先装好 git lfs,再从 ModelScope 创空间仓库克隆项目,权重由 lfs 追踪会自动下载。

    git lfs install
    git clone https://www.modelscope.cn/studios/AI-ModelScope/video_chat.git
  2. 2创建 conda 环境

    按 README 要求创建 python 3.10 的独立环境。

    conda create -n metahuman python=3.10
  3. 3激活环境进入目录

    激活刚创建的环境,并切换到项目根目录。

    conda activate metahuman
    cd video_chat
  4. 4安装项目依赖

    安装 requirements.txt 中的依赖,版本仅供参考,最新依赖以各模块 Repo 说明为准。

    pip install -r requirements.txt
  5. 5配置百炼 API-KEY

    默认使用 API 方式的 LLM 和 TTS,在 app.py 第 14 行填入自己的 DASHSCOPE API-KEY。

    os.environ["DASHSCOPE_API_KEY"] = "sk-xxxxxxxx"
  6. 6启动服务

    运行主程序,启动内置 Gradio 界面进行实时语音交互测试。

    python app.py
  7. 7可选:切换仅级联分支

    若不需要端到端 MLLM(更省显存),切到 cascade_only 分支后再启动。

    git checkout cascade_only

关键配置

配置项必填说明示例
DASHSCOPE_API_KEY是阿里云百炼 API-KEY,用于默认的 Qwen 与 CosyVoice 接口调用sk-xxxxxxxx

如何确认成功

运行 python app.py 后,终端会输出 Gradio 访问地址,浏览器打开该地址能进入对话页面即启动成功。

常见问题

Q:显存不够怎么办?

A:端到端 MLLM 方案约需 20G 显存,级联方案约 8G。显存有限可执行 git checkout cascade_only 切换到仅含级联方案的分支。

Q:必须手动下载模型权重吗?

A:不必。通过 README 给出的 ModelScope 创空间仓库 git clone 时,权重已由 git lfs 追踪并自动拉取,无需额外配置。

Q:不想购买 API-KEY 可以本地推理吗?

A:可以。LLM 用 src/llm.py 中的 Qwen 类本地推理,或用 vLLM 部署后以 Qwen_API(api_key="EMPTY",base_url="http://localhost:8000/v1") 调用;TTS 可删除 CosyVoice_API 相关内容,改用 Edge_TTS。

Q:想用 vLLM 加速 LLM 推理怎么装?

A:按 README 克隆 vllm 仓库后依次执行 python use_existing_torch.py、pip install -r requirements-build.txt、pip install -e . --no-build-isolation。

注意事项

  • 级联方案首包延迟约 3s(单张 A100),端到端语音方案约 7s(单张 A100)。
  • requirements 中的依赖版本仅供参考,遇到问题请查看对应模块 Repo 的最新说明。
  • 使用自定义数字人形象与音色属于可选步骤,具体配置请参考 README 第 5 节。

核心亮点

  • 对话延迟低至3秒,交互体验流畅,优于多数开源数字人方案。
  • 支持音色克隆,可快速复制特定声音,个性化程度高。
  • 提供Gradio界面,部署简单,上手快,适合快速原型验证。

不足之处

  • 文档/社区待观察
  • 依赖多模态大模型和渲染组件,对硬件资源要求较高。

适用场景

  • 虚拟主播/直播带货,实现24小时无人直播。
  • 在线教育/客服,提供拟人化交互服务。
  • 个人助理/陪伴机器人,打造个性化虚拟形象。

替代项目

SadTalker、HeyGen、D-ID

项目介绍

VideoChat 是数字人3D领域的开源项目,由 Henry-23 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,313)位列前 30%,在数字人3D分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。

它主要面向的使用场景是:虚拟主播/直播带货,实现24小时无人直播。同类可对比的替代方案包括 SadTalker、HeyGen、D-ID。

上一篇:Mediapipe4u-plugin

下一篇:Bert-VITS2-ext

同类项目推荐

A3D 开源

在 three.js 里直接调用 AI 生成纹理和素材,边建模边生成

3D x AI hybrid editor, built with three.js

★ 129 2026-08-09
cube 开源

用一句话生成 3D 模型,在 Roblox 里快速落地 AI 创作

Roblox Foundation Model for 3D Intelligence

★ 1254 2026-08-09
AG3D 开源

用2D图片直接生成3D虚拟人,告别昂贵扫描

Official code release for ICCV2023 paper AG3D: Learning to Generate 3D Avatars from ···

★ 272 2026-08-09
GameFactory-3A 开源

一条命令生成 3A 游戏资产,从模型到视频全自动

A comprehensive open-source 3A game-generation skill and asset framework.

★ 798 2026-08-21