kandinsky-6

一句话生成带声音的视频,口型音效自动对上

Kandinsky 6.0 是面向视频与音频同步生成的基础模型开源项目,由 Sber AI 团队推出,采用 Python 实现。它解决的核心问题是:传统视频生成模型只能产出画面,音频需要单独制作再对齐,流程割裂且口型、节奏常对不上。Kandinsky 6.0 尝试在同一个扩散框架内联合建模视觉与听觉信号,让生成的视频自带与之匹配的音轨,包括环境音、语音口型和动作音效。项目提供预训练权重、推理脚本和配置示例,支持文本到视频+音频的联合生成,也可用于视频配音、音效补全等任务。对于研究多模态生成、音视频联合建模的开发者,它提供了一个可复现的基线,降低了从零搭建同步生成系统的门槛。当前星标数约 223,属于早期项目,社区生态仍在成长。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 223
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类视频生成
开发团队kandinskylab
所属国家
官网地址
定价模式free
价格说明开源模型权重,免费使用
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 223
30天Star增速
HF 下载量
上线时间2026-10-05 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-09
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 同一扩散框架联合建模视频与音频,减少后期对齐成本
  • 提供预训练权重与推理脚本,可直接跑通文本到音视频生成
  • 覆盖语音口型、环境音、动作音效等多种同步场景

不足之处

  • 项目处于早期,星标和社区规模较小,第三方教程与插件少
  • 对显存和算力要求较高,普通消费级显卡难以流畅推理
  • 生成质量与稳定性可能不及成熟商业方案,需自行调参

适用场景

  • 短视频创作者快速产出带背景音和口型的角色视频
  • 游戏或动画原型阶段自动生成角色动作与配套音效
  • 研究多模态联合生成,作为音视频同步建模的实验基线

替代项目

Open-Sora、CogVideo、VideoCrafter

项目介绍

kandinsky-6 是视频领域的开源项目,由 kandinskylab 开发,是 2026 年新上线的项目。

它收录于视频分类,该分类目前共有 528 个项目,GitHub 星标数为 223。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-08。开源模型权重,免费使用。

它主要面向的使用场景是:短视频创作者快速产出带背景音和口型的角色视频。同类可对比的替代方案包括 Open-Sora、CogVideo、VideoCrafter。

上一篇:AutoDubVN

下一篇:minimax-h3-colab-skill

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 129176 2026-08-09
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3784 2026-08-10
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 329 2026-08-26
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4325 2026-08-10