Bernini

一条指令,让AI帮你生成或编辑视频,多模态输入全搞定

Bernini 是一个统一的视频生成与编辑框架,将基于多模态大语言模型(MLLM)的语义规划器与基于扩散Transformer(DiT)的渲染器相结合。它解决的核心问题是:传统视频生成模型难以同时处理文本、图像、视频等多种模态输入,且生成与编辑任务割裂。Bernini 通过语义规划器理解用户意图(如文本指令、参考图像或视频),将其转化为结构化的编辑计划,再由 DiT 渲染器生成高质量视频或对现有视频进行精细编辑。其核心能力包括:多模态条件输入(文本、图像、视频)、统一的生成与编辑流程、以及基于扩散模型的时序一致性控制。该框架旨在为创意工作者和开发者提供一站式视频内容创作工具,降低视频制作门槛。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1319
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队bytedance
所属国家
定价模式free
价格说明开源框架,Apache-2.0 许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型image-editing,image-generation,video-editing,video-generation
GitHub 星标★ 1319
30天Star增速
HF 下载量
上线时间2026-05-29 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(仓库根目录提供 requirements.txt)
  • 必须额外安装 Open-VeOmni 依赖,README 说明需以 --no-deps 方式安装
  • 训练场景推荐使用 uv 管理 Python 环境,pyproject.toml 会自动路由 torch / torchvision 到对应 CUDA 索引
  • 需从 Hugging Face 下载模型权重(ByteDance/Bernini-Diffusers 等仓库)
  • 推理与训练需按官方文档 docs/bernini.md 或 docs/bernini_r.md 执行

安装与启动步骤

  1. 1克隆仓库

    把 Bernini 源码拉取到本地 bernini 目录并进入该目录,后续命令都在此目录内执行。

    git clone https://github.com/bytedance/Bernini.git bernini && cd bernini
  2. 2安装推理依赖

    安装仓库提供的推理依赖清单。确保 pip 指向你打算使用的 Python 环境,建议先建好虚拟环境。

    pip install -r requirements.txt
  3. 3安装 Open-VeOmni

    Open-VeOmni 是必需依赖,README 要求加 --no-deps 安装,避免它顺带拉入自己的依赖。具体包名与完整命令请以 README 原文和官方文档为准。

  4. 4安装 uv(训练用)

    只有训练场景需要。用官方脚本安装 uv,然后用它来创建 .venv 并管理训练依赖。如已安装可跳过。

    curl -LsSf https://astral.sh/uv/install.sh | sh
  5. 5同步训练依赖

    创建 .venv 并安装 pyproject.toml 声明的全部训练依赖,再安装 all 附加依赖。注意此步骤可能拉取体积较大的 CUDA 版 torch。

    uv sync
    uv sync --extra all
  6. 6下载权重并推理

    权重下载与各任务的推理命令是按模型区分的,README 没有直接给出,需按 docs/bernini.md(完整 Bernini)或 docs/bernini_r.md(Bernini-R 渲染器)中的步骤执行。

如何确认成功

按 docs/bernini.md 或 docs/bernini_r.md 执行对应推理命令后,能正常输出生成的视频或编辑结果,即表示权重与环境配置成功。

常见问题

Q:推理要用哪个模型?

A:完整 Bernini 的推理代码与权重在 Hugging Face 的 ByteDance/Bernini-Diffusers;Bernini-R 渲染器另有 Bernini-R-Diffusers 与 1.3B 版本,按 docs/bernini.md 或 docs/bernini_r.md 选择。

Q:为什么要用 --no-deps 安装 Open-VeOmni?

A:README 明确要求这样做,目的是不让它顺带拉入自身依赖,避免与仓库已有的依赖版本冲突。

Q:训练环境怎么装?

A:推荐用 uv:先装 uv,再在仓库目录执行 uv sync 与 uv sync --extra all,pyproject.toml 会声明依赖并自动指向正确的 CUDA 索引。

Q:1.3B 和 14B 版本怎么选?

A:1.3B 由 Wan2.1-1.3B 微调而来,在风格迁移、字幕/水印去除、局部编辑等简单任务上接近 14B,但人物生成等复杂任务弱于 14B。

注意事项

  • README 中未给出端口、路径、密钥等配置项,本教程未做任何补充,凡未列出的参数请以官方文档为准。
  • Open-VeOmni 的安装命令在 README 节选中被截断,请务必回原文确认完整命令后再执行。
  • 权重下载与推理命令按模型区分,不在 README 正文中,需查阅 docs/bernini.md 与 docs/bernini_r.md。
  • 训练依赖含 torch/torchvision,下载与安装体积较大,请预留磁盘空间与稳定网络。

核心亮点

  • 统一框架同时支持视频生成和编辑,无需切换不同模型
  • 融合MLLM语义规划,能理解复杂文本指令和参考图像,编辑更精准
  • 基于DiT渲染,生成视频的时序连贯性和画质有保障

不足之处

  • 项目较新,文档和社区生态尚待完善
  • 依赖大规模计算资源,普通开发者本地部署门槛高

适用场景

  • 创意短视频的快速生成与风格化编辑
  • 根据剧本或分镜脚本自动生成视频片段
  • 对已有视频进行局部修改或内容替换

替代项目

Runway Gen-2、Pika Labs、Stable Video Diffusion

项目介绍

Bernini 是视频领域的开源项目,由 bytedance 开发,是 2026 年新上线的项目。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,319)位列前 30%,在视频分类中处于中上游。

近 45 天,它的 GitHub 星标从 1,241 增加到 1,319,净增 78。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:创意短视频的快速生成与风格化编辑。同类可对比的替代方案包括 Runway Gen-2、Pika Labs、Stable Video Diffusion。

上一篇:VideoClaw

下一篇:ComfyUI-LTXVideo

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10