Emu

一个模型搞定图像视频生成与理解,智源出品

Emu 是北京智源人工智能研究院(BAAI)发布的一系列生成式多模态模型,涵盖图像生成、视频生成以及多模态理解等任务。该项目旨在通过统一的模型架构和训练范式,解决传统生成模型在跨模态理解和生成上的割裂问题,使模型能够同时处理文本、图像和视频等多种输入,并生成高质量的视觉内容。核心能力包括:基于自回归或扩散的生成能力、多模态指令跟随、以及支持多种视觉任务的统一接口。项目提供了模型权重、推理代码和训练脚本,方便研究者和开发者进行二次开发与部署。Emu 系列在多项基准上表现出色,是开源社区中较为活跃的多模态模型项目之一。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1778
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队baaivision
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型foundation-models,generative-pretraining-in-multimodality,in-context-learning,instruct-tuning,multimodal-generalist,multimodal-pretraining
GitHub 星标★ 1778
30天Star增速
HF 下载量
上线时间2023-07-11 00:00:00
最近更新2026-09-04 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:高级 约 15 分钟 部署方式:模型权重 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目主要开发语言为 Python)
  • Git,用于克隆 GitHub 仓库
  • 可访问外网,便于后续拉取模型权重与依赖
  • 建议具备 GPU 环境用于多模态模型推理(README 未给出具体显存要求)

安装与启动步骤

  1. 1确认使用哪个版本

    仓库按 Emu1 / Emu2 / Emu3 三个版本分目录维护,先确定你要用哪一版,再进入对应子目录查看其说明。

  2. 2克隆项目仓库

    把 baaivision 的 Emu 仓库拉到本地,后续所有代码与权重说明都在仓库子目录中。

    git clone https://github.com/baaivision/Emu.git
  3. 3进入版本子目录

    Emu1、Emu2 的推理代码和模型说明各自放在独立子目录,进入你要用的那一版。

    cd Emu/Emu2
  4. 4阅读子目录说明文档

    主 README 未给出统一安装命令,环境依赖、权重下载、推理脚本需按所在子目录的 README 与脚本执行。

    ls
  5. 5体验官方在线 demo

    若只想快速看效果,README 提供了 Emu2 官方演示地址,可直接在浏览器中打开试用。

如何确认成功

克隆完成并能进入对应子目录、看到该版本的 README 与推理代码,即表示前期准备完成。

常见问题

Q:主 README 里没有 pip install 或 docker 命令怎么办?

A:该仓库把各版本的安装与推理说明分散在 Emu1、Emu2 等子目录中,需进入子目录查看对应 README 和脚本,主 README 只做版本索引。

Q:Emu3 在哪个仓库?

A:README 明确给出 Emu3 已单独开源,地址为 https://github.com/baaivision/Emu3,不在当前仓库里。

Q:想先看效果再部署可以吗?

A:可以。README 提供了 Emu2 的在线 demo(http://218.91.113.230:9002/),可先在浏览器体验,再决定是否本地部署。

Q:需要下载模型权重吗?

A:需要。README 提到已发布 Emu、Emu2 的推理代码与模型,权重获取方式请以对应子目录中的说明为准。

注意事项

  • 本项目为研究型多模态生成模型,主 README 未提供统一的一键安装流程,实际部署以各版本子目录文档为准。
  • README 公布的演示地址为第三方(BAAI)服务器,可能随时失效或限流,仅建议用于快速体验。
  • 模型体积与算力需求较大,请在具备 GPU 资源的机器上尝试本地推理。

核心亮点

  • 统一多模态框架,同时支持图像/视频生成与理解,减少多模型拼接成本
  • 基于 BAAI 研究积累,提供预训练权重,开箱即用
  • 代码结构清晰,支持自定义训练和推理,便于学术研究

不足之处

  • 模型参数量较大,推理资源需求高,不适合轻量部署
  • 文档和示例相对较少,社区生态仍在建设中

适用场景

  • 多模态内容创作,如根据文本生成配图或短视频
  • 视觉问答与图像描述,提升多模态交互体验
  • 学术研究,用于探索统一生成模型架构

替代项目

CogVideo、NEXT-GPT、Unified-IO

项目介绍

Emu 是开源模型领域的开源项目,由 baaivision 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,778)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-04。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:多模态内容创作,如根据文本生成配图或短视频。同类可对比的替代方案包括 CogVideo、NEXT-GPT、Unified-IO。

上一篇:Otter

下一篇:lag-llama

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10