OmniTokenizer

一个模型搞定图像视频分词,统一 token 化,加速多模态生成

OmniTokenizer 是一个用于图像和视频联合分词(tokenization)的统一模型,来自 NeurIPS 2024。它解决了图像和视频生成中分词器不统一的问题,传统方法需要为图像和视频分别训练不同的 VAE/VQVAE 模型,而 OmniTokenizer 通过单一模型和单一权重同时处理图像与视频,将视觉数据转换为离散 token,供自回归模型使用。其核心能力包括:支持图像和视频的联合编码与解码,在多个基准上达到 SOTA 性能,并具备良好的扩展性。该模型基于 VQVAE 架构,通过时空建模统一处理静态和动态视觉内容,为多模态生成任务提供了基础组件。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 329
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队FoundationVision
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型auto-regressive-model,image-generation,tokenization,vae,video-generation,vqvae
GitHub 星标★ 329
30天Star增速
HF 下载量
上线时间2024-06-13 00:00:00
最近更新2026-09-09 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 统一图像与视频分词,减少模型部署和训练成本
  • 在图像和视频重建任务上均达到 SOTA 性能
  • 支持自回归生成,可直接用于多模态大模型

不足之处

  • 文档和社区支持尚待完善,项目处于早期阶段
  • 对长视频处理可能受限于 token 长度和计算资源

适用场景

  • 图像与视频联合生成模型的基础组件
  • 多模态自回归模型的 tokenizer 替换
  • 视频压缩与重建研究

替代项目

VideoGPT、TATS (Time-Aware Transformer)、MagViT

项目介绍

OmniTokenizer 是开源模型领域的开源项目,由 FoundationVision 开发,2024 年首次发布。

它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 329。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-09。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:图像与视频联合生成模型的基础组件。同类可对比的替代方案包括 VideoGPT、TATS (Time-Aware Transformer)、MagViT。

上一篇:LlamaGen

下一篇:caption-upsampling

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10