PixelUMM

去掉视觉编码器,一套模型同时看懂和生成图像视频

PixelUMM 是一个无编码器(Encoder-Free)的统一多模态模型,同时处理图像与视频的理解和生成任务。传统方案通常依赖独立的视觉编码器(如 CLIP、SigLIP)把图像转成特征,再交给大语言模型或扩散模型处理,导致理解与生成两条链路割裂、参数量大、部署复杂。PixelUMM 的核心思路是去掉独立视觉编码器,让模型直接在像素层面统一建模,用一套架构完成看图、看视频、生成图像和生成视频。这样既减少了模块间的对齐成本,也让理解和生成共享同一套表示,理论上更利于跨任务迁移。项目用 Python 实现,属于早期研究型开源模型,星标约 151,适合关注统一多模态架构、想复现或二次开发的研究者。它解决的是多模态系统中编码器冗余、理解与生成难以统一的问题,核心能力包括统一图像视频理解、统一图像视频生成、无编码器像素级建模。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 151
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类开源模型
开发团队nv-tlabs
所属国家
定价模式free
价格说明开源模型权重,免费使用
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 151
30天Star增速
HF 下载量
上线时间2026-09-04 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-06
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 去掉独立视觉编码器,理解与生成共用一套像素级表示,架构更统一
  • 同时覆盖图像和视频的理解与生成四类任务,不是只做单一方向
  • Python 实现,便于研究者在统一多模态方向上复现和二次开发

不足之处

  • 早期项目,星标约 151,社区规模和生态尚小
  • 无编码器路线在视频长序列上的计算与效果仍需更多验证

适用场景

  • 研究统一多模态架构,对比有编码器方案的效果差异
  • 需要同一模型同时做图像/视频理解与生成的实验场景
  • 作为无编码器多模态方向的复现与二次开发基线

替代项目

Chameleon、Emu3、Show-o

项目介绍

PixelUMM 是开源模型领域的开源项目,由 nv-tlabs 开发,是 2026 年新上线的项目。

它收录于开源模型分类,该分类目前共有 430 个项目,GitHub 星标数为 151。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。开源模型权重,免费使用。

它主要面向的使用场景是:研究统一多模态架构,对比有编码器方案的效果差异。同类可对比的替代方案包括 Chameleon、Emu3、Show-o。

上一篇:Spark-X2.5

下一篇:HongLabLLM

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1878 2026-08-10