Janus

一个模型搞定看图说话和画图,多模态全能选手

Janus 是一个统一的多模态理解与生成模型系列,由 DeepSeek 团队开源。它解决了传统模型将视觉编码与文本生成割裂的问题,通过解耦视觉编码路径,在同一 Transformer 架构内同时支持图像理解和图像生成任务。其核心能力包括高保真的文本到图像生成、精准的图像描述与视觉问答,以及多模态对话。Janus 采用创新的自回归框架,在保持生成质量的同时,显著提升了多模态理解的准确性。该系列提供不同参数规模的模型,如 Janus-Pro-1B 和 Janus-Pro-7B,兼顾研究探索与实用部署。项目代码基于 Python 和 PyTorch 实现,提供了完整的推理与训练示例,适合开发者快速上手。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 17765
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队deepseek-ai
所属国家
官网地址
定价模式free
价格说明开源模型,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型any-to-any,foundation-models,llm,multimodal,unified-model,vision-language-pretraining
GitHub 星标★ 17765
30天Star增速
HF 下载量
上线时间2024-10-18 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 7 步

环境要求

  • Python >= 3.8
  • PyTorch 环境(用于加载模型)
  • 可访问 GitHub 与 Hugging Face 下载模型权重
  • 建议具备 GPU 与足够显存(README 节选未给出具体硬件门槛)

安装与启动步骤

  1. 1检查 Python 版本

    确认本机 Python 版本不低于 3.8,否则后续 pip install -e . 可能失败。

    python --version
  2. 2克隆项目代码

    从官方 GitHub 仓库拉取 Janus 源码,并进入项目根目录。

    git clone https://github.com/deepseek-ai/Janus.git
    cd Janus
  3. 3安装项目依赖

    在项目根目录执行可编辑安装,安装 README 要求的必要依赖。

    pip install -e .
  4. 4补充生成依赖

    如需使用图像生成能力,README 要求额外安装 diffusers 相关依赖。

    pip install diffusers[torch]
  5. 5下载模型权重

    按 README 的 Model Download 章节从 Hugging Face deepseek-ai 组织下载 Janus-Pro 系列权重,节选未给出具体下载命令。

  6. 6运行推理代码

    按 README 示例准备输入、调用 prepare_inputs_embeds 与 language_model.generate,并解码输出。

  7. 7确认输出结果

    运行后控制台应打印出 sft_format 提示内容与模型返回的 answer 文本,且过程无报错。

关键配置

配置项必填说明示例
max_new_tokens否控制生成的最大新 token 数量,示例中为 512。512
do_sample否是否采样生成,示例中使用 False 表示贪婪解码。False
use_cache否是否启用 KV 缓存以加速自回归生成。True
pad_token_id否填充 token 的 id,示例中设为 tokenizer.eos_token_id。tokenizer.eos_token_id
bos_token_id否起始 token 的 id,示例中取自 tokenizer。tokenizer.bos_token_id
eos_token_id否结束 token 的 id,示例中取自 tokenizer。tokenizer.eos_token_id

如何确认成功

运行 README 的生成代码后,控制台打印出模型回答文本且无报错,即表示环境与模型加载成功。

常见问题

Q:安装依赖时应该用哪条命令?

A:README 要求在 Python >= 3.8 环境下执行 pip install -e .,图像生成还需 pip install diffusers[torch]。

Q:怎么使用图像生成功能?

A:在完成 pip install -e . 后额外执行 pip install diffusers[torch],再按 README 的生成示例调用模型。

Q:模型权重在哪里下载?

A:README 有 Model Download 章节,权重发布在 Hugging Face 的 deepseek-ai 组织下,节选未给出具体下载命令。

Q:可以不做本地部署直接体验吗?

A:可以,README 提供了 Janus-Pro-7B、Janus-1.3B、JanusFlow-1.3B 的 Hugging Face Space 在线 Demo。

Q:需要什么硬件?

A:README 节选未给出具体硬件要求,建议参考官方仓库说明,并使用 GPU 环境运行推理。

注意事项

  • README 节选仅给出 Python >= 3.8 与两条 pip 安装命令,其他命令请以官方仓库为准。
  • 模型权重体积较大,下载前请确认磁盘空间与网络环境。
  • 示例推理代码需要自行补全前置的模型与 tokenizer 加载、输入预处理逻辑。
  • 代码与模型分别适用不同许可证(LICENSE-CODE 与 LICENSE-MODEL),使用前请确认合规。

核心亮点

  • 视觉编码解耦设计,理解与生成互不干扰,性能更优
  • 提供 1B 和 7B 多尺寸模型,灵活适配不同算力场景
  • 开源代码完整,含推理和训练脚本,二次开发门槛低

不足之处

  • 模型参数量相对较大,端侧部署有挑战
  • 文档/社区待观察

适用场景

  • 多模态聊天机器人,同时理解图片并生成图像回复
  • 创意设计辅助,根据文字描述生成配图并理解用户上传的草图
  • 视觉内容分析,对图片进行描述、问答和内容再创作

替代项目

LLaVA、Qwen-VL、CogVLM

项目介绍

Janus 是开源模型领域的开源项目,由 deepseek-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(17,765)位列前 3%,在开源模型分类的 424 个项目里位列前 3%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:多模态聊天机器人,同时理解图片并生成图像回复。同类可对比的替代方案包括 LLaVA、Qwen-VL、CogVLM。

上一篇:Chinese-LLaMA-Alpaca

下一篇:kubesphere

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
awesome-ltx2 开源

找齐 LTX-2 模型、工作流和 LoRA,一键上手视频生成。

All available LTX-2 models, encoders, workflows, LoRAs for ComfyUI

★ 593 2026-08-10