DeepSeek-VL

看懂图片并回答问题的开源多模态大模型

DeepSeek-VL 是深度求索推出的开源视觉语言模型,旨在弥合真实世界视觉理解与语言模型之间的鸿沟。它解决的是多模态理解问题,即让模型能同时处理图像和文本,完成看图问答、图像描述、文档解析等任务。核心能力包括:采用创新的视觉编码器与语言模型对齐策略,支持高分辨率图像输入,能捕捉细粒度视觉细节;在多项公开基准上达到或超越同类主流模型,同时保持高效推理。项目提供完整的训练、微调和推理代码,以及模型权重,便于研究者和开发者直接使用或二次开发。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4182
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队deepseek-ai
所属国家
官网地址
定价模式free
价格说明开源模型,MIT许可证,可免费自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型foundation-models,vision-language-model,vision-language-pretraining
GitHub 星标★ 4182
30天Star增速
HF 下载量
上线时间2024-03-07 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 7 步

环境要求

  • Python >= 3.8
  • 已安装 pip(用于执行 pip install -e .)
  • 按 README 的 Model Download 章节下载好模型权重

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 DeepSeek-VL 源码,pip install -e . 需要在仓库根目录执行。

    git clone https://github.com/deepseek-ai/DeepSeek-VL.git
  2. 2进入仓库目录

    切换到克隆下来的 DeepSeek-VL 目录,后续安装命令都在这里执行。

    cd DeepSeek-VL
  3. 3确认 Python 版本

    README 要求在 Python >= 3.8 的环境下操作,版本过低请先升级。

    python --version
  4. 4安装项目依赖

    在仓库根目录以可编辑模式安装依赖,README 明确给出的唯一安装命令。

    pip install -e .
  5. 5准备模型权重

    按 README 的 Model Download 章节获取权重;README 未给出具体下载命令,请以官方页面指引为准。

  6. 6编写推理脚本

    参考 README Quick Start 的示例代码,加载模型与 tokenizer,调用 prepare_inputs_embeds 得到图像嵌入。

  7. 7运行模型生成回答

    用 language_model.generate 生成结果,并用 tokenizer.decode 解码后打印。

关键配置

配置项必填说明示例
max_new_tokens单次生成的最大新 token 数512
do_sample是否启用采样;False 为确定性输出False
use_cache是否启用 KV 缓存以加速生成True

如何确认成功

脚本成功打印出 sft_format 对应的提问与 answer 回答文本,即表示模型加载与推理正常。

常见问题

Q:pip install -e . 报错怎么办?

A:先确认 Python >= 3.8,并确保命令是在克隆下来的 DeepSeek-VL 仓库根目录执行(存在 setup.py/pyproject.toml 的那一层)。

Q:模型权重在哪里下载?

A:README 顶部提供 Model Download 章节入口,并给出 HuggingFace 官方页面(deepseek-ai),请从该章节和官方页面获取权重。

Q:有不用本地部署的体验方式吗?

A:README 中提供了 HuggingFace Space 在线 Demo 链接(deepseek-ai/DeepSeek-VL-7B),可直接在浏览器中试用。

Q:生成的回答里带特殊符号怎么办?

A:解码时使用 skip_special_tokens=True,示例代码已这样设置,可过滤掉特殊 token。

注意事项

  • README 只给出 pip install -e . 这一条安装命令,未提供 Docker 或 conda 方式,不要自行替换。
  • 推理代码需要先完成模型权重加载,显存要求 README 未给出,请以官方页面说明为准。
  • 项目包含代码许可证 LICENSE-CODE 与模型许可证 LICENSE-MODEL,商用前请分别阅读。

核心亮点

  • 视觉编码器与语言模型深度对齐,细粒度理解能力强
  • 支持高分辨率图像输入,细节捕捉更准确
  • 提供完整训练和推理代码,便于二次开发

不足之处

  • 模型参数量较大,部署资源要求高
  • 文档/社区待观察

适用场景

  • 图像问答与对话
  • 文档图像内容提取
  • 多模态研究基准测试

替代项目

LLaVA、Qwen-VL、InternVL

项目介绍

DeepSeek-VL 是开源模型领域的开源项目,由 deepseek-ai 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,182)位列前 10%,在开源模型分类的 422 个项目里位列前 14%。

近 42 天,它的 GitHub 星标从 4,159 增加到 4,182,净增 23。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,可免费自行部署使用。

它主要面向的使用场景是:图像问答与对话。同类可对比的替代方案包括 LLaVA、Qwen-VL、InternVL。

上一篇:TabPFN

下一篇:LimiX

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10