modlens

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

modlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文本模型无法直接处理图像的问题,用户只需粘贴图片,modlens 即可通过 OCR、版面分析和语义理解,输出结构化的 JSON 证据,供代理进行后续推理和决策。核心能力包括:高精度 OCR 文本提取、版面结构解析、图像语义理解,以及无缝集成到 agent-skills、claude-code、codex 等主流编码代理框架中。项目基于 TypeScript 开发,采用 harness-engineering 理念,强调插件化、轻量级和易用性,使纯文本模型无需额外训练即可获得视觉认知,显著扩展了其应用场景。

开源 unknown 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4071
维护状态 活跃
是否开源 是
定价模式 unknown

项目预览

项目数据

分类计算机视觉
开发团队liustack
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型agent-skills,claude-code,claude-skills,codex,cordis,deepseek,dsh,dsh-plugin,glm,harness,harness-engineering,hermes-agent,image-to-text,multimodal,ocr,openclaw,pi-agent,text-only-llm,vision,vision-transformer
GitHub 星标★ 4071
30天Star增速
HF 下载量
上线时间2026-02-22 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-19
浏览次数22

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:命令行工具 6 步

环境要求

  • 已安装 Node.js(可用 npx 命令)
  • 一个支持 skills 的编码代理环境(如 DeepSeek Harness、Claude Code、Codex 等)
  • 可选:免费的 Gemini API Key,或其他 OpenAI 兼容平台的 Key
  • 可选:Antigravity CLI(不想注册任何账号时使用)

安装与启动步骤

  1. 1安装 modlens 技能

    用 skills.sh 把 modlens 技能装到用户级别(--global),安装后该技能对所有项目生效,无需手动 clone。

    npx -y skills add liustack/modlens --skill modlens --global
  2. 2重启代理

    安装完成后必须重启你使用的编码代理(harness),让新技能被加载识别。

  3. 3配置并健康检查

    重启后让 AI 按官方 INSTALL.md 完成配置并执行健康检查;它会先检测本机已有的登录环境。

  4. 4配置免费视觉引擎

    仅当健康检查结果为空时需要:推荐去 Google AI Studio 申请免费 Gemini API Key,约三分钟且无需信用卡,配置后每次读图约 5-10 秒。

  5. 5或用 Antigravity CLI

    不想注册任何账号时,改为安装 Antigravity CLI 并登录一次作为视觉引擎,登录后即可退出。

    curl -fsSL https://antigravity.google/cli/install.sh | bash
    agy
  6. 6粘贴图片使用

    直接在对话中粘贴图片或给出路径并提问,技能会自动触发把图片送往视觉引擎,回答基于实际读到的内容。

关键配置

配置项必填说明示例
Gemini API Key否推荐的免费视觉引擎凭据,缺失且健康检查为空时才需要配置AIzaSyxxxxxxxxxxxxxxxx
Settings → Plugins → Plugin config 中的 Mo否DeepSeek Harness 图形界面入口,可在此切换引擎、勾选 auto 模式可复用的本地 CLI引擎切换 / 勾选 Codex、OpenCode、Pi

如何确认成功

向 AI 索要健康检查结果,能看到可用视觉引擎即配置成功;再粘贴一张图片提问,回答确实基于图中内容。

常见问题

Q:健康检查结果为空怎么办?

A:说明没找到可用视觉引擎。配置一个免费的 Gemini API Key(Google AI Studio 获取,无需信用卡),或安装 Antigravity CLI 登录,然后重新跑健康检查。

Q:需要先把图片保存成文件再传路径吗?

A:不需要。ModLens 直接读取粘贴进对话的图片,无需存盘再传路径。

Q:会偷偷用我已有的 Claude Code / Codex 登录吗?

A:不会。它会先询问是否允许复用,逐个 harness 确认;被复用的读取会标明消耗了谁的配额。

Q:同一张图再问一次要重新粘贴吗?

A:不用。粘贴一次后,基于同一张图的后续提问无需重复粘贴。

注意事项

  • DeepSeek 旗舰对话模型和 GLM-5.3 本身是纯文本,无法直接读图,必须搭配 ModLens 提供的视觉引擎。
  • 除了命令行安装,DeepSeek Harness 还能在 Settings → Plugins → Plugin config 的 ModLens 卡片里图形化配置。
  • 也可以把安装整件事交给 AI:让它按官方 INSTALL.md 安装配置并回报健康检查结果。
  • 未配置任何引擎时无法读图,务必以健康检查结果为准,不要凭安装成功就认为可用。

核心亮点

  • 直接为 DeepSeek/GLM 等纯文本模型补充视觉能力,无需重新训练,集成成本低
  • 输出结构化 JSON(OCR、版面、语义),方便下游代理程序化处理,而非简单文本描述
  • 兼容多种主流代理框架(claude-code、codex 等),插件化设计易于扩展和定制

不足之处

  • 依赖外部视觉模型或 API,可能增加额外调用延迟和成本
  • 文档/社区待观察

适用场景

  • 在编码代理中处理 UI 截图、设计稿,自动提取界面元素和文本
  • 对文档扫描件、PDF 截图进行 OCR 和版面分析,辅助数据录入
  • 为纯文本聊天机器人提供图像理解能力,实现多模态对话

替代项目

LLaVA、CogVLM、Qwen-VL

项目介绍

modlens 是计算机视觉领域的开源项目,由 liustack 开发,是 2026 年新上线的项目。

在全站 13,591 个收录项目中,它的 GitHub 星标数(4,071)位列前 10%,在计算机视觉分类的 485 个项目里位列前 10%。

近 42 天,它的 GitHub 星标从 3,090 增加到 4,071,净增 981。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。从国内网络环境看,访问稳定性一般,建议自备网络条件。

它主要面向的使用场景是:在编码代理中处理UI截图、设计稿,自动提取界面元素和文本。同类可对比的替代方案包括 LLaVA、CogVLM、Qwen-VL。

上一篇:DEIMv2

下一篇:OpenCVTutorials

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4071 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 91039 2026-08-10
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2049 2026-08-14
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1431 2026-08-20