
modlens
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
modlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文本模型无法直接处理图像的问题,用户只需粘贴图片,modlens 即可通过 OCR、版面分析和语义理解,输出结构化的 JSON 证据,供代理进行后续推理和决策。核心能力包括:高精度 OCR 文本提取、版面结构解析、图像语义理解,以及无缝集成到 agent-skills、claude-code、codex 等主流编码代理框架中。项目基于 TypeScript 开发,采用 harness-engineering 理念,强调插件化、轻量级和易用性,使纯文本模型无需额外训练即可获得视觉认知,显著扩展了其应用场景。
开源
unknown
计算机视觉
GitHub 星标
★ 3090
维护状态
活跃
是否开源
是
定价模式
unknown
项目数据
分类计算机视觉
开发团队liustack
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型agent-skills,claude-code,claude-skills,codex,cordis,deepseek,dsh,dsh-plugin,glm,harness,harness-engineering,hermes-agent,image-to-text,multimodal,ocr,openclaw,pi-agent,text-only-llm,vision,vision-transformer
GitHub 星标★ 3090
30天Star增速
HF 下载量
上线时间2026-02-22 00:00:00
最近更新2026-08-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-19
浏览次数1
核心亮点
- 直接为 DeepSeek/GLM 等纯文本模型补充视觉能力,无需重新训练,集成成本低
- 输出结构化 JSON(OCR、版面、语义),方便下游代理程序化处理,而非简单文本描述
- 兼容多种主流代理框架(claude-code、codex 等),插件化设计易于扩展和定制
不足之处
- 依赖外部视觉模型或 API,可能增加额外调用延迟和成本
- 文档/社区待观察
适用场景
- 在编码代理中处理 UI 截图、设计稿,自动提取界面元素和文本
- 对文档扫描件、PDF 截图进行 OCR 和版面分析,辅助数据录入
- 为纯文本聊天机器人提供图像理解能力,实现多模态对话
替代项目
LLaVA、CogVLM、Qwen-VL
项目介绍
上一篇:DEIMv2
下一篇:没有了!
同类项目推荐
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3
geti
开源
少数据快训练,轻松搞定计算机视觉模型
Build computer vision models in a fraction of the time and with less data.
fsdl-text-recognizer-2022-labs
开源
跟着课程撸一个能跑的文本识别全流程项目
Complete deep learning project developed in Full Stack Deep Learning, 2022 edition. ···