ds-vision-skill 是计算机视觉领域的开源项目,由 Sorwcyra 开发,是 2026 年新上线的项目。
它收录于计算机视觉分类,该分类目前共有 492 个项目,GitHub 星标数为 164。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费。
它主要面向的使用场景是:给DeepSeek等文本模型加图片问答能力。同类可对比的替代方案包括 LLaVA、MiniGPT-4。

给纯文本模型装上眼睛,图片问答不求人
ds-vision-skill 是一个为纯文本大模型补上视觉能力的技能套件,主要面向 DeepSeek 等不具备原生多模态输入能力的模型。它通过一套可复用的技能流程,把图片理解、描述、OCR 等视觉任务拆解为文本模型可执行的步骤,让原本只能处理文字的模型也能“看图说话”。项目用 PowerShell 编写,适合在 Windows 环境下快速接入,无需改动模型本身即可扩展图像能力。核心价值在于降低多模态能力的接入门槛,让开发者用现有文本模型完成图片问答、内容提取等任务,而不必切换到昂贵的多模态模型。对于想低成本验证视觉场景、或在本地/私有环境里给文本模型加视觉外挂的团队,这是一个轻量、可组合的起点。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
LLaVA、MiniGPT-4
ds-vision-skill 是计算机视觉领域的开源项目,由 Sorwcyra 开发,是 2026 年新上线的项目。
它收录于计算机视觉分类,该分类目前共有 492 个项目,GitHub 星标数为 164。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费。
它主要面向的使用场景是:给DeepSeek等文本模型加图片问答能力。同类可对比的替代方案包括 LLaVA、MiniGPT-4。
上一篇:Altbot
下一篇:没有了!
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3