ds-vision-skill

给纯文本模型装上眼睛,图片问答不求人

ds-vision-skill 是一个为纯文本大模型补上视觉能力的技能套件,主要面向 DeepSeek 等不具备原生多模态输入能力的模型。它通过一套可复用的技能流程,把图片理解、描述、OCR 等视觉任务拆解为文本模型可执行的步骤,让原本只能处理文字的模型也能“看图说话”。项目用 PowerShell 编写,适合在 Windows 环境下快速接入,无需改动模型本身即可扩展图像能力。核心价值在于降低多模态能力的接入门槛,让开发者用现有文本模型完成图片问答、内容提取等任务,而不必切换到昂贵的多模态模型。对于想低成本验证视觉场景、或在本地/私有环境里给文本模型加视觉外挂的团队,这是一个轻量、可组合的起点。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 164
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类计算机视觉
开发团队Sorwcyra
所属国家
官网地址
定价模式free
价格说明开源免费
访问状态
是否开源是
开源协议MIT
主要语言PowerShell
技术栈/模型
GitHub 星标★ 164
30天Star增速
HF 下载量
上线时间2026-08-01 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 用 PowerShell 实现,Windows 环境零依赖快速跑通
  • 把视觉任务拆成文本模型可执行的技能步骤,不改模型即可扩展
  • 面向 DeepSeek 等文本模型,降低多模态接入成本

不足之处

  • 仅支持 PowerShell,跨平台与 Linux 部署受限
  • 早期项目,技能覆盖面和稳定性待更多验证

适用场景

  • 给 DeepSeek 等文本模型加图片问答能力
  • 本地/私有环境做图片内容提取与 OCR 辅助
  • 低成本验证多模态场景,避免直接换多模态模型

替代项目

LLaVA、MiniGPT-4

项目介绍

ds-vision-skill 是计算机视觉领域的开源项目,由 Sorwcyra 开发,是 2026 年新上线的项目。

它收录于计算机视觉分类,该分类目前共有 492 个项目,GitHub 星标数为 164。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费。

它主要面向的使用场景是:给DeepSeek等文本模型加图片问答能力。同类可对比的替代方案包括 LLaVA、MiniGPT-4。

上一篇:Altbot

下一篇:没有了!

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4139 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 91081 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1433 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2049 2026-08-14