agent-vision-toolkit

给纯文本模型装眼睛,粘贴图片就能看懂界面和截图

agent-vision-toolkit 是一个为纯文本大模型补上视觉能力的开源工具箱,核心解决 Claude Code、Codex、OpenCode 等编码智能体只能读文字、无法直接看图的痛点。它提供多图理解、图片问答、长截图 OCR、前端 UI 还原和 GUI 自动化等技能,让原本不支持视觉的模型也能处理截图、设计稿和界面元素。项目以 Python 编写,可无缝接入多个主流 agent 框架,用户直接粘贴图片即可触发识别流程,无需切换工具或手动转文字。对做前端还原、自动化测试、文档截图分析的开发者来说,它相当于给文本模型外挂了一双眼睛,把视觉任务转化为模型可消费的结构化信息,从而扩展智能体的实际可用边界。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1217
维护状态 活跃
是否开源 是
定价模式 unknown

项目预览

项目数据

分类智能体
开发团队Anionex
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agent,agent-skills,claude-code,codex,computer-use,deepseek,dsh-plugin,glm,harness-engineering,multimodal,opencode,text-only-llm,vision,vision-language-model
GitHub 星标★ 1217
30天Star增速
HF 下载量
上线时间2026-08-01 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Python 3.11+(glance 仅需此项)
  • 准备一个支持 OpenAI Chat Completions / Responses 或 Anthropic Messages 的多模态 API(含 base
  • 使用 ground/detect/crop 及长截图 OCR 需额外安装 pillow
  • 使用 trace 需 pillow + numpy(仅 --outline 回退时需要 vtracer)
  • Node.js/npx(用 npx skills 安装 skill 时需要,也可手动拷贝 skills 目录)

安装与启动步骤

  1. 1写入视觉 API 配置

    在本机配置目录创建 env 文件,写入三个必填变量并存为仅本人可读(chmod 600)。

    mkdir -p ~/.config/agent-vision-toolkit && printf 'VISION_API_KEY=sk-xxxxxxxx
    VISION_BASE_URL=https://openrouter.ai/api/v1
    VISION_MODEL=google/gemini-3.6-flash
    ' > ~/.config/agent-vision-toolkit/env && chmod 600 ~/.config/agent-vision-toolkit/env
  2. 2克隆仓库并加入 PATH

    把仓库拉到本地,将 bin 目录加入 PATH 以便直接调用 CLI;写入 shell 配置文件才能持久生效。

    git clone https://github.com/Anionex/agent-vision-toolkit.git
    export PATH="$PWD/agent-vision-toolkit/bin:$PATH"
  3. 3按需装可选依赖

    仅为你实际使用的工具在隔离的 venv 中安装依赖:pillow 供 ground/detect/crop 与长截图 OCR,numpy 供 trace。

    python3 -m venv .venv && .venv/bin/pip install pillow numpy
  4. 4安装 vision-skills 技能

    让智能体知道这些工具存在及如何组合使用;也可把 skills/vision-skills/ 拷进智能体技能目录(如 ~/.codex/skills/)。

    npx skills add Anionex/agent-vision-toolkit --skill vision-skills -a codex -g --copy -y
  5. 5重启智能体并粘贴图片

    安装可选集成后重启智能体,直接粘贴图片或让模型调用其内置图片工具触发识别。

关键配置

配置项必填说明示例
VISION_API_KEY是多模态模型的 API 密钥sk-xxxxxxxx
VISION_BASE_URL是服务商 API 基础地址,要含 /v1 但不带 /messages 等协议端点https://openrouter.ai/api/v1
VISION_MODEL是多模态模型名称google/gemini-3.6-flash
LANG否视觉模型输出语言,zh 为中文(默认)、en 为英文zh
VISION_API_PROTOCOL否Python 客户端/代理协议:chat_completions(默认)、responses 或 anthropicanthropic
VISION_UPSTREAM_PROXY否上游代理地址,经 CONNECT 隧道转发;代理不支持认证http://127.0.0.1:7890

如何确认成功

重启智能体后粘贴一张图片,或让模型调用内置图片工具,能得到图片描述或识别结果即成功。

常见问题

Q:支持哪些视觉 API 接口?

A:任意兼容 OpenAI Chat Completions 且支持 image_url 的端点均可;也可用 /responses(设 VISION_API_PROTOCOL=responses)或 Anthropic Messages(base URL 以 /v1 结尾)。

Q:可以不装代理集成层吗?

A:可以。只装 CLI 加 skill 即可使用;无缝代理或原生扩展属于可选集成,Pi、Oh My Pi、OpenCode 使用单文件原生扩展而非代理。

Q:支持哪些编码智能体?

A:Codex、Claude Code、Pi、Oh My Pi、OpenCode。把安装说明发给当前智能体即可让它自行完成安装与配置。

Q:Anthropic 模式返回 HTTP 400 怎么办?

A:先把 VISION_ANTHROPIC_THINKING 恢复为默认的 omit,它不发送 thinking 字段、兼容性最好;仅当模型明确支持时再用 disabled 或 adaptive。

注意事项

  • 配置文件含密钥,务必保持 chmod 600 权限。
  • 代理默认直连上游、不读 Windows 系统代理,显式代理需用 --upstream-proxy 或 VISION_UPSTREAM_PROXY。
  • 代理路由按连接成功情况切换,全部失败时返回 502 并列出各路由失败原因。
  • Pi 与 OpenCode 原生扩展使用各自设置,目前只调用 /chat/completions。

核心亮点

  • 支持多图理解与图片问答,粘贴即用,降低文本模型接入视觉的门槛
  • 覆盖长截图 OCR、前端 UI 还原、GUI 自动化等具体场景,不是泛泛的视觉封装
  • 可无缝接入 Codex、Claude Code、OpenCode 等多个主流 agent,复用现有工作流

不足之处

  • 项目仍处成长阶段,文档和示例的完整度有待观察
  • 作为视觉代理层,实际识别效果依赖底层模型与外部视觉服务,稳定性需自行验证

适用场景

  • 前端开发者把设计稿截图粘贴给编码 agent,自动生成对应 UI 代码
  • 测试或运维人员用长截图 OCR 快速提取日志、报错信息并交给 agent 分析
  • GUI 自动化场景中让文本模型识别界面元素,完成点击、填表等操作

替代项目

microsoft/OmniParser、OpenAdaptAI/OpenAdapt

项目介绍

agent-vision-toolkit 是智能体领域的开源项目,由 Anionex 开发,是 2026 年新上线的项目。

在全站 13,821 个收录项目中,它的 GitHub 星标数(1,217)位列前 30%,在智能体分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。

它主要面向的使用场景是:前端开发者把设计稿截图粘贴给编码agent,自动生成对应UI代码。同类可对比的替代方案包括 microsoft/OmniParser、OpenAdaptAI/OpenAdapt。

上一篇:answer-me-with-html

下一篇:huuuuuuho-skills

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 210 2026-08-09
goutoujunshi 开源

先哄情绪再出招,恋爱难题给可执行方案

一个先接住情绪、再分析关系并给出可执行策略的 Codex 恋爱军师,内置心理、法律、社会、人···

★ 7094 2026-09-25
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 244524 2026-08-15
ECC 开源

调教你的 AI 编程搭子,让它越用越顺手

The agent harness performance optimization system. Skills, instincts, memory, securi···

★ 274147 2026-08-09