vision
本站收录 34 个带「vision」标签的 AI 开源项目
LibreChatLibreChat 是一个开源的增强版 ChatGPT 式对话平台,面向希望自建 AI 聊天服务的团队和个人。它解决的核心问题是:官方 ChatGPT 无法私有★ 45,163
LibreChatLibreChat 是一个开源的 ChatGPT 克隆增强版,旨在提供一个功能全面、可自托管的 AI 对话平台,解决用户对数据隐私、模型选择自由和扩展性的需求。★ 45,122
UI-TARS-desktopUI-TARS-desktop 是字节跳动开源的多模态 AI Agent 桌面栈,目标是把前沿视觉语言模型与 Agent 基础设施打通,让 AI 能像人一样操作★ 39,158
skyvernSkyvern 是一个基于 AI 的浏览器自动化工具,旨在替代传统脆弱的脚本化网页操作。它利用大语言模型和计算机视觉,将自然语言描述的任务(如表单填写、数据抓取★ 23,092
modlensmodlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文★ 4,071
SimpleMemSimpleMem 是一个为大型语言模型(LLM)智能体设计的终身记忆模块,旨在解决智能体在长期交互中遗忘历史信息、缺乏持续学习能力的问题。它通过高效的记忆存储★ 3,819
Torch-PruningTorch-Pruning 是一个基于 PyTorch 的结构化剪枝工具库,核心实现 CVPR 2023 论文 DepGraph(依赖图)算法,旨在解决传统剪枝★ 3,358
ha-llmvisionha-llmvision 是一个将视觉语言模型(VLM)集成到 Home Assistant 的开源项目,旨在为家庭自动化系统赋予视觉理解能力。它解决了传统智能★ 1,479
dsh-vision-routerdsh-vision-router 是给纯文本 DeepSeek Harness(dsh)智能体装上"眼睛"的插件。dsh 这类 agent 本身只能处理文字,★ 1,121
caercaer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它整合了图像处理、数据增强、模型训练与评估等常用功能,提★ 818
design2codedesign2code 是一个将网页设计截图自动转换为干净 HTML/CSS 代码的开源工具。它解决了前端开发中从设计稿到代码的重复劳动问题,帮助设计师和开发者★ 682
LLaVA-MiniLLaVA-Mini 是一个统一的大规模多模态模型(LMM),旨在高效处理图像、高分辨率图像和视频的理解任务。它解决了传统多模态模型在处理高分辨率图像和视频时计★ 576
photonvisionPhotonVision 是面向 FIRST 机器人竞赛(FRC)的开源计算机视觉方案,用 Java 编写,基于 OpenCV 和 WPILib 生态。它解决的★ 432
potatopotato 是一个轻量级、可移植的数据标注工具,旨在为 AI 研究和开发提供灵活高效的标注解决方案。它解决了传统标注工具部署复杂、难以定制、难以适应多模态数据★ 425
Stream-OmniStream-Omni 是一个类似 GPT-4o 的多模态对话助手,能够同时处理文本、语音和视觉输入,并支持多种模态组合的交互。它解决了传统对话系统只能处理单一★ 392
World-SimulatorWorld-Simulator 是一个围绕“模拟真实世界”主题的学术资源聚合项目,收录了 IEEE TPAMI 2026 论文《Simulating the R★ 391
VectorDB-PluginVectorDB-Plugin 是一个开源的本地文档问答工具,允许用户直接对本地文档、音频和视频文件提问。它解决了传统搜索只能返回相关片段、无法直接给出答案的问★ 370
ChatGPT-OpenAI-Smart-Speaker这是一个基于Python的开源AI智能音箱项目,旨在将普通音箱升级为支持语音和视觉交互的智能助手。它利用OpenAI的GPT-4模型,结合语音识别(STT)、文★ 316
LRV-InstructionLRV-Instruction 是一个用于缓解大型多模态模型(LMM)幻觉问题的开源项目,其核心方法是通过鲁棒的指令微调来提升模型对视觉内容的忠实度。项目针对当★ 297
oximediaOxiMedia 是一个用纯 Rust 编写的开源多媒体处理框架,目标是重建 FFmpeg 与 OpenCV 的能力并统一到一个内存安全的库中。它解决的核心问题★ 260
TextGrabber2TextGrabber2 是一款 macOS 菜单栏小工具,主打“复制即操作”的 OCR 体验。它常驻菜单栏,用户截取或复制图片后,可直接从图片中提取文字,省去★ 240
vigenairvigenair是一个基于生成式AI的视频广告重制工具,旨在帮助营销人员和内容创作者快速将现有视频素材转化为高质量、多样化的广告变体。它利用Google Clo★ 235
rusty_artrusty_art 是一个用 Rust 语言进行创意编程和视觉错觉艺术创作的开源项目。它旨在为开发者提供一套简洁、高效的 API,通过代码生成令人惊叹的视觉图案★ 219
unitxtUnitxt 是一个面向企业级 AI 性能评估的 Python 库,提供全球最大的工具和数据目录,用于端到端的 AI 基准测试。它解决了 AI 评估流程中数据准★ 216
best-llm-finder-pipeline这是一个用于寻找最佳大语言模型(LLM)的自动化流水线项目,基于Agentic RAG、多智能体系统和视觉推理三种技术路线构建。它解决的是在众多LLM中如何高效★ 143
SwiftyCrowSwiftyCrow 是一款完全在设备端运行的 macOS 屏幕翻译工具,面向需要跨语言阅读的用户。它通过 ScreenCaptureKit 截取屏幕上任意区域★ 107
openrouter-mcp-multimodal这是一个基于 Model Context Protocol (MCP) 的服务器,用于连接 OpenRouter 平台,让 Claude Desktop、Cur★ 92
achatbotachatbot 是一个开源的聊天机器人架构,专为语音、视觉及多模态助手设计,支持本地(CPU/GPU 受限)和远程(I/O 受限)运行。它整合了 ASR(语音★ 90
Awesome-AVIAwesome-AVI 是一个关于音频-视觉智能(Audio-Visual Intelligence)的精选资源列表,旨在系统梳理该领域的前沿研究、工具和数据集★ 90
FlowVisionFlowVision 是一款基于 Electron 和 React 的桌面应用,旨在帮助开发者快速理解陌生代码库。它通过一键分析项目代码,自动生成架构流程图,并★ 88
mere-runmere-run 是一个面向 Apple Silicon 设备的本地生成式 AI 工作流引擎,用 Swift 编写,基于 MLX 框架。它解决了在 Mac 上统★ 78
annolidannolid 是一个基于实例分割的多目标跟踪与行为分析工具包,主要面向动物行为研究领域。它解决了研究人员在视频分析中手动标注耗时、难以追踪个体和提取行为特征的★ 59
DelphiGeminiDelphiGemini 是一个面向 Delphi 开发者的 Google Gemini API 封装库,旨在让 Pascal 语言生态能够便捷地接入 Gemi★ 51