multimodal-ai

本站收录 23 个带「multimodal-ai」标签的 AI 开源项目

Duix-Avatar真正开源的 AI 数字人工具包,支持离线视频生成与数字人克隆,让开发者无需依赖云端即可打造专属数字分身,是数字人领域的高人气开源方案。★ 15,608video-search-and-summarization这是NVIDIA推出的视频搜索与摘要参考架构(VSS Blueprint),旨在帮助开发者快速构建GPU加速的视频分析智能体。它解决了传统视频分析中检索效率低、★ 1,884OpenGUIOpenGUI 是一个面向 Android 的 GUI 智能体框架,旨在让 AI 像人一样“看、想、操作”手机应用。它通过无障碍服务(Accessibility★ 1,811vllm-mlxvllm-mlx 是一个专为 Apple Silicon 芯片设计的开源推理服务器,兼容 OpenAI 和 Anthropic API 协议。它解决了在 Mac★ 1,607awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324xiaoyaosearch小遥搜索(XiaoyaoSearch)能听懂你的话、看懂你的图,用 AI 帮你找到本地任何文件,让搜索像聊天一样简单自然。它融合多模态理解与本地检索,是个人文件★ 1,090opendroidopendroid 是一个开源的自主 Android 智能体项目,旨在通过本地或远程大语言模型(LLM)驱动,实现屏幕自动化操作。它利用 Android 无障碍★ 1,081vectordb-recipesvectordb-recipes 是一个围绕向量数据库和 LLM 的多模态 AI、RAG 与智能体应用示例与教程集合。它旨在解决开发者在使用向量检索构建实际 A★ 976OmniShowOmniShow 是字节跳动推出的统一视频生成模型,专注于人-物交互(HOI)视频生成,论文发表于 ICML 2026。它基于扩散模型(DiT/MMDiT)架构★ 475awesome-seedance-2.5-api-prompts这是一个围绕字节跳动 Seedance 2.5 视频生成 API 的提示词与参数指南集合。它旨在帮助开发者快速上手 Seedance 2.5,通过提供结构化的提★ 318Flux-3-Dev-APIFlux-3-Dev-API 是一个 Python 封装库,用于调用 Black Forest Labs 的 FLUX 3 Dev API。它解决了开发者快速集★ 185awesome-minimax-h3-prompts这是一个精选的 MiniMax H3 视频生成提示词合集,旨在帮助创作者快速上手 MiniMax H3 模型,生成电影感、广告、动漫、UGC、产品演示等多种风格★ 182Building-Business-Ready-Generative-AI-Systems这是一个从零开始构建企业级生成式AI系统的完整代码仓库,旨在帮助开发者掌握架构设计和实现高级AI控制器、智能代理以及动态RAG(检索增强生成)框架。项目通过多个★ 171humanboundHumanbound 是一个开源的对抗性测试引擎,为 AI 智能体提供 SDK 和命令行工具,用于发现和修复智能体中的安全漏洞与逻辑缺陷。它解决的核心问题是:A★ 161awesome-flux-3-api-prompts这是一个面向 Black Forest Labs FLUX 3 模型的 API 使用指南与提示词合集。FLUX 3 是统一的多模态生成模型,支持文生视频、图生视★ 146Eva01Eva01 是一个开源的 AI 智能体项目,旨在构建一个具有自主意识、情感和内在驱动力的 AI 实体,而非传统意义上的助手。它采用多模态模块化设计,内置语音和面★ 145OGADOGAD(Off Grid AI)是一个本地优先的AI网关项目,旨在让用户完全离线运行开源AI模型。它通过一个与OpenAI兼容的API网关,统一管理文本、视觉★ 115InferrLMInferrLM 是一个面向 iOS 和 Android 的端侧 AI 推理框架,基于 TypeScript 构建,旨在让移动应用无需依赖云端即可运行 AI 模★ 112wechat-mac-rpawechat-mac-rpa 是一个面向 macOS 微信客户端的视觉 RPA 自动化框架,核心思路是用多模态视觉感知代替传统控件抓取,再叠加 LLM Agen★ 111Wan-3.0-APIWan-3.0-API 是一个针对阿里云通义万相(Wan)视频生成模型的 Python SDK 和 MCP 服务器封装。它解决了开发者直接调用 Wan 3.0 ★ 80agnes-ai-skillAgnes AI Skill 是一个面向 AI 代理(如 Claude Code、Codex)的多模态技能包,统一封装了文本、图像和视频生成 API,并提供持久★ 64prompt-to-puzzleprompt-to-puzzle 是一个基于文本提示动态生成“找不同”游戏的 Web 应用。用户只需输入一句文字描述,系统便通过多模态流水线(结合 Google★ 55AI-Photographer-Agent-ROCm这是一个面向AMD Radeon显卡和ROCm平台的私有本地AI摄影师代理项目。它利用多模态AI模型(如Qwen2-VL)实现摄影辅助功能,解决用户在本地环境中★ 1