multimodal

本站收录 212 个带「multimodal」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

anything-llm主打本地优先的全能 AI 助手,集聊天、RAG、文档管理等能力于一身,支持多种模型后端,让你真正「拥有」自己的智能,不再租赁。★ 66,603ai-agent-book《深入理解 AI Agent:设计原理与工程实践》是一本由李博杰撰写的开源技术书籍,旨在系统讲解 AI Agent 的设计原理与工程实践。该书解决了开发者从零构★ 51,740UI-TARS-desktopUI-TARS-desktop 是字节跳动开源的多模态 AI Agent 桌面栈,目标是把前沿视觉语言模型与 Agent 基础设施打通,让 AI 能像人一样操作★ 39,158LLaVA视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-★ 25,045unilmUniLM是微软开源的大规模自监督预训练模型系列,旨在统一处理自然语言理解与生成任务。它基于Transformer架构,通过掩码语言建模、序列到序列建模等预训练★ 22,226serve基于云原生技术栈构建多模态 AI 应用的框架,让开发者可以像搭积木一样编排微服务化的 AI 流水线。它天然支持文本、图像、音视频等多种模态的模型编排与扩展,配合★ 21,864screenpipescreenpipe 是一个本地优先的屏幕录制与 AI 代理连接工具,由 YC 孵化的开源项目。它持续记录屏幕内容(24/7),并通过本地、私密、安全的方式将录★ 21,777JanusJanus 是一个统一的多模态理解与生成模型系列,由 DeepSeek 团队开源。它解决了传统模型将视觉编码与文本生成割裂的问题,通过解耦视觉编码路径,在同一 ★ 17,764ms-swiftms-swift 是魔搭社区推出的国产大模型全流程训练与部署工具,旨在解决开发者微调大模型时面临的框架割裂、上手门槛高、多模态支持不足等痛点。它支持从增量预训练★ 15,754all-in-ragall-in-rag 是 Datawhale 社区推出的大模型应用开发实战指南,聚焦检索增强生成(RAG)技术全栈。它系统讲解从基础概念到高级优化的完整知识体系★ 11,554rerunrerun 是一个用于多模态机器人数据可视化和流式处理的开源工具,采用 Rust 编写,提供 Python 和 C++ 接口。它解决机器人开发中传感器数据(如摄★ 11,515runanywhere-sdksrunanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供★ 10,318PixelRAGPixelRAG 是一个面向像素级原生搜索的开源项目,旨在终结传统网页解析的繁琐流程。它解决的核心问题是:当信息以图像、图表、截图等视觉形式存在时,传统基于文本★ 10,116pyodPyOD是一个专注于异常检测的Python库,覆盖表格、时间序列、图、文本、图像和音频等多种数据类型,内置60多种检测算法,包括经典的LOF、IForest以及★ 10,020seatunnelSeaTunnel(原名Waterdrop)是一个高性能、分布式、海量数据集成工具,支持多模态数据同步。它解决了传统数据同步工具在异构数据源间传输效率低、配置复★ 9,688deeplake面向 AI Agent 的数据运行时,提供无服务器 PostgreSQL 与多模态数据湖,支持大规模数据的高效检索与训练。开发者可以像使用数据库一样管理图像、文★ 9,245BentoML以最简单的方式部署 AI 应用与模型的开源框架,支持构建模型推理 API、任务队列、LLM 应用与多模型流水线。它提供了标准化的服务化流程、容器化打包与云原生扩★ 8,870mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487genkitGenkit 是 Google 推出的开源框架,用于在 JavaScript、Go、Dart 和 Python 中构建智能体应用。它解决了开发 AI 智能体时面★ 6,457ai-notesai-notes 是一个面向软件工程师的 AI 学习笔记库,旨在帮助工程师快速跟上 AI 领域的最新发展。它由 Latent Space 社区维护,既是博客写作★ 6,249VLM-R1VLM-R1 是一个将强化学习(RL)应用于视觉语言模型(VLM)的开源项目,旨在提升模型在视觉理解任务中的推理能力。它基于 DeepSeek-R1 的 RL ★ 6,029pyspurPySpur 是一个用于智能体工作流的可视化开发平台。它解决了 AI 工程师在构建、调试和迭代多步骤智能体流程时效率低下的问题,传统上需要编写大量胶水代码和反复★ 5,797UltraRAGUltraRAG 是一个基于 Python 的低代码 MCP(Model Context Protocol)框架,用于构建复杂且创新的 RAG(检索增强生成)流★ 5,711xtunerXTuner 是一个专为超大规模 MoE(混合专家)模型设计的下一代训练引擎。它解决了传统训练框架在 MoE 模型上显存占用高、训练效率低、扩展性差的问题,提供★ 5,205align-anythingAlign Anything 是一个面向全模态模型的对齐训练框架,旨在解决多模态模型(文本、图像、音频、视频等)在人类反馈对齐方面的碎片化问题。它提供统一的训练★ 4,670Awesome-AIGC-TutorialsAwesome-AIGC-Tutorials 是一个精选的 AIGC 学习资源合集,涵盖大语言模型、AI 绘画、多模态等领域。它解决了 AIGC 领域信息分散、★ 4,548lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437ruby_llmruby_llm 是一个为 Ruby 语言打造的 AI 框架,旨在统一接入各大主流 AI 提供商(如 OpenAI、Anthropic、Gemini、DeepS★ 4,422MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147modlensmodlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文★ 4,071discoartdiscoart 是一个用 Python 编写的开源工具,旨在通过一行代码简化 Disco Diffusion 艺术作品的创作流程。Disco Diffusio★ 3,822SimpleMemSimpleMem 是一个为大型语言模型(LLM)智能体设计的终身记忆模块,旨在解决智能体在长期交互中遗忘历史信息、缺乏持续学习能力的问题。它通过高效的记忆存储★ 3,819morphik-coreMorphik Core 是一个开源的多模态检索引擎,旨在为 AI 应用提供统一的文档摄取、处理和检索能力。它解决了传统 RAG 系统中数据管道复杂、多模态支持★ 3,716Awesome-LLM-ReasoningAwesome-LLM-Reasoning 是一个精心整理的资源列表,聚焦于大语言模型(LLM)的推理能力,覆盖从经典的 Chain-of-Thought(Co★ 3,690NExT-GPTNExT-GPT是新加坡国立大学团队在ICML 2024发表的任意模态大语言模型,支持文本、图像、音频和视频的任意输入与输出组合。它采用LLM作为核心大脑,通过★ 3,636InternGPTInternGPT(iGPT)是一个开源的AI模型演示平台,旨在让开发者轻松展示和交互体验多种前沿AI模型。它集成了DragGAN、ChatGPT、ImageB★ 3,206OSWorldOSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发表于 NeurIPS 2024。它解决了现有基准测试环境★ 3,165ai这是一个基于 TypeScript 的 AI 开发工具包,主打类型安全与供应商无关。它解决了开发者在对接不同大模型(如 OpenAI、Anthropic、Gem★ 3,150InternLM-XComposerInternLM-XComposer 是上海人工智能实验室推出的多模态大模型系统,最新版本 2.5-OmniLive 专注于长时流式视频与音频的实时交互。它解决★ 2,928datachaindatachain 是一个面向非结构化数据的上下文层,它将存储在 S3、GCS、Azure Blob 等对象存储中的文件(如图片、视频、文档)抽象为类型化、版本★ 2,818autodistillAutodistill 是一个面向计算机视觉的自动化标注与训练工具,旨在解决监督学习依赖大量人工标注的问题。它利用基础模型(如 GPT-4V、CLIP、Grou★ 2,783maestroMaestro 是一个专注于多模态模型微调的开源工具,旨在简化 PaliGemma 2、Florence-2 和 Qwen2.5-VL 等视觉-语言模型的定制流★ 2,696OmAgentOmAgent 是一个用于快速构建多模态语言智能体的开源框架,旨在帮助开发者从原型到生产环境无缝部署。它解决了传统语言模型在处理图像、视频等非文本数据时的局限,★ 2,666generative-aigenerative-ai 是一个综合性的生成式 AI 学习资源库,旨在帮助开发者系统掌握从基础到进阶的生成式 AI 技能。项目包含详细的学习路线图、实战项目、★ 2,644mPLUG-OwlmPLUG-Owl是阿里巴巴达摩院开发的多模态大语言模型家族,旨在让AI同时理解文本和图像,并基于指令进行对话。它解决了传统语言模型只能处理文本、无法理解视觉信★ 2,539HuixiangDouHuixiangDou 是一个基于大语言模型(LLM)的技术问答助手,专门解决群聊场景中的技术咨询问题。它针对微信群、飞书群等多人对话环境,通过检索增强生成(R★ 2,501Awesome-Text-to-ImageAwesome-Text-to-Image 是一个聚焦文本到图像生成/合成领域的精选资源列表,旨在系统梳理该方向的研究进展、关键技术和开源工具。它解决了研究人员★ 2,447stability-sdkstability-sdk 是 Stability AI 官方提供的 Python SDK,用于与 stability.ai 的 API 交互,核心是调用 St★ 2,435