multi-modal

本站收录 42 个带「multi-modal」标签的 AI 开源项目

agentscope阿里通义实验室开源的智能体开发框架,核心主张是构建并运行「看得见、看得懂、信得过」的智能体。提供统一的多智能体编排、分布式调度与可视化调试能力,支持大模型服务接★ 32,570ten-frameworkTEN Framework 是一个面向对话式语音 AI 智能体的开源开发框架,用 Python 编写,主打实时、多模态交互。它要解决的核心问题是:开发者想搭建能★ 11,143InternVLInternVL 是一个开源的多模态对话模型家族,旨在成为 GPT-4o 的开源替代方案,在 CVPR 2024 上获得 Oral 论文。它解决了开源社区缺乏高★ 10,169big-AGIbig-AGI 是一个基于 TypeScript 构建的 AI 套件,旨在整合多种前沿大模型(如 GPT、Gemini、Claude、DeepSeek 等)并提★ 7,134data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105DALLE-pytorchDALLE-pytorch 是 OpenAI 文本生成图像模型 DALL-E 的 PyTorch 非官方实现,旨在复现其核心架构与训练流程。该项目解决的是研究者★ 5,625VLMEvalKitVLMEvalKit 是一个开源的大语言多模态模型(LMMs)评估工具包,旨在解决多模态模型评测标准不统一、评测流程繁琐的问题。它支持 220 多个主流 LMM★ 4,418OmniGenOmniGen 是一个统一图像生成框架,基于扩散模型,通过单一模型实现文生图、图像编辑、多图融合、角色一致性生成等多种任务,无需额外模块或复杂pipeline。★ 4,345LLamaSharpLLamaSharp 是一个面向 C#/.NET 开发者的本地大语言模型推理库,基于 llama.cpp 的高效 C++ 内核封装,提供纯托管代码的 API 接★ 3,804LISALISA 是一个基于大型语言模型(LLM)的推理分割(Reasoning Segmentation)项目。它解决的是传统图像分割任务中,用户需要明确指定目标类别★ 2,685MotionGPTMotionGPT 是一个将人体运动视为一种‘外语’的统一生成模型,发表于 NeurIPS 2023。它利用大型语言模型(LLM)的架构来处理运动序列,将动作数★ 1,974GPTDiscordGPTDiscord 是一个基于 Python 的 Discord 机器人,旨在为 Discord 服务器提供一站式 GPT 接口。它解决了在 Discord ★ 1,852fastRAGfastRAG是一个专注于高效检索增强生成(RAG)的开源框架,旨在解决企业落地RAG时面临的性能瓶颈和部署复杂性问题。它基于Haystack构建,但针对生产环★ 1,787SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538modelfusionModelFusion 是一个用于构建 AI 应用的 TypeScript 库,旨在为开发者提供一套统一、类型安全的接口来集成多种大语言模型(LLM)、嵌入模型★ 1,319VisRAGVisRAG 是一个基于视觉语言模型(VLM)的解析免检索增强生成(RAG)框架。传统 RAG 依赖文本解析(如 PDF 转文本),而 VisRAG 直接将文档★ 981byaldibyaldi 是一个让开发者用几行代码就能调用 ColPali 等晚期交互多模态模型的 Python 库。它解决了传统文本检索无法理解图片、表格等视觉信息的问题★ 851AetherAether 是一个面向具身智能与空间智能的统一世界模型,核心解决视频生成中几何一致性缺失的问题。它通过融合4D重建与生成技术,在生成视频的同时显式建模场景的几★ 612forge-filmforge-film 是一个基于 Python 的多模型 DAG 驱动并行 AI 影视生成引擎。它解决传统 AI 视频生成中场景逐个生成、耗时漫长的问题,通过将★ 537Robust-R1Robust-R1 是一个针对视觉语言模型在复杂退化场景下推理能力不足的问题而提出的开源项目,其论文被 AAAI 2026 接收为 Oral。该项目核心是提出一★ 511awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483ACTalkerACTalker 是一个基于视频扩散模型的端到端说话头生成框架,由 ICCV 2025 论文提出。它解决的是传统说话头合成中控制信号单一、生成效果不自然的问题,★ 465chat2graphChat2Graph 是一个图原生的智能体系统,旨在将对话能力与知识图谱技术深度融合。它解决的核心问题是:传统对话系统或 RAG 系统难以处理多跳关系查询、缺乏★ 430LightRFTLightRFT 是一个轻量、高效、支持全模态的强化微调(RFT)框架,核心思路是用奖励模型驱动训练,把强化学习引入大语言模型和多模态模型的微调流程。它解决了传★ 404LLMGALLMGA是一个基于多模态大语言模型的图像生成助手,源自ECCV 2024 Oral论文。它旨在解决用户难以精确控制图像生成和编辑的问题,通过将大语言模型的推理★ 395Audio2HeadAudio2Head 是一个基于 IJCAI 2021 论文的音频驱动说话头生成项目,专注于实现一次性(one-shot)的头部自然运动合成。它解决了传统说话头★ 351MeshXLMeshXL 是一个基于神经坐标场(Neural Coordinate Field)的3D网格生成基础模型,由 NeurIPS 2024 论文提出。它解决了传统★ 341OASISOASIS是ICLR 2021论文的官方实现,提出了一种仅需对抗监督即可完成语义图像合成的新方法。传统方法依赖复杂的感知损失或特征匹配损失来训练生成器,而OAS★ 339ViP-LLaVAViP-LLaVA是CVPR 2024收录的多模态大模型,旨在让模型理解任意视觉提示(如点、框、涂鸦等),而不仅限于文本指令。它解决了现有视觉语言模型只能处理全★ 338TSITTSIT是ECCV 2020 Spotlight论文的官方实现,提出了一种简单且通用的图像到图像翻译框架。它通过特征变换(feature transformat★ 288VisualRWKVVisualRWKV 是 RWKV 语言模型的视觉增强版本,旨在让 RWKV 架构原生支持图像理解与多模态任务。它解决了传统 RWKV 模型仅处理文本、无法感知★ 246MotionGPT3MotionGPT3 是一个基于多模态大语言模型(MoT)框架的开源项目,旨在将人体运动作为第二种模态,与文本、语言模型统一处理,实现运动的理解与生成。它解决的★ 242video-SALMONN-2video-SALMONN-2 是清华大学电子工程系与字节跳动联合开发的新一代音视频大语言模型,旨在解决视频理解中音频与视觉信息融合不足的问题。该模型能够接收视★ 219grps_trtllmgrps_trtllm 是一个基于 TensorRT-LLM 和 C++ 实现的高性能 OpenAI 兼容 LLM 服务框架,旨在解决 vLLM 在高并发、低延★ 161ShapeGPTShapeGPT 是一个将 3D 形状生成与多模态语言模型统一起来的开源项目。它旨在解决传统 3D 建模门槛高、交互复杂的问题,让用户能通过自然语言指令直接生成★ 101AudioTokenAudioToken 是一个基于扩散模型的音频到图像生成工具,源自 InterSpeech 2023 论文。它解决了仅凭文本描述难以准确捕捉音频中情感、节奏等抽★ 90Flipped-VQAFlipped-VQA 是一个面向视频问答(VideoQA)的推理框架,核心思想是让大型语言模型(LLM)作为时间与因果推理器,通过翻转视频问答中的问题与答案生★ 77oneringaioneringai 是一个用 TypeScript 编写的生成式 AI 统一库,旨在通过一个库搞定所有主流 AI 提供商(如 OpenAI、Anthropic、★ 72Image-Text-Papers这是一个精选图像描述与文本生成图像相关论文的列表,旨在为多模态生成领域的研究者提供系统性的文献索引。项目按研究方向分类整理,涵盖图像描述、文本到图像合成、多模态★ 69SemBenchSemBench 是一个用于评测语义查询处理引擎的开源基准测试工具。它针对知识图谱、图数据库和语义数据管理系统中常见的复杂查询(如SPARQL、属性路径、联邦查★ 66Awesome-MLLM-Uncertainty这是一个精选多模态大语言模型(MLLM)不确定性研究论文的列表项目,旨在系统梳理该领域的最新进展。它解决的是MLLM在推理过程中缺乏可靠置信度、容易产生幻觉或错★ 59LUMIERELUMIERE 是 Google Research 论文《A Space-Time Diffusion Model for Video Generation》的★ 52