multimodality

本站收录 13 个带「multimodality」标签的 AI 开源项目

CradleCradle 是一个旨在实现通用计算机控制(GCC)的智能体框架,是这一领域的首次尝试。它让智能体能够像人类一样操作任何计算机软件,通过标准化通用环境,以最小化★ 2,594big-sleepbig-sleep 是一个基于命令行的文本生成图像工具,由 OpenAI 的 CLIP 模型和 BigGAN 生成对抗网络结合实现。它解决的核心问题是:在没有配★ 2,574RAG-SurveyRAG-Survey 是一个系统整理检索增强生成(RAG)领域论文的精选列表,由腾讯 AI Lab 团队维护,并基于其发表的综述论文《Retrieval-Aug★ 1,789OvisOvis是一个多模态大语言模型(MLLM)架构,旨在从结构上对齐视觉和文本嵌入。它解决了传统多模态模型在融合视觉与语言信息时存在的语义鸿沟问题,通过创新的嵌入对★ 1,525WoodpeckerWoodpecker 是一个针对多模态大语言模型(MLLM)的幻觉纠正工具。它通过训练一个轻量级的纠正器,在模型生成文本后,利用视觉知识库和交叉验证机制,自动检★ 650MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597Awesome-LLMs-meet-Multimodal-Generation这是一个精选论文列表,聚焦于基于大语言模型(LLM)的多模态生成领域,涵盖图像、视频、3D和音频四大模态。项目系统梳理了LLM与多模态生成结合的前沿研究,包括多★ 552clip-guided-diffusionclip-guided-diffusion 是一个基于 OpenAI CLIP 和扩散模型的文本生成图像工具,提供命令行接口和 Python 模块。它解决了早期★ 459MagiCompilerMagiCompiler 是一个面向视频生成模型的即插即用编译器,旨在为推理和训练提供免费的性能优化。它解决了视频生成模型在部署和训练过程中计算开销大、效率低的★ 333MMStarMMStar 是一个用于评估大型视觉语言模型(LVLMs)的基准测试工具,源自 NeurIPS 2024 论文。它解决了现有评估基准中模型可能通过语言先验或训练★ 217ChatTimeChatTime 是 AAAI 2025 oral 论文的官方 PyTorch 实现,定位为统一的多模态时间序列基础模型,旨在桥接数值数据与文本数据。它解决的核★ 168Awesome-AI-PapersAwesome-AI-Papers 是一个用于收集人工智能领域论文和对应代码的精选列表仓库。它旨在解决 AI 研究者、工程师和学生难以高效追踪前沿研究、找到论文★ 99DEFAMEDEFAME 是一个用于文本和视觉输入的事实核查系统,旨在自动验证信息真实性。它通过分析文本内容和相关图像,识别潜在的虚假信息或误导性内容。系统结合了自然语言处★ 62