foundation-models
本站收录 275 个带「foundation-models」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
ColossalAIColossalAI是一个旨在降低大型AI模型使用门槛的开源项目,专注于让大模型的训练、微调和推理更便宜、更快速、更易获取。它解决了大模型开发中显存不足、训练效★ 41,445
LLaVA视觉指令微调(Visual Instruction Tuning)的开创性工作,NeurIPS 2023 Oral 论文。通过指令微调赋予视觉语言模型 GPT-★ 25,045
unilmUniLM是微软开源的大规模自监督预训练模型系列,旨在统一处理自然语言理解与生成任务。它基于Transformer架构,通过掩码语言建模、序列到序列建模等预训练★ 22,226
JanusJanus 是一个统一的多模态理解与生成模型系列,由 DeepSeek 团队开源。它解决了传统模型将视觉编码与文本生成割裂的问题,通过解耦视觉编码路径,在同一 ★ 17,764
YuEYuE 是开源的全曲目音乐生成基础模型,功能类似 Suno.ai 但完全开放。支持生成带人声的完整歌曲,涵盖歌词、旋律与编曲,为音乐创作者提供可本地部署、可自由★ 10,578
pyodPyOD是一个专注于异常检测的Python库,覆盖表格、时间序列、图、文本、图像和音频等多种数据类型,内置60多种检测算法,包括经典的LOF、IForest以及★ 10,020
TabPFNTabPFN 是一个基于 Transformer 的表格式数据基础模型,由 Prior-Data Fitted Networks 技术驱动,旨在解决传统机器学习★ 8,083
data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105
opensquillaOpenSquilla 是一个主打 Token 高效利用的 AI Agent 框架,旨在让同样的预算获得更高的智能密度。它通过优化上下文管理、记忆机制和技能调用★ 7,065
opensquillaOpenSquilla 是一个用 Python 编写的开源 AI Agent 框架,核心卖点是“Token 效率”——在相同预算下提供更高的智能密度。它面向需要★ 7,065
chronos-forecastingChronos是一个基于Transformer架构的预训练时间序列预测模型库,由Amazon Science团队开发。它解决了传统时间序列预测模型需要针对每个数★ 5,926
LimiXLimiX 是一个专注于结构化数据建模的开源项目,旨在增强通用人工智能(AGI)对表格、数据库等结构化数据的理解与生成能力。它解决了当前大语言模型在处理非文本结★ 4,327
DeepSeek-VLDeepSeek-VL 是深度求索推出的开源视觉语言模型,旨在弥合真实世界视觉理解与语言模型之间的鸿沟。它解决的是多模态理解问题,即让模型能同时处理图像和文本,★ 4,179
nixtlaNixtla 是一个专注于时间序列预测与异常检测的开源项目,其核心是 TimeGPT-1,一个生产级的预训练时间序列基础模型。该模型基于生成式预训练 Trans★ 4,017
NExT-GPTNExT-GPT是新加坡国立大学团队在ICML 2024发表的任意模态大语言模型,支持文本、图像、音频和视频的任意输入与输出组合。它采用LLM作为核心大脑,通过★ 3,636
OtterOtter是一个基于OpenFlamingo的多模态模型,旨在提升视觉-语言任务的指令跟随和上下文学习能力。它针对DeepMind Flamingo的开源版本进★ 3,443
Ask-AnythingAsk-Anything 是一个基于大语言模型的多模态视频理解对话助手,核心解决“让 AI 看懂视频并自然对话”的问题。它支持多种主流语言模型(如 miniGP★ 3,354
SuperCLUESuperCLUE 是一个面向中文通用大模型的综合性评测基准,旨在系统评估基础模型在中文场景下的能力。它解决了当前大模型评测中缺乏中文深度覆盖、维度单一、标准不★ 3,302
autodistillAutodistill 是一个面向计算机视觉的自动化标注与训练工具,旨在解决监督学习依赖大量人工标注的问题。它利用基础模型(如 GPT-4V、CLIP、Grou★ 2,783
EVAEVA是北京智源人工智能研究院(BAAI)开源的一系列视觉基础模型,专注于视觉表示学习。它通过大规模对比学习预训练,为图像分类、目标检测、语义分割等下游视觉任务★ 2,695
InternVideoInternVideo 是一个面向多模态理解的开源视频基础模型项目,由上海人工智能实验室发布,相关论文发表于 ECCV2024。它旨在解决视频理解中模型泛化能力★ 2,398
awesome-llm-powered-agent这是一个精心整理的关于大语言模型驱动智能体的资源列表,收录了相关论文、开源仓库、博客文章等。它旨在帮助开发者和研究者快速了解LLM Agent领域的最新进展和核★ 2,251
MambaVisionMambaVision是CVPR 2025官方发布的PyTorch实现,提出了一种混合Mamba-Transformer视觉骨干网络。它针对视觉任务中Mamba★ 2,235
CoOpCoOp(Context Optimization)是一个针对视觉-语言模型(如CLIP)的提示学习(Prompt Learning)开源项目,由OpenAI团★ 2,231
alpaca_evalalpaca_eval 是一个用于自动评估指令跟随语言模型的工具。它解决了人工评估成本高、速度慢、难以规模化的问题,提供了一种廉价、快速且经过人类验证的自动评估★ 2,018
graph-fraud-detection-papers这是一个精选的图神经网络与Transformer在欺诈检测、异常检测和离群点检测领域的论文与资源列表。项目系统整理了基于图结构(如GNN、Graph Trans★ 1,897
EmuEmu 是北京智源人工智能研究院(BAAI)发布的一系列生成式多模态模型,涵盖图像生成、视频生成以及多模态理解等任务。该项目旨在通过统一的模型架构和训练范式,解★ 1,778
lag-llamaLag-Llama 是一个基于 LLaMA 架构的开源概率时间序列预测基础模型,由 Arjun Ashok 等人开发。它通过引入滞后特征(lag feature★ 1,600
skforecastskforecast 是一个基于 Python 的时间序列预测库,它允许用户直接使用 scikit-learn 兼容的机器学习模型(如随机森林、XGBoost、★ 1,537
awesome-japanese-llm这是一个专门汇总日本语大语言模型(LLM)资源的精选清单项目,旨在解决日语NLP领域模型分散、信息难找的问题。它系统整理了各类支持日语的LLM,包括开源模型、商★ 1,433
AuKAuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源分离等任务统一到一个模型框架中。它解决的是传统语音流水线中模型碎★ 1,413
tabiclTabICLv2 是一个基于上下文学习(In-Context Learning)的表格数据基础模型,旨在解决传统表格预测模型需要针对每个数据集重新训练、泛化能力★ 1,391
awesome-vlm-architectures这是一个精心整理的视觉语言模型(VLM/MLLM)架构目录,收录了155+个相关模型,涵盖论文、架构图、训练配方、数据集以及发布时间线。项目以可视化的方式呈现多★ 1,324
KnowledgeEditingPapersKnowledgeEditingPapers 是一个精选论文列表,聚焦于大语言模型(LLM)的知识编辑(Knowledge Editing)领域。知识编辑旨在高★ 1,248
Awesome-TimeSeries-SpatioTemporal-LM-LLM这是一个精选列表,收录了用于时间序列、时空数据和事件数据的大语言模型(LLM)与基础模型(FM)的相关论文、代码和资源。它解决了该领域研究资料分散、难以追踪的问★ 1,233
torchxrayvisionTorchXRayVision 是一个面向胸部 X 光影像的开源工具库,集成了多个公开数据集和预训练模型,覆盖分类、分割和自编码器三大任务。它解决了医学影像研究★ 1,201
Foundation-Models-Framework-Lab这是一个基于 Apple 新发布的 Foundation Models 框架的实战实验室,旨在帮助开发者快速上手构建、测试和评估基于 Apple 基础模型的应用★ 1,185
Awesome-Foundation-ModelsAwesome-Foundation-Models 是一个精选基础模型列表,专注于视觉和语言任务。它系统整理了各类预训练模型,包括多模态、视觉、语言等方向,为研★ 1,178
ONE-PEACEONE-PEACE 是一个跨视觉、音频、语言三种模态的通用表示模型,旨在探索一种能处理无限模态的统一表征框架。它解决了传统模型只能处理单一或少数模态、难以共享和★ 1,060
PointLLMPointLLM 是一个让大语言模型直接理解三维点云的开源多模态模型,解决了传统大模型只能处理文本和图像、无法感知三维结构的问题。它首次将点云编码器与 LLaM★ 1,056
auroraAurora 是微软研究院开源的地球系统基础模型实现,用于高精度天气预报和大气、海洋、空气质量等地球科学预测。它基于多模态、多分辨率的大气数据训练,能处理从分钟★ 1,021
Large-Time-Series-ModelTimer 是一个面向时间序列预测的大规模预训练模型项目,由 ICML 2024 论文团队开源。它解决传统时间序列模型难以跨领域泛化、需要针对每个数据集单独训练★ 1,020
groundingLMMGLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩码无缝集成的多模态大模★ 970
FasterViTFasterViT 是一个面向视觉任务的高效 Transformer 模型,由 NVIDIA 研究人员开发,相关论文发表于 ICLR 2024。它旨在解决传统 ★ 925
nucleotide-transformerNucleotide Transformer 是一个面向基因组学和转录组学的开源基础模型项目,旨在利用大规模预训练 Transformer 架构来学习 DNA ★ 922
vision_pilotvision_pilot 是一个免费且完全开源的 L2 级高级驾驶辅助系统(ADAS)软件栈,采用端到端人工智能技术驱动。它旨在为开发者、研究人员和汽车爱好者提★ 905
terratorchterratorch 是一个用于微调地理空间基础模型(GFMs)的 Python 工具包。它解决了遥感领域研究人员和开发者难以高效适配大型预训练模型到特定下游任★ 863
meerkatMeerkat 是一个用于探索和理解机器学习训练与验证数据的开源工具。它解决了深度学习项目中数据质量难以直观检查、样本分布不透明、错误分析繁琐等问题。核心能力包★ 854
OpenCUAOpenCUA 是一个为计算机使用智能体(Computer-Use Agents)提供开放基础的开源项目,入选 NeurIPS 2025 Spotlight。它★ 849
VoxPoserVoxPoser 是一个将大语言模型(LLM)与机器人操作相结合的框架,旨在让机器人仅通过自然语言指令就能完成复杂的物理操作任务。它解决了传统机器人编程需要专业★ 838