moe

本站收录 26 个带「moe」标签的 AI 开源项目

vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945LlamaFactory统一的 LLM 高效微调框架,支持 100+ 主流模型(LLM 与 VLM),集成 LoRA 等前沿技术,被 ACL 2024 收录,是微调领域最流行的开源工具★ 75,189sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594ms-swiftms-swift 是魔搭社区推出的国产大模型全流程训练与部署工具,旨在解决开发者微调大模型时面临的框架割裂、上手门槛高、多模态支持不足等痛点。它支持从增量预训练★ 15,754TensorRT-LLMTensorRT-LLM 是 NVIDIA 推出的开源大语言模型推理加速库,提供易用的 Python API 来定义 LLM,并在 NVIDIA GPU 上实现★ 14,723FreeTokenFreeToken 是一个面向桌面的数据中心级模型推理引擎,旨在让个人电脑也能高效运行大规模模型。它解决了本地设备算力有限、无法流畅运行大模型的问题,通过优化的★ 13,975kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795flashinferFlashInfer 是一个面向大语言模型推理服务的高性能 GPU 内核库,用 CUDA 和 PyTorch 实现,专注解决 LLM 部署中注意力计算、MoE ★ 6,516GLM-4.5GLM-4.5 是智谱AI推出的新一代开源基础模型系列,专注于智能体(Agentic)、推理(Reasoning)和编程(Coding)三大核心能力,简称ARC★ 4,425MoBAMoBA 是一种面向长上下文大语言模型的新型注意力机制,核心思想是将输入序列划分为多个块,并采用混合专家(MoE)的思路,让每个查询只关注最相关的少数块,从而将★ 2,191ucclUCCL 是一个面向 GPU 的高效通信库,专注于解决大规模 AI 训练和推理中的数据传输瓶颈。它覆盖了集合通信(如 AllReduce、AllGather)、★ 1,533TutelTutel 是微软开源的高性能混合专家(MoE)训练与推理优化库,核心目标是解决大规模 MoE 模型在分布式环境下通信开销大、显存占用高、计算效率低的问题。它通★ 1,022haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798SwiftLMSwiftLM 是一个面向 Apple Silicon 的原生 MLX Swift 大模型推理服务器,目标是把本地 LLM 推理做成可直接调用的 OpenAI ★ 774pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712Chinese-MixtralChinese-Mixtral 是一个专注于中文优化的混合专家(MoE)大语言模型项目,基于 Mixtral 架构进行中文能力增强。它解决了 Mixtral 原★ 612BigMoeOnEdgeBigMoeOnEdge 是一个让 MoE(混合专家)大模型跑在内存不足设备上的推理方案,核心思路是流式加载专家权重:模型的总参数量可以远超设备 RAM,但每次★ 595ARIS-in-AI-OfferARIS-in-AI-Offer 是一个面向 AI 领域秋招的中英双语面试速查表项目,由 ARIS 工具链自动生成。它解决 AI 求职者备考资料分散、更新不及时★ 559step_into_llmStep into LLM 是华为 MindSpore 社区推出的大语言模型入门课程项目,以 Jupyter Notebook 为载体,系统讲解从 BERT、G★ 480franken_ocrfranken_ocr 是一个用纯 Rust 实现的 CPU 端 OCR 推理引擎,目标模型是百度 Unlimited-OCR——一个基于 DeepSeek-O★ 332MoE-plus-plusMoE++ 是一个针对混合专家(Mixture-of-Experts, MoE)模型的加速框架,核心思想是引入“零计算专家”(Zero-Computation ★ 280Awesome-LLM-EnsembleAwesome-LLM-Ensemble 是一个精选论文列表,配套综述论文《Harnessing Multiple Large Language Models:★ 256LLaVA-MoDLLaVA-MoD 是一个面向多模态大语言模型的高效压缩方案,通过结合混合专家(MoE)与知识蒸馏技术,将原本庞大的 LLaVA 模型压缩为轻量级版本,同时保持★ 227minimind-deep-dive这是一个以 MiniMind 开源大模型源码为切入点,面向中文读者的深度学习笔记项目。它逐行精读预训练、SFT、DPO、PPO、GRPO 等核心训练机制,帮助读★ 222modern-llm-notebook这是一个从零开始构建现代大语言模型的实战课程,基于 PyTorch 和 Jupyter Notebook 实现。项目包含 26 个可运行的 Notebook,覆★ 219Awesome-Mixture-of-Experts这是一个精选的混合专家(MoE)与混合多模态专家(MoME)资源列表,旨在为研究人员和工程师提供系统化的学习与参考入口。项目本身不包含代码实现,而是以目录形式收★ 75