mixture-of-experts

本站收录 19 个带「mixture-of-experts」标签的 AI 开源项目

kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795optillmoptillm 是一个面向大语言模型(LLM)推理场景的优化代理服务。它位于客户端与模型服务之间,通过集成多种前沿推理优化技术,如思维链(CoT)、自我一致性、★ 4,304mixtral-offloadingmixtral-offloading 是一个让 Mixtral-8x7B 大模型在消费级硬件(如 Colab 免费版或个人桌面)上运行的工具。它通过智能的层卸载★ 2,334TutelTutel 是微软开源的高性能混合专家(MoE)训练与推理优化库,核心目标是解决大规模 MoE 模型在分布式环境下通信开销大、显存占用高、计算效率低的问题。它通★ 1,022makeMoEmakeMoE 是一个从零开始实现稀疏混合专家(MoE)语言模型的教学项目,灵感来源于 Andrej Karpathy 的 makemore。它通过 Jupyt★ 818halogen-flash-serverhalogen-flash-server 是一个面向 AMD Strix Halo(gfx1151)平台的本地大模型推理部署脚本,目标是让用户以最快速度在搭载该★ 729Chinese-MixtralChinese-Mixtral 是一个专注于中文优化的混合专家(MoE)大语言模型项目,基于 Mixtral 架构进行中文能力增强。它解决了 Mixtral 原★ 612BigMoeOnEdgeBigMoeOnEdge 是一个让 MoE(混合专家)大模型跑在内存不足设备上的推理方案,核心思路是流式加载专家权重:模型的总参数量可以远超设备 RAM,但每次★ 595krasisKrasis 是一个混合 LLM 运行时,专注于在消费级显存受限的硬件上高效运行更大的模型。它通过将模型层智能卸载到 CPU/内存,并利用 GPU 加速关键计算★ 521MoE-InfinityMoE-Infinity 是一个基于 PyTorch 的开源库,旨在高效、低成本地服务混合专家(MoE)大语言模型。它解决了 MoE 模型因参数量巨大、推理时显★ 363MoE-plus-plusMoE++ 是一个针对混合专家(Mixture-of-Experts, MoE)模型的加速框架,核心思想是引入“零计算专家”(Zero-Computation ★ 280LLaVA-MoDLLaVA-MoD 是一个面向多模态大语言模型的高效压缩方案,通过结合混合专家(MoE)与知识蒸馏技术,将原本庞大的 LLaVA 模型压缩为轻量级版本,同时保持★ 227aarambh-studioaarambh-studio 是一个完全用 Rust 和 Candle 框架从零构建的 decoder-only 大语言模型项目,不依赖 Python 或 Py★ 110Unified-MoE-CompressionUnified-MoE-Compression 是论文《Towards Efficient Mixture of Experts: A Holistic Stu★ 92Routing-MVMoERouting-MVMoE 是 ICML 2024 论文《MVMoE: Multi-Task Vehicle Routing Solver with Mixtu★ 84MonetMonet 是一个面向 Transformer 架构的开源模型,提出了混合单语义专家(Mixture of Monosemantic Experts)机制,旨在★ 79Awesome-Mixture-of-Experts这是一个精选的混合专家(MoE)与混合多模态专家(MoME)资源列表,旨在为研究人员和工程师提供系统化的学习与参考入口。项目本身不包含代码实现,而是以目录形式收★ 75Comfy_HunyuanImage3Comfy_HunyuanImage3 是一个 ComfyUI 自定义节点,让用户能在本地运行腾讯的混元图像生成模型 Hunyuan Image 3。它解决了官★ 67hummingbirdhummingbird 是一个轻量级、零依赖的 C 语言运行时,专为大规模开源混合专家(MoE)语言模型设计。它通过统一 SSD、RAM 和 VRAM 为单一智★ 58