inference-engine
本站收录 25 个带「inference-engine」标签的 AI 开源项目
Halfrost-FieldHalfrost-Field 是一个以 Go 语言为主的技术博客与知识库,由作者 Halfrost 维护,内容涵盖源码深度解析、系统设计与工程实践。项目以系列文★ 13,238
kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795
FedMLFedML 是一个统一且可扩展的机器学习库,专注于大规模分布式训练、模型服务和联邦学习。它提供跨云调度器 FedML Launch,支持在任意 GPU 云或本地★ 4,067
sonarsonar 是一个面向大规模 LLM 推理场景的高性能引擎,用 C++ 编写,旨在解决大模型部署时的高延迟、低吞吐和硬件适配问题。它支持多种硬件后端,包括 NV★ 1,869
xllmxllm 是一个高性能推理引擎,专为大型语言模型(LLM)、视觉语言模型(VLM)、扩散变换器(DiT)和 REC 模型设计,并针对多种 AI 加速器进行优化。★ 1,587
kvcachedkvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的★ 1,509
nobodywhoNobodyWho 是一个用 Rust 编写的本地 LLM 推理引擎,旨在让任何设备都能高效运行大语言模型。它解决了在资源受限设备(如手机、嵌入式设备)上部署 ★ 1,505
zero-to-sglangzero-to-sglang 是 SGLang 官方与 Datawhale 联合推出的 LLM 推理学习课程,面向想深入理解大模型推理引擎的开发者。它解决的是「★ 1,323
mlxstudioMLX Studio 是一个专为 Apple Silicon Mac 设计的本地 AI 一体化工作台,集成了图像生成/编辑与聊天/代码功能。它基于 MLX 框架★ 980
SavantSavant 是一个基于 Python 的计算机视觉与视频分析框架,构建在 NVIDIA DeepStream 和 CUDA 之上,目标是让开发者用声明式 YA★ 858
halogen-flash-serverhalogen-flash-server 是一个面向 AMD Strix Halo(gfx1151)平台的本地大模型推理部署脚本,目标是让用户以最快速度在搭载该★ 729
pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712
OpenArcOpenArc 是一个面向英特尔硬件(CPU、核显、Arc 独显)的推理引擎,基于 OpenVINO 工具链构建,目标是在没有 NVIDIA GPU 的机器上也★ 533
krasisKrasis 是一个混合 LLM 运行时,专注于在消费级显存受限的硬件上高效运行更大的模型。它通过将模型层智能卸载到 CPU/内存,并利用 GPU 加速关键计算★ 521
TensorSharpTensorSharp 是一个用 C# 编写的原生 .NET 大语言模型推理引擎,专门用于加载和运行 GGUF 格式的模型。它解决的是 .NET 生态中缺少高性★ 507
audio.cpp-webuiaudio.cpp-webui 是一个基于 ggml 的纯 C++ 音频模型推理引擎,为 audio.cpp 提供全任务 WebUI。它支持语音合成(TTS)、★ 369
MoE-InfinityMoE-Infinity 是一个基于 PyTorch 的开源库,旨在高效、低成本地服务混合专家(MoE)大语言模型。它解决了 MoE 模型因参数量巨大、推理时显★ 363
swiftLLMswiftLLM 是一个极简但高性能的 LLM 推理系统,专为研究目的设计。它用仅约 2000 行 Python 代码实现了与 vLLM 相当的性能,代码量仅为★ 359
MIVisionXMIVisionX 是 AMD 推出的开源计算机视觉工具包,核心是符合 Khronos OpenVX 1.3.2 规范的高度优化实现。它主要解决在 AMD 硬件★ 217
NekoSpeakNekoSpeak 是一款面向 Android 的本地离线 AI 语音合成应用,支持 Kokoro、KittenTTS、Pocket-tts 和 Piper 等★ 172
vLLM-HookvLLM-Hook 是一个针对 vLLM 推理引擎的插件,允许开发者编程访问和修改模型在推理过程中的内部状态。它解决了 vLLM 默认黑盒推理、难以干预中间层输★ 162
qwen3-ttsqwen3-tts 是一个纯 C 语言实现的 Qwen3-TTS 文本转语音推理引擎,旨在摆脱 Python 和 PyTorch 的依赖,仅用 C 和 BLAS★ 109
tinylmtinylm 是一个基于浏览器的机器学习推理框架,采用 TypeScript 编写,提供 OpenAI 兼容的 API 接口,让开发者能在浏览器端直接运行 De★ 59
hummingbirdhummingbird 是一个轻量级、零依赖的 C 语言运行时,专为大规模开源混合专家(MoE)语言模型设计。它通过统一 SSD、RAM 和 VRAM 为单一智★ 58