llm-inference

本站收录 126 个带「llm-inference」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

rayRay 是一个面向 AI 计算的分布式引擎,由核心分布式运行时和一组 AI 库组成,用于加速机器学习工作负载。它解决了大规模分布式训练、调参、推理和服务部署中的★ 43,949gitleaksGitleaks 是一个用 Go 编写的开源密钥扫描工具,专门用于检测 Git 仓库中的敏感信息泄露,如密码、API 密钥、令牌等。它解决的是开发者在代码提交过★ 29,556llm-actionllm-action 是一个面向大模型工程师和开发者的开源知识库与实战指南,系统梳理了大模型从训练、微调到推理部署的全链路技术原理与工程实践。项目以教程和代码示★ 25,121litgptLitGPT 是一个基于 PyTorch 的高性能大语言模型(LLM)训练与部署框架,由 Lightning AI 团队开发。它内置了 20 多种主流 LLM ★ 13,687OpenLLM让任意开源 LLM(如 DeepSeek、Llama)一键以 OpenAI 兼容的 API 形式部署到云端的工具。它屏蔽了模型服务化的复杂度,提供标准化的推理接★ 12,548openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935mistral-inferencemistral-inference 是 Mistral AI 官方发布的推理库,用于加载和运行 Mistral 系列大语言模型。它解决了开发者在使用 Mistr★ 10,821PowerInferPowerInfer 是一个面向本地部署的高速大语言模型推理引擎,专注于在消费级硬件上实现接近服务器级的推理速度。它通过利用大语言模型推理中的高稀疏性(即神经元★ 9,815BentoML以最简单的方式部署 AI 应用与模型的开源框架,支持构建模型推理 API、任务队列、LLM 应用与多模型流水线。它提供了标准化的服务化流程、容器化打包与云原生扩★ 8,870kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795lmdeployLMDeploy 是一个专为大语言模型(LLM)设计的压缩、部署和服务工具包。它解决了 LLM 在实际生产环境中推理速度慢、显存占用高、部署复杂等核心问题。其核★ 8,100planoPlano 是一个面向智能体应用的原生 AI 代理服务器与数据平面,用 Rust 编写。它解决的是 LLM 应用开发中模型路由、可观测性、智能体编排和安全护栏等★ 7,070turbo-fieldfareturbo-fieldfare 是一个基于 Swift 编写的开源项目,旨在让 Gemma 4 26B-A4B 模型在任意 M 系列 MacBook 上仅用约 ★ 6,842flashinferFlashInfer 是一个面向大语言模型推理服务的高性能 GPU 内核库,用 CUDA 和 PyTorch 实现,专注解决 LLM 部署中注意力计算、MoE ★ 6,516cactuscactus 是一个专为移动设备、可穿戴设备、智能家居和机器人等边缘场景设计的轻量级 AI 推理引擎。它解决了在资源受限的硬件上高效运行深度学习模型的问题,核心★ 6,080kserveKServe 是一个基于 Kubernetes 的标准化的分布式生成式 AI 和预测式 AI 推理平台,旨在为可扩展、多框架的模型部署提供统一解决方案。它解决了★ 6,046lemonadeLemonade 是一个面向本地 AI 应用的开源推理引擎,旨在让用户直接在自己的 GPU 和 NPU 上运行优化后的大语言模型。它解决了云端 AI 带来的隐私★ 5,797gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327ekoEko 是一个用自然语言构建生产级智能体工作流的开源框架,基于 TypeScript 开发。它解决了开发者在构建复杂 AI Agent 时面临的编排难、调试难、★ 4,962RuVectorRuVector 是一个用 Rust 构建的高性能实时向量数据库,专为 AI 应用设计,集成了图神经网络(GNN)和记忆数据库能力。它解决了传统向量数据库在实时★ 4,527optillmoptillm 是一个面向大语言模型(LLM)推理场景的优化代理服务。它位于客户端与模型服务之间,通过集成多种前沿推理优化技术,如思维链(CoT)、自我一致性、★ 4,304GenerativeAIExamplesGenerativeAIExamples 是 NVIDIA 推出的生成式 AI 参考工作流集合,专为加速基础设施和微服务架构优化。它提供了一系列端到端的示例,涵★ 4,197Rapid-MLXRapid-MLX 是一个专为 Apple Silicon 芯片打造的高性能本地 AI 推理引擎,旨在解决 Mac 上运行大模型速度慢、工具调用支持差的问题。它★ 3,864loraxLorax 是一个专为大规模多 LoRA 推理而设计的高性能服务器,能够同时承载数千个微调后的 LLM。它解决了传统推理服务中每个微调模型需要独立部署、资源消耗★ 3,834AI-Engineer-HeadquartersAI-Engineer-Headquarters 是一个面向 AI 工程师的知识库与工具集,以 Jupyter Notebook 形式组织,汇集了构建机器学习模★ 3,689ai-engineering-interview-questions这是一个面向AI工程师的面试准备资源库,以Markdown格式提供问答式速查表。它系统梳理了AI工程领域的核心知识点,涵盖大语言模型、智能体、微调、量化、MCP★ 3,242distributed-llamadistributed-llama 是一个用 C++ 实现的开源项目,旨在将家庭中的多台设备(如电脑、树莓派等)组成一个分布式集群,共同运行 Llama 大语言★ 3,082MedusaMedusa是一个用于加速大语言模型生成的轻量级框架,核心思路是在原始模型基础上添加多个解码头(decoding heads),每个头并行预测后续多个token★ 2,771EAGLEEAGLE是一个开源的大语言模型推理加速框架,由字节跳动团队开发,包含EAGLE-1、EAGLE-2和EAGLE-3三个版本,分别发表于ICML'24、EMNL★ 2,545nanocoder由社区集体而非公司打造的开放终端编程代理。自带模型即可使用,代码始终留在您的机器上,无需依赖任何商业服务。开源、透明、无绑定,是追求自主可控的开发者理想之选。★ 2,492intel-extension-for-transformersIntel Extension for Transformers 是英特尔推出的开源工具包,旨在让开发者快速构建聊天机器人,并在英特尔平台上高效运行大语言模型(★ 2,170neuron-aineuron-ai 是 PHP 生态中的智能体框架,旨在帮助开发者构建生产级 AI 驱动应用。它解决了 PHP 开发者难以将大语言模型、工具、向量数据库和记忆模★ 2,109aiciAICI(Artificial Intelligence Controller Interface)是一个开源框架,它提出了一种全新的与大语言模型交互的方式:将★ 2,076llama2-webuillama2-webui 是一个让你在本地轻松运行 Llama 2 大语言模型的工具,它基于 Gradio 构建了直观的网页界面,支持在 GPU 或 CPU 上★ 1,934beta9beta9 是一个面向 AI 推理和计算场景的超快无服务器 GPU 平台,用 Go 语言实现。它解决了传统 GPU 部署中资源利用率低、冷启动慢、环境隔离复杂等★ 1,798InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792react-native-executorchreact-native-executorch 是一个将 Meta 的 ExecuTorch 推理引擎封装为 React Native 原生模块的开源库,让开发★ 1,750Atomic-ChatAtomic-Chat 是一款面向本地智能体的 AI 对话应用与推理引擎,旨在让用户完全离线、私密地运行开源大模型。它基于 TypeScript 构建,深度集成★ 1,650xllmxllm 是一个高性能推理引擎,专为大型语言模型(LLM)、视觉语言模型(VLM)、扩散变换器(DiT)和 REC 模型设计,并针对多种 AI 加速器进行优化。★ 1,587kvcachedkvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的★ 1,509awesome-ai-web-search这是一个精选AI驱动的网页搜索工具列表,收录了各种利用大语言模型增强搜索体验的开源项目和商业服务。它解决了传统搜索引擎结果冗余、难以直接获取答案的问题,通过整理★ 1,459BrowserAIBrowserAI 是一个基于 WebGPU 的浏览器端本地 AI 推理引擎,支持在浏览器中直接运行 llama、deepseek-distill、kokoro★ 1,452zero-to-sglangzero-to-sglang 是 SGLang 官方与 Datawhale 联合推出的 LLM 推理学习课程,面向想深入理解大模型推理引擎的开发者。它解决的是「★ 1,323tiny-vllmtiny-vllm 是一个用 C++ 与 CUDA 从零实现的高性能 LLM 推理引擎教学项目,定位为 vLLM 的精简版。它解决的核心问题是:主流推理框架(如★ 1,135resume_render_from_job_descriptionResume_Builder_AIHawk 是一个基于 Python 的开源简历定制工具,核心思路是把求职流程自动化:用户只需提供目标职位的 URL,工具会抓取★ 1,132jevjev 是一个可在笔记本本地运行的开源二分类决策模型,定位为 Jev 的替代方案,专门回答“是/否”这类简单判断问题。它基于 llama.cpp 与 GGUF ★ 1,132AI-CompassAI-Compass 是一个面向 AI 学习者的开源知识导航与路线图项目,用 Python 组织内容,目标是解决 AI 领域知识点庞杂、学习路径混乱的问题。它把★ 965time-to-first-token这是一个为期10周、每天30分钟的LLM推理服务与优化学习路线图。它面向想要系统掌握大模型推理性能调优的开发者,解决从理论到实践缺乏结构化路径的问题。项目核心能★ 960awesome-hostingawesome-hosting 是一个按最低套餐价格排序的托管服务清单,本质是精选资源集合而非可运行软件。它解决的问题是:开发者在选云主机、VPS、PaaS、S★ 936