inference

本站收录 113 个带「inference」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945yolov5YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源项目之一。它解决了实时目标检测、实例分★ 58,097whisper.cppwhisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 ★ 54,014ColossalAIColossalAI是一个旨在降低大型AI模型使用门槛的开源项目,专注于让大模型的训练、微调和推理更便宜、更快速、更易获取。它解决了大模型开发中显存不足、训练效★ 41,445mediapipeMediaPipe 是 Google 开源的跨平台机器学习解决方案框架,专为实时和流媒体场景设计。它解决的是开发者难以高效构建、部署和优化多模态 ML 应用的问★ 37,118sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594ml-engineering这是一本面向机器学习工程师的开放书籍,系统梳理了大模型训练与推理全流程的工程实践。它解决的核心问题是:当模型规模从百万级跃升到百亿级时,硬件选型、分布式策略、性★ 19,062nano-vllmnano-vllm 是一个轻量级的大语言模型推理引擎,旨在以极简的代码实现 vLLM 的核心功能。它解决了 vLLM 等大型推理框架依赖重、部署复杂的问题,让开★ 15,661FreeTokenFreeToken 是一个面向桌面的数据中心级模型推理引擎,旨在让个人电脑也能高效运行大规模模型。它解决了本地设备算力有限、无法流畅运行大模型的问题,通过优化的★ 13,975LMCacheLMCache 是一个专为大型语言模型(LLM)推理场景设计的 KV 缓存加速层,旨在解决长上下文和多轮对话场景下推理速度慢、显存占用高的问题。它通过智能管理 ★ 11,941amazon-sagemaker-examplesamazon-sagemaker-examples 是亚马逊官方维护的 Jupyter Notebook 示例集,旨在帮助开发者快速上手 Amazon Sage★ 10,987openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935yolov3这是一个基于PyTorch实现的YOLOv3目标检测项目,支持YOLOv3、YOLOv3-SPP和YOLOv3-tiny三种模型。它解决了从模型训练到部署的全流★ 10,612runanywhere-sdksrunanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供★ 10,318inferenceXinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模★ 9,593oumioumi 是一个专注于开源大语言模型(LLM)微调、评估和部署的全流程工具包。它旨在简化从模型选择到生产部署的复杂流程,支持 Qwen、Gemma、Llama ★ 9,392vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135MooncakeMooncake 是 Moonshot AI 为其 Kimi 大语言模型服务打造的高性能推理平台,核心解决 LLM 服务中的高吞吐、低延迟和成本控制问题。它基于★ 6,689argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385semantic-routersemantic-router 是一个用 Go 编写的可编程混合模型路由器,专为异构 LLM 推理场景设计。它解决的核心问题是:当企业或开发者需要同时调用多个不★ 5,980gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327cube-studiocube-studio 是一个开源的云原生一站式 AI 平台,覆盖机器学习、深度学习和 LLMOps 全链路。它解决了 AI 开发中环境搭建复杂、资源利用率低、★ 5,079AutoGPTQAutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降★ 5,067CTranslate2CTranslate2 是一个专为 Transformer 类模型设计的高性能推理引擎,用 C++ 编写,支持 CPU(含 AVX、AVX2、NEON 等指令集★ 4,690llm-dllm-d 是一个专注于在 Kubernetes 上实现现代加速器(如 GPU)上最先进推理性能的开源项目。它解决了在云原生环境中部署大型语言模型时面临的性能瓶★ 4,679FastVideo统一的视频生成加速框架,将推理与后训练(post-training)流程整合一体,通过高效优化实现更快的视频生成速度,降低训练与推理成本,适合研究团队与工程部署★ 4,521csghubCSGHub 是由 OpenCSG 团队开发的开源大模型管理平台,旨在提供类似 Hugging Face 的功能,但支持私有化部署和 SaaS 两种模式。它帮助★ 4,117FastDeployFastDeploy 是百度飞桨(PaddlePaddle)生态下的高性能推理与部署工具包,专注于大语言模型(LLM)和多模态模型(VLM)的快速部署。它解决了★ 3,718siesie 是一个开源的推理服务器和生产级集群,专为智能体(agent)所需的各类模型提供统一部署和调度。它解决了多模型、多副本在生产环境中难以统一管理的问题,提供★ 3,337vllm-ascendvllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它★ 2,911ortort 是一个基于 Rust 的 ONNX 模型推理与训练库,它封装了微软的 ONNX Runtime,为 Rust 开发者提供了高性能的机器学习推理能力。该项★ 2,542cube-studiocube-studio 是一个基于云原生的开源 AI 平台,旨在统一管理机器学习、深度学习及大模型的完整生命周期。它解决企业在算法开发、训练、部署和运维中的碎片★ 2,529inferenceinference 是一个将任何计算机或边缘设备转变为计算机视觉项目指挥中心的开源工具。它解决了视觉模型从开发到生产部署的复杂性问题,提供统一的推理 API,支★ 2,462AI-Engineering.academyAI-Engineering.academy 是一个专注于应用人工智能教育的开源项目,以 Jupyter Notebook 为载体,通过循序渐进的方式讲解 AI★ 2,384dstackdstack 是一个厂商中立的编排平台,专为 AI 训练、推理和智能体工作负载设计。它解决了 AI 团队在混合基础设施(云、Kubernetes、裸金属)上运行★ 2,264any-llmany-llm 是一个 Python 库,旨在通过统一的接口与多种 LLM 提供商(如 OpenAI、Anthropic、Google 等)进行通信。它解决了开★ 2,207picolmpicolm 是一个极轻量级的开源大语言模型推理引擎,专为在超低资源设备上运行 10 亿参数模型而设计,例如仅 256MB 内存、10 美元成本的开发板。它用 ★ 2,200ai-gatewayai-gateway 是一个基于 Envoy Gateway 构建的统一访问管理网关,专门用于管理和路由对各类生成式 AI 服务的请求。它解决了企业在使用多个 ★ 2,159aiciAICI(Artificial Intelligence Controller Interface)是一个开源框架,它提出了一种全新的与大语言模型交互的方式:将★ 2,076uzuuzu 是一个用 Rust 编写的高性能 AI 模型推理引擎,专注于音频和音乐相关的模型部署。它解决了在本地设备上高效运行 AI 模型(尤其是 TTS 等音频模★ 1,817InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792llmgatewayllmgateway 是一个基于 TypeScript 构建的轻量级 LLM API 网关,旨在统一管理多个大模型提供商的请求。它通过一个统一的 API 接口,★ 1,668mlx-servemlx-serve 是一个专为 Apple Silicon 设计的原生 LLM 推理服务器,使用 Zig 语言编写,无需 Python 环境。它兼容 OpenA★ 1,665xllmxllm 是一个高性能推理引擎,专为大型语言模型(LLM)、视觉语言模型(VLM)、扩散变换器(DiT)和 REC 模型设计,并针对多种 AI 加速器进行优化。★ 1,587nvidia_gpu_exporternvidia_gpu_exporter 是一个用 Go 编写的 Prometheus 导出器,通过调用 nvidia-smi 二进制文件采集 NVIDIA GP★ 1,561rtp-llmRTP-LLM是阿里巴巴开源的高性能大语言模型推理引擎,旨在为多样化的应用场景提供低延迟、高吞吐的推理服务。它解决了LLM在生产环境中部署时面临的性能瓶颈和资源★ 1,357budgetmlbudgetml 是一个面向预算有限场景的机器学习推理服务部署工具,旨在让开发者用不到 10 行代码就能将模型部署为可用的推理服务。它解决了传统 ML 部署中配★ 1,344EmbedAnythingEmbedAnything 是一个基于 Rust 构建的高性能、模块化、内存安全的向量嵌入与索引引擎,专为生产环境设计。它解决了传统 Python 嵌入库在性能★ 1,309sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302