gpu

本站收录 75 个带「gpu」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

skypilot面向前沿 AI 团队的计算平台,将分散在不同云厂商的 GPU 算力整合成一台“AI 超级计算机”。它支持在多云环境下统一调度资源、自动选型最优实例并显著节省成本★ 10,665ipex-llmipex-llm 是英特尔推出的开源工具库,旨在加速本地大语言模型(LLM)的推理和微调。它支持在 Intel XPU(包括集成显卡、独立显卡如 Arc/Fle★ 8,853flashinferFlashInfer 是一个面向大语言模型推理服务的高性能 GPU 内核库,用 CUDA 和 PyTorch 实现,专注解决 LLM 部署中注意力计算、MoE ★ 6,516lemonadeLemonade 是一个面向本地 AI 应用的开源推理引擎,旨在让用户直接在自己的 GPU 和 NPU 上运行优化后的大语言模型。它解决了云端 AI 带来的隐私★ 5,797llm-dllm-d 是一个专注于在 Kubernetes 上实现现代加速器(如 GPU)上最先进推理性能的开源项目。它解决了在云原生环境中部署大型语言模型时面临的性能瓶★ 4,679serveServe 是一个用于在生产环境中部署、优化和扩展 PyTorch 模型的开源基础设施项目。它解决了将训练好的 PyTorch 模型高效、稳定地服务化的问题,提★ 4,344deepflowDeepFlow 是一个基于 eBPF 的分布式追踪与性能剖析平台,旨在解决云原生环境下应用可观测性不足的问题。它利用 eBPF 技术自动采集应用、网络和系统层★ 4,283StringZillaStringZilla 是一个跨语言的高性能字符串处理库,专为加速字符串搜索、哈希、排序、编辑距离计算、相似度草图和内存操作而设计。它利用现代 CPU 的 SI★ 3,569chituchitu 是一个面向大语言模型的高性能推理框架,专注于效率、灵活性和可用性。它旨在解决 LLM 推理过程中的性能瓶颈和部署复杂性问题,通过优化的内核和调度策略★ 3,010CV-CUDACV-CUDA 是字节跳动与英伟达联合开源、面向云规模图像处理与计算机视觉的 GPU 加速库。它针对传统 OpenCV 在 CPU 上处理高并发视频流时吞吐不足★ 2,727paipai 是一个面向 AI 场景的资源调度与集群管理平台,主要解决 GPU 等异构计算资源在深度学习训练和推理任务中的分配效率问题。它支持多种 AI 框架(如 C★ 2,694openlakeOpenLake 是一个用 Rust 编写的高性能存储引擎,专为大型语言模型(LLM)推理和 GPU 训练而设计。它解决的是传统数据存储系统在 AI 工作负载下★ 2,656deepdetectdeepdetect 是一个开源的深度学习服务器和命令行工具,最初由 Jolibrain 开发,旨在简化深度学习模型的部署和服务化。它支持多种深度学习框架,包括★ 2,551lupineLUPINE 是一个 GPU over IP 桥接工具,允许将远程机器上的 GPU 通过 IP 网络挂载到仅配备 CPU 的本地机器上,实现 GPU 资源的远程★ 2,435dstackdstack 是一个厂商中立的编排平台,专为 AI 训练、推理和智能体工作负载设计。它解决了 AI 团队在混合基础设施(云、Kubernetes、裸金属)上运行★ 2,264trainertrainer 是一个基于 Kubernetes 的分布式 AI 模型训练与 LLM 微调平台,由开源社区维护。它解决了在 Kubernetes 上运行大规模训★ 2,234node-llama-cppnode-llama-cpp 是一个将 llama.cpp 绑定到 Node.js 的库,让你能在本地机器上直接运行 AI 模型(如 Llama、Mistral★ 2,186beta9beta9 是一个面向 AI 推理和计算场景的超快无服务器 GPU 平台,用 Go 语言实现。它解决了传统 GPU 部署中资源利用率低、冷启动慢、环境隔离复杂等★ 1,798InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792tt-metaltt-metal 是 Tenstorrent 公司推出的底层算子库与内核编程模型,包含 TT-NN 算子库和 TT-Metalium 低层内核编程接口。它旨在为★ 1,692gpu-hotgpu-hot 是一个基于 JavaScript 开发的实时 NVIDIA GPU 监控仪表盘,以网页形式直观展示 GPU 的实时状态。它解决的是开发者和运维人★ 1,634ucclUCCL 是一个面向 GPU 的高效通信库,专注于解决大规模 AI 训练和推理中的数据传输瓶颈。它覆盖了集合通信(如 AllReduce、AllGather)、★ 1,533gpu_poorgpu_poor 是一个用于估算任意大语言模型(LLM)在本地部署时所需 GPU 显存和推理速度(token/s)的命令行工具。它通过解析模型的参数量、量化方式★ 1,400auto-deep-researcher-24x7这是一个自主运行深度学习实验的AI智能体,能在你睡觉时24/7不间断地执行实验任务。它解决的是研究人员需要长时间盯守实验、手动调参和监控的痛点。核心能力包括:基★ 1,293modal-examplesmodal-examples 是 Modal 官方维护的示例库,集中展示了如何在 Modal 无服务器云平台上构建和运行各类 AI 与机器学习程序。它解决了开发★ 1,272tty7tty7 是一个用纯 Rust 构建的终端工作台,旨在将传统终端模拟器与现代 AI 编码代理能力整合到一个 GPU 加速的界面中。它基于 Alacritty 的★ 1,181raftRAFT 是 NVIDIA 开源的 CUDA 加速算法与基础原语库,面向机器学习和信息检索场景。它把常用但实现复杂的底层算子(如距离计算、聚类、线性代数、最近邻★ 1,042SiliconScopeSiliconScope 是一款面向 Apple Silicon Mac 的原生系统监控工具,用 SwiftUI 编写,无需 sudo 权限即可运行。它解决的核★ 966mosecmosec 是一个高性能的机器学习模型服务框架,专注于解决模型部署中的吞吐量和资源利用率问题。它通过动态批处理(dynamic batching)和 CPU/G★ 902cuvscuVS 是 NVIDIA 开源的 GPU 向量搜索与聚类库,属于 RAPIDS 生态的基础设施组件。它把近似最近邻搜索(ANN)、距离计算、邻居图构建和聚类等★ 857Deep-learning-in-cloud这是一个整理深度学习云服务提供商的精选列表,旨在帮助开发者和企业快速找到适合的云端AI训练与推理平台。项目以清单形式汇总了各大主流云厂商(如AWS、Google★ 828caercaer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它整合了图像处理、数据增强、模型训练与评估等常用功能,提★ 818SOMA-XSOMA-X是一个统一参数化人体模型的Python开源库,旨在解决现有3D人体模型(如SMPL、SMPL-X、MANO等)格式不统一、难以互操作的问题。它提供了★ 797can-i-finetune-this这是一个帮助开发者快速判断 Hugging Face 上的模型能否在本地 GPU 上进行微调的工具。它通过分析模型的参数量、架构和精度,结合用户 GPU 的显存★ 792devitoDevito 是一个基于 Python 的领域特定语言(DSL)与编译器框架,专门用于自动生成有限差分和模板(stencil)计算的高性能代码。它解决的核心问题★ 715pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712LoongForgeLoongForge 是一个面向大模型训练的统一高性能框架,支持在 NVIDIA GPU 和昆仑芯 XPU 上训练 LLM、VLM、扩散模型及具身智能模型。它解★ 582examplesCerebrium 是一个无服务器 GPU 平台,这个名为 examples 的仓库是它的官方示例集合,包含多种机器学习工作负载的部署代码,如 Stable D★ 526plotoptixplotoptix 是一个基于 NVIDIA OptiX 9.1 框架的 Python 数据可视化和光线追踪库。它旨在将高性能的光线追踪渲染能力引入 Pytho★ 518JetStreamJetStream 是一个面向 XLA 设备(当前以 TPU 为主,未来计划支持 GPU)的 LLM 推理引擎,专注于提升吞吐量和优化内存使用。它解决了在 TP★ 461rag-chatbotrag-chatbot 是一个基于检索增强生成(RAG)的对话助手,专门从 Markdown 文件集合中提取上下文信息来回答用户问题。它解决了传统 LLM 依赖★ 445rust-mlops-templaterust-mlops-template 是一个正在开发中的开源项目,旨在使用 Rust 语言构建机器学习运维(MLOps)解决方案的模板。它针对当前 MLOps★ 385VL.FuseVL.Fuse 是一个基于 GPU 的可视化编程库,专为加速图形、逻辑和计算而设计。它构建在 VL(vvvv 的视觉语言)之上,允许用户通过节点图而非传统代码来★ 314clearml-agentClearML Agent 是 ClearML 平台的核心调度与编排组件,负责执行远程任务、管理队列并调度 GPU 等计算资源。它解决了 MLOps/LLMOp★ 313terraform-provider-iterativeterraform-provider-iterative 是一个 Terraform 插件,专为机器学习工作负载设计,用于在 AWS、GCP、Azure 和 K★ 295ContainariumContainarium 是一个开源的智能体运行时,专注于为 AI 代理提供安全、隔离的执行环境。它通过 SSH 原生隔离、eBPF 出口策略、Kubernet★ 291TurboLLMTurboLLM 是一个面向本地大模型推理的基础设施工具,用 TypeScript 编写,目标是让任何人都能在自己的显卡上跑起任意本地 LLM 引擎。它自动检测★ 278LLMKubeLLMKube 是一个 Kubernetes Operator,用于在异构 GPU 集群上自托管大模型推理。它解决的核心问题是:家里或公司机房里混着 NVIDI★ 220aimirroraimirror 是一个面向 AI 时代的下载加速工具,通过并行分片与智能缓存技术,将模型、数据集等大文件的下载速度提升至原来的 200 倍。它支持 Docke★ 215homelab-monitorhomelab-monitor 是一个即插即用的家庭实验室(homelab)仪表盘,以单个容器形式部署,集中展示 GPU 使用率、本地 AI 显存占用、Dock★ 207