cuda

本站收录 83 个带「cuda」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945voiceboxvoicebox 是一个开源的 AI 语音工作室,旨在提供一站式的声音克隆、语音转写和语音合成能力。它解决了个人开发者和小团队难以高效构建高质量语音 AI 应用★ 55,989VoiceStudioVoiceStudio 是一个开源的 AI 语音工作站,旨在成为 ElevenLabs 的替代方案。它集成了语音克隆、配音、听写、转录、有声书创作和语音工作流编★ 47,464sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594TensorRT-LLMTensorRT-LLM 是 NVIDIA 推出的开源大语言模型推理加速库,提供易用的 Python API 来定义 LLM,并在 NVIDIA GPU 上实现★ 14,723LMCacheLMCache 是一个专为大型语言模型(LLM)推理场景设计的 KV 缓存加速层,旨在解决长上下文和多轮对话场景下推理速度慢、显存占用高的问题。它通过智能管理 ★ 11,941flashinferFlashInfer 是一个面向大语言模型推理服务的高性能 GPU 内核库,用 CUDA 和 PyTorch 实现,专注解决 LLM 部署中注意力计算、MoE ★ 6,516gpustackgpustack 是一个面向高性能 AI 模型服务的 GPU 集群管理器,专注于简化 vLLM、SGLang 等推理引擎的部署与运维。它解决了 GPU 资源利用★ 5,768CTranslate2CTranslate2 是一个专为 Transformer 类模型设计的高性能推理引擎,用 C++ 编写,支持 CPU(含 AVX、AVX2、NEON 等指令集★ 4,690SageAttention清华开源的量化注意力算子,相较 FlashAttention 可实现 2~5 倍加速,在语言、图像与视频模型上均保持端到端指标不损失,被 ICLR 2025、I★ 3,953viseronViseron 是一款自托管的本地 NVR 与 AI 计算机视觉软件,专注于隐私保护,所有视频处理均在本地完成,无需云端依赖。它解决传统监控系统智能化不足的问题★ 3,553skillsNVIDIA 官方推出的 Agent Skills 集合,专为 Claude Code、Codex 等编码代理设计,提供物理 AI、机器人、仿真、CUDA 和 ★ 3,480how-to-optim-algorithm-in-cuda这是一个专注于CUDA算法优化的开源教程项目,旨在帮助开发者掌握在NVIDIA GPU上高效实现和优化各类算法的技巧。项目通过具体案例,深入讲解CUDA编程中的★ 3,295ramalamaRamaLama 是一个开源开发者工具,旨在简化 AI 模型的本地部署与推理流程。它通过容器化技术,让开发者能够从任何来源(如 HuggingFace、Olla★ 3,064luceboxlucebox 是一个面向异构硬件与消费级 GPU 的 LLM 投机推理服务器,用 C++ 编写并深度依赖 CUDA 与自定义内核。它要解决的问题是:在非数据中★ 2,885AI-fundamentalsAI-fundamentals 是一个面向 AI 学习者的开源知识库,系统整理了 GPU 架构、CUDA 编程、大模型基础以及 AI Agent 等核心主题。项★ 2,870CV-CUDACV-CUDA 是字节跳动与英伟达联合开源、面向云规模图像处理与计算机视觉的 GPU 加速库。它针对传统 OpenCV 在 CPU 上处理高并发视频流时吞吐不足★ 2,727lupineLUPINE 是一个 GPU over IP 桥接工具,允许将远程机器上的 GPU 通过 IP 网络挂载到仅配备 CPU 的本地机器上,实现 GPU 资源的远程★ 2,435node-llama-cppnode-llama-cpp 是一个将 llama.cpp 绑定到 Node.js 的库,让你能在本地机器上直接运行 AI 模型(如 Llama、Mistral★ 2,186onediffOneDiff 是一个开箱即用的扩散模型加速库,专门针对 Stable Diffusion 等图像生成模型进行推理优化。它解决了扩散模型生成速度慢、部署成本高的★ 1,965sonarsonar 是一个面向大规模 LLM 推理场景的高性能引擎,用 C++ 编写,旨在解决大模型部署时的高延迟、低吞吐和硬件适配问题。它支持多种硬件后端,包括 NV★ 1,869beta9beta9 是一个面向 AI 推理和计算场景的超快无服务器 GPU 平台,用 Go 语言实现。它解决了传统 GPU 部署中资源利用率低、冷启动慢、环境隔离复杂等★ 1,798awesome-yolo-object-detectionawesome-yolo-object-detection 是一个精选 YOLO 目标检测系列开源项目和数据集的资源合集。它系统整理了 YOLO 从 v1 到 ★ 1,794InferenceXInferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性能评测。它把当下主流大模型(如 Kimi、MiniM★ 1,792tt-metaltt-metal 是 Tenstorrent 公司推出的底层算子库与内核编程模型,包含 TT-NN 算子库和 TT-Metalium 低层内核编程接口。它旨在为★ 1,692gpu-hotgpu-hot 是一个基于 JavaScript 开发的实时 NVIDIA GPU 监控仪表盘,以网页形式直观展示 GPU 的实时状态。它解决的是开发者和运维人★ 1,634ucclUCCL 是一个面向 GPU 的高效通信库,专注于解决大规模 AI 训练和推理中的数据传输瓶颈。它覆盖了集合通信(如 AllReduce、AllGather)、★ 1,533Chatterbox-TTS-ServerChatterbox-TTS-Server 是一个自托管的文本转语音(TTS)服务,基于强大的 Chatterbox 模型。它解决了用户需要灵活、可扩展的语音合★ 1,460zero-to-sglangzero-to-sglang 是 SGLang 官方与 Datawhale 联合推出的 LLM 推理学习课程,面向想深入理解大模型推理引擎的开发者。它解决的是「★ 1,323stable-faststable-fast 是一个专为 NVIDIA GPU 设计的 HuggingFace Diffusers 推理性能优化框架,由 WaveSpeed.ai 团★ 1,304sglang-omniSGLang-Omni 是一个基于 SGLang 的高性能多模态推理服务框架,专注于语音相关模型(TTS、ASR)及全模态(omni)模型的部署。它解决了传统语★ 1,302tiny-vllmtiny-vllm 是一个用 C++ 与 CUDA 从零实现的高性能 LLM 推理引擎教学项目,定位为 vLLM 的精简版。它解决的核心问题是:主流推理框架(如★ 1,135raftRAFT 是 NVIDIA 开源的 CUDA 加速算法与基础原语库,面向机器学习和信息检索场景。它把常用但实现复杂的底层算子(如距离计算、聚类、线性代数、最近邻★ 1,042efficient-dl-systems这是一个面向深度学习系统的高效实现课程材料仓库,由多伦多大学等机构维护,内容涵盖深度学习系统的高效训练、推理、部署等核心主题。项目通过Jupyter Noteb★ 1,039SavantSavant 是一个基于 Python 的计算机视觉与视频分析框架,构建在 NVIDIA DeepStream 和 CUDA 之上,目标是让开发者用声明式 YA★ 858cuvscuVS 是 NVIDIA 开源的 GPU 向量搜索与聚类库,属于 RAPIDS 生态的基础设施组件。它把近似最近邻搜索(ANN)、距离计算、邻居图构建和聚类等★ 857surogatesurogate 是一个专注于大语言模型训练与微调的高性能开源项目,基于 C++ 和 CUDA 实现,旨在提供“光速”般的训练体验。它针对 NVIDIA GPU★ 839caercaer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它整合了图像处理、数据增强、模型训练与评估等常用功能,提★ 818SOMA-XSOMA-X是一个统一参数化人体模型的Python开源库,旨在解决现有3D人体模型(如SMPL、SMPL-X、MANO等)格式不统一、难以互操作的问题。它提供了★ 797cressetcresset 是一个用于从源码构建 PyTorch 项目的模板仓库,支持任意版本的 PyTorch、CUDA 和 cuDNN 组合。它解决了深度学习开发中环境★ 718ServerlessLLMServerlessLLM 是一个面向大语言模型(LLM)的无服务器推理服务平台,旨在让任何人都能轻松部署和运行 LLM 服务。它解决了传统 LLM 部署中资源★ 715pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712chatterbox-tts-apiChatterbox TTS API 是一个本地部署的、兼容 OpenAI 接口的文本转语音服务,基于 Chatterbox 模型实现声音克隆。它解决了在本地或★ 685yzmayzma 是一个用 Go 语言直接封装 llama.cpp 的本地推理框架,目标是让 Go 开发者无需依赖 CGO 或外部服务,就能在应用中嵌入大语言模型和多模★ 642llm-algo-leetcodellm-algo-leetcode 是一个面向大模型算法与系统方向的开源实战教程,以 Jupyter Notebook 为主要载体,把大模型入门到进阶所需的核心★ 619x-stable-diffusionx-stable-diffusion 是一个专注于 Stable Diffusion 实时推理加速的开源项目,目标是将延迟降低至 0.88 秒。项目集成了多种主★ 556plotoptixplotoptix 是一个基于 NVIDIA OptiX 9.1 框架的 Python 数据可视化和光线追踪库。它旨在将高性能的光线追踪渲染能力引入 Pytho★ 518willow-inference-serverWillow 是一个开源的、本地自托管的语言推理服务器,专注于音频和语音场景,同时支持 ASR/STT、TTS 和 LLM 推理。它解决了在本地环境中高效部署多★ 511TensorSharpTensorSharp 是一个用 C# 编写的原生 .NET 大语言模型推理引擎,专门用于加载和运行 GGUF 格式的模型。它解决的是 .NET 生态中缺少高性★ 507AL_YoloAL_Yolo 是一个基于 YOLOv5 的实时计算机视觉系统,专注于低延迟的视觉目标检测与跟踪。它把 YOLOv5 的检测能力与屏幕采集、鼠标控制等模块结合,★ 366