
pegainfer
纯 Rust 直调 CUDA,OpenAI 接口跑大模型
pegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的是现有推理框架依赖庞大、部署链路复杂的问题:传统方案往往需要 PyTorch、CUDA 工具链和 Python 环境层层叠加,资源占用高且难以嵌入到 Rust 服务中。pegainfer 提供 OpenAI 兼容的 HTTP 接口,支持从 Qwen3 到 Kimi-K2、DeepSeek 等主流开源模型,内置 KV Cache 管理、GPU 推理调度和模型服务能力。核心能力包括:纯 Rust 实现带来更小的运行时体积和更可控的内存行为;直接编写 CUDA kernel 以贴近硬件优化性能;兼容 OpenAI API 协议,方便现有客户端无缝切换。适合希望在 Rust 技术栈内自建推理服务、或对部署体积和启动速度有要求的团队。
项目数据
使用教程
核心亮点
- 纯 Rust + 自研 CUDA kernel,不依赖 PyTorch/Python,运行时体积和依赖链显著更小
- 提供 OpenAI 兼容 API,现有客户端和工具链可直接接入,迁移成本低
- 已覆盖 Qwen3、Kimi-K2、DeepSeek 等主流模型,并内置 KV Cache 管理
不足之处
- 项目处于早期阶段,模型覆盖和算子优化仍在持续补齐,生产稳定性待验证
- 纯 Rust + CUDA 的技术栈门槛较高,社区贡献者和文档生态相对薄弱
适用场景
- 在 Rust 后端服务中内嵌 LLM 推理,避免引入 Python 运行时
- 对部署体积和启动速度敏感的 GPU 推理服务场景
- 需要 OpenAI 兼容接口、快速替换现有推理后端的团队
替代项目
vLLM、llama.cpp、TensorRT-LLM
项目介绍
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···