xllm

一套引擎,跑遍各类模型和加速器,推理更快更省心。

xllm 是一个高性能推理引擎,专为大型语言模型(LLM)、视觉语言模型(VLM)、扩散变换器(DiT)和 REC 模型设计,并针对多种 AI 加速器进行优化。它托管于开放原子基金会,旨在解决 AI 模型在不同硬件上推理性能不足和部署复杂的问题。核心能力包括:支持多种模型架构,提供统一的推理接口,通过算子融合、内存优化等技术提升推理速度,并适配 CPU、GPU 及各类 AI 芯片。项目采用 C++ 实现,强调跨平台和高效执行,适合在边缘设备和数据中心部署。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1578
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队xLLM-AI
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型deepseek,glm,inference,inference-engine,large-language-models,llm-inference,qwen
GitHub 星标★ 1578
30天Star增速
HF 下载量
上线时间2025-08-12 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:高级 约 30 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 与官方文档站点 docs.xllm-ai.com 的网络环境
  • 已下载目标模型权重(如 GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4 等,README 仅给链接)
  • C++ 构建/运行环境(项目以 C++ 实现,README 未给出具体依赖)
  • 可用的推理硬件:CPU 或各类 AI 加速器(README 未列出具体要求)

安装与启动步骤

  1. 1获取项目源码

    从 GitHub 克隆 xLLM 仓库到本地,README 未给出其他获取方式。

    git clone https://github.com/xLLM-AI/xllm.git
  2. 2阅读快速开始

    README 的 Getting Started 只提供官方文档链接,安装命令以该页为准。

  3. 3按文档启动 xLLM

    打开 Launch xLLM 文档,按其步骤完成引擎的启动配置。

  4. 4选择在线或离线模式

    在线服务适合常驻接口调用,离线推理适合批量任务,按场景选其一。

  5. 5确认模型是否支持

    在 Supported Models 页面核对你要部署的模型是否在支持列表中。

  6. 6参考模型部署脚本

    README 对新模型给出 testspace 下的部署脚本,可作为配置示例参考。

如何确认成功

README 未提供启动命令、端口或日志,需以官方 Quick Start 文档给出的校验方式为准。

常见问题

Q:README 里为什么没有安装命令?

A:本仓库 README 的 Getting Started 只给出官方文档链接,实际安装与启动步骤需到 docs.xllm-ai.com 查看,本教程因此不提供未经验证的命令。

Q:想部署 GLM-5.3-Flash / MiniMax-M3 / DeepSeek-V4 怎么办?

A:README 的 News 中给出了对应模型的部署文档(testspace 下的 run_*.sh 脚本),按脚本中的配置进行部署即可。

Q:支持哪些模型?

A:以官方文档的 Supported Models 页面为准,README 只列出了近期 day-0 支持的部分模型。

Q:需要什么硬件?

A:项目针对多种 AI 加速器及 CPU 做了优化,README 未给出具体硬件清单,请查阅官方文档的部署要求。

注意事项

  • 本教程严格依据 README 节选整理,README 未提供的命令、端口、路径一律未编写,实际安装请以 docs.xllm-ai.com 官方文档为准。
  • xLLM 已于 2026-07-06 捐赠给开放原子基金会(OpenAtom Foundation),项目归属与许可信息请以仓库最新说明为准。
  • 项目采用 Apache License 2.0 许可,商用前请阅读许可证条款。

核心亮点

  • 同时支持 LLM、VLM、DiT 和 REC 四类模型,覆盖主流生成式 AI 场景
  • 针对多种 AI 加速器优化,不绑定单一硬件,适配灵活
  • 背靠开放原子基金会,社区治理和长期维护有保障

不足之处

  • 文档/社区待观察
  • 项目尚在成长中,生态和工具链成熟度可能不及老牌引擎

适用场景

  • 在边缘设备上部署 LLM 实现低延迟推理
  • 多模态模型(VLM)在智能终端上的实时推理
  • 异构计算环境中统一推理引擎,降低适配成本

替代项目

llama.cpp、vLLM、TensorRT-LLM

项目介绍

xllm 是基础设施领域的开源项目,由 xLLM-AI 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,578)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,518 增加到 1,578,净增 60。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:在边缘设备上部署LLM实现低延迟推理。同类可对比的替代方案包括 llama.cpp、vLLM、TensorRT-LLM。

上一篇:ggml

下一篇:llm-sandbox

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09