inference

一行代码切换任意大模型,部署推理全搞定

Xinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模态模型,并支持在云端、本地或笔记本电脑上运行。项目提供生产就绪的推理 API,兼容 OpenAI 协议,覆盖模型管理、推理加速、分布式部署等核心能力,并内置 WebUI 便于可视化操作。通过标准化接口,它降低了模型切换成本,提升了 AI 应用开发的灵活性与可移植性。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 9588
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队xorbitsai
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费自部署使用,无在线服务或付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型artificial-intelligence,deployment,diffusers,gemma,glm,glm-5-3,inference,kimi,kimi-k3,llama-cpp,llamacpp,llm,machine-learning,openai-api,pytorch,qwen,sglang,transformers,vllm,whisper
GitHub 星标★ 9588
30天Star增速
HF 下载量
上线时间2023-06-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:Docker 5 步

环境要求

  • Python 环境(用于 pip 安装 xinference)
  • Docker(使用 Docker 镜像部署时需先安装)
  • CUDA(Nvidia GPU 用户使用 Docker 镜像前需配置)
  • Helm 与 Kubernetes 集群(仅 K8s 部署方式需要)

安装与启动步骤

  1. 1pip 安装 Xinference

    使用 pip 安装完整版 Xinference,包含全部依赖;如需精简安装方式可参考官方 Installation 页面。

    pip install "xinference[all]"
  2. 2启动本地服务

    运行该命令在本地启动 Xinference 实例,启动后可通过 WebUI、cURL、命令行或 Python 客户端调用。

    xinference-local
  3. 3Docker 部署(GPU)

    Nvidia GPU 用户可用官方镜像启动服务,把 换成宿主机真实目录,端口映射为 9997。

    docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v :/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0
  4. 4K8s Helm 部署

    在 Kubernetes 集群中用 Helm 安装 Xinference,把 换成实际版本号;更多定制方式见文档。

    helm install xinference xinference/xinference -n xinference --version 0.0.1-v
  5. 5访问并调用服务

    服务运行后,通过 WebUI、cURL、命令行或 Xinference Python 客户端试用,调用方式见官方文档。

关键配置

配置项必填说明示例
XINFERENCE_HOME否容器内 Xinference 数据存放目录,Docker 部署时通过 -e 设置/data
-v :/data是将宿主机目录挂载到容器数据目录,需替换为真实路径/home/user/xinference:/data
-p 9997:9997是端口映射,宿主机 9997 映射到容器 99979997:9997

如何确认成功

服务启动后端口 9997 可访问,通过 WebUI、cURL、命令行或 Python 客户端确认可正常调用模型。

常见问题

Q:Docker 方式启动前需要准备什么?

A:需先在系统上安装并配置好 Docker 与 CUDA(Nvidia GPU 用户),然后再执行 docker run 命令。

Q:有几种部署方式可选?

A:README 给出三种:pip 本地安装后运行 xinference-local、Docker 镜像启动、以及 Kubernetes 上的 Helm 安装。

Q:安装后怎么试用?

A:可通过 Web UI、cURL、命令行或 Xinference 的 Python 客户端四种方式,具体用法参考官方文档。

Q:安装方式不止 pip 一种吗?

A:README 说明 pip install "xinference[all]" 只是其中一种,更多安装选项见官方 Installation 页面。

注意事项

  • Docker 命令中的 是占位符,执行前必须替换为宿主机真实目录路径。
  • Helm 命令中的 需替换为实际的发布版本号。
  • GPU 部署依赖 CUDA,未配置 CUDA 环境时不要使用 --gpus all 参数。
  • 更多安装、内置模型、自定义模型与部署细节请查阅 inference.readthedocs.io 官方文档。

核心亮点

  • 一行代码即可从 GPT 切换到其他 LLM,迁移成本极低
  • 统一 API 兼容 OpenAI 协议,可直接替换现有应用
  • 支持文本、语音、多模态模型,覆盖场景广泛

不足之处

  • 文档/社区待观察
  • 多模型兼容可能导致部分模型特性无法完全发挥

适用场景

  • 快速原型开发,需要灵活切换不同大模型
  • 企业内部统一模型推理入口,管理多种模型
  • 边缘设备或本地环境部署开源模型,避免云端依赖

替代项目

Ollama、vLLM、LocalAI

项目介绍

inference 是基础设施领域的开源项目,由 xorbitsai 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(9,588)位列前 6%,在基础设施分类的 1,130 个项目里位列前 8%。

近 41 天,它的 GitHub 星标从 9,489 增加到 9,588,净增 99。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可免费自部署使用,无在线服务或付费版本。

它主要面向的使用场景是:快速原型开发,需要灵活切换不同大模型。同类可对比的替代方案包括 Ollama、vLLM、LocalAI。

上一篇:seatunnel

下一篇:ipex-llm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09