JetStream

在 TPU 上榨干每一分性能,让 LLM 推理更快更省内存

JetStream 是一个面向 XLA 设备(当前以 TPU 为主,未来计划支持 GPU)的 LLM 推理引擎,专注于提升吞吐量和优化内存使用。它解决了在 TPU 上高效运行大语言模型推理时面临的性能瓶颈问题,通过底层优化实现更快的推理速度和更低的资源占用。核心能力包括针对 XLA 编译器的深度优化、内存管理策略以及高效的批处理机制,使得在 TPU 硬件上部署和运行 LLM 服务更加经济高效。项目目前处于早期阶段,代码库活跃,但文档和生态尚在建设中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 460
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队AI-Hypercomputer
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型gemma,gpt,gpu,inference,jax,large-language-models,llama,llama2,llm,llm-inference,llmops,mlops,model-serving,pytorch,tpu,transformer
GitHub 星标★ 460
30天Star增速
HF 下载量
上线时间2024-03-01 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 针对 TPU 的 XLA 深度优化,推理吞吐量显著提升
  • 内存使用优化,支持更大模型或更长上下文
  • 与 JAX 生态集成良好,便于现有 XLA 工作流迁移

不足之处

  • 目前仅支持 TPU,GPU 支持尚在规划中
  • 项目处于早期,文档和社区生态待观察

适用场景

  • 在 Google Cloud TPU 上部署大模型推理服务
  • 需要高吞吐量、低延迟的 LLM 在线推理场景
  • 研究或生产环境中对 TPU 资源利用率有极致要求的场景

替代项目

vLLM、TensorRT-LLM、TGI (Hugging Face Text Generation Inference)

项目介绍

JetStream 是基础设施领域的开源项目,由 AI-Hypercomputer 开发,2024 年首次发布。

它收录于基础设施分类,该分类目前共有 1,132 个项目,GitHub 星标数为 460。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:在GoogleCloudTPU上部署大模型推理服务。同类可对比的替代方案包括 vLLM、TensorRT-LLM、TGI (Hugging Face Text Generation Inference)。

上一篇:lilypad

下一篇:scalax

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09