chitu

让大模型推理更快更省,轻松部署高并发服务

chitu 是一个面向大语言模型的高性能推理框架,专注于效率、灵活性和可用性。它旨在解决 LLM 推理过程中的性能瓶颈和部署复杂性问题,通过优化的内核和调度策略,提供低延迟、高吞吐的模型服务能力。核心能力包括:支持多种主流模型架构、动态批处理、连续批处理、量化推理(如 INT8/FP8)以及分布式推理(张量并行)。项目基于 Python 实现,接口简洁,易于集成到现有 AI 应用或微服务中。chitu 强调对硬件资源的充分利用,并提供了灵活的配置选项,以适应不同场景下的性能与成本平衡需求。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3008
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队thu-pacman
所属国家
官网地址https://chitu.ai
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deepseek,gpu,llm,llm-serving,model-serving,pytorch
GitHub 星标★ 3008
30天Star增速
HF 下载量
上线时间2025-02-20 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 15 分钟 部署方式:命令行工具 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可从 GitHub Releases 的 Assets 页面下载文件的网络环境
  • 具备受支持的算力硬件(README 提到英伟达、昇腾、沐曦、海光、摩尔线程等多系列产品)
  • 需要部署的模型需在官方支持列表内(见 docs/zh/SUPPORTED_MODELS.md)
  • 建议先通读 docs/zh/DEVELOPMENT.md 开发手册获取完整安装使用说明

安装与启动步骤

  1. 1下载 chitu.run

    打开 GitHub Releases 页面,在对应版本的 Assets 中下载 chitu.run 可执行文件。README 明确建议使用 chitu.run 进行部署。

  2. 2查阅开发手册

    README 未给出具体命令与参数,安装使用与配置细节全部以 docs/zh/DEVELOPMENT.md 为准,请先按手册核对环境。

  3. 3确认模型支持

    在 docs/zh/SUPPORTED_MODELS.md 中核对你要部署的模型是否被支持,避免选到未适配的模型架构。

  4. 4启动推理服务

    chitu.run 为单文件可执行程序,v0.6.0 起可启动多结点、多实例、PD 分离等任务;具体启动参数请以开发手册为准。

    ./chitu.run

如何确认成功

按 docs/zh/DEVELOPMENT.md 的说明确认 chitu.run 进程正常拉起、无报错,并可用自测负载成功请求到模型服务。

常见问题

Q:chitu 应该怎么安装?

A:README 建议直接使用 chitu.run 部署,从 GitHub Releases 的 Assets 页面下载该可执行文件;完整安装使用说明见开发手册 docs/zh/DEVELOPMENT.md。

Q:支持哪些模型?

A:需查看 docs/zh/SUPPORTED_MODELS.md。里程碑显示已支持 DeepSeek、Qwen、GLM、Kimi 等模型,例如 DeepSeek-R1 671B、GLM-4.5 MoE、Qwen3 系列。

Q:支持哪些硬件?

A:README 提到多元算力适配,除了 NVIDIA 多系列产品外,还适配昇腾、沐曦、海光、摩尔线程等国产芯片,并提供纯 CPU 部署方案。

Q:遇到问题怎么获得技术支持?

A:可以致信 solution@chitu.ai 获取专业技术服务;项目团队也说明因精力有限,无法保证及时解决所有使用问题。

Q:性能数据在哪里看?

A:开发团队测试的性能数据见 docs/zh/PERFORMANCE.md,也可以到 GitHub Discussions 分享或查看自测数据。

注意事项

  • README 未提供任何具体安装命令、参数、端口或路径,实际部署请严格以 docs/zh/DEVELOPMENT.md 为准
  • 性能数据与硬件配置、软件版本、测试负载相关,多次测试结果可能存在波动
  • 纯 CPU 场景也可部署,但大规模集群与高吞吐场景需要相应算力资源
  • 项目迭代较快(v0.1.0 至 v0.6.0),建议确认所用版本与硬件、模型的适配情况

核心亮点

  • 聚焦推理性能优化,提供低延迟高吞吐的 serving 能力
  • 支持多种量化方案(如 FP8/INT8),降低显存占用和成本
  • 具备动态批处理和连续批处理,提升 GPU 利用率

不足之处

  • 项目相对年轻,生态和周边工具链尚不成熟
  • 文档和社区支持有待完善,新手上手可能有一定门槛

适用场景

  • 云端 LLM 服务部署,提供高并发的 API 推理
  • 企业内部私有化部署大模型,降低硬件成本
  • 边缘设备或资源受限环境下的模型推理优化

替代项目

vLLM、TensorRT-LLM、SGLang

项目介绍

chitu 是基础设施领域的开源项目,由 thu-pacman 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,008)位列前 30%,在基础设施分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:云端LLM服务部署,提供高并发的API推理。同类可对比的替代方案包括 vLLM、TensorRT-LLM、SGLang。

上一篇:harbor

下一篇:mesh-llm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09