chitu 是基础设施领域的开源项目,由 thu-pacman 开发,2025 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(3,008)位列前 30%,在基础设施分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:云端LLM服务部署,提供高并发的API推理。同类可对比的替代方案包括 vLLM、TensorRT-LLM、SGLang。

让大模型推理更快更省,轻松部署高并发服务
chitu 是一个面向大语言模型的高性能推理框架,专注于效率、灵活性和可用性。它旨在解决 LLM 推理过程中的性能瓶颈和部署复杂性问题,通过优化的内核和调度策略,提供低延迟、高吞吐的模型服务能力。核心能力包括:支持多种主流模型架构、动态批处理、连续批处理、量化推理(如 INT8/FP8)以及分布式推理(张量并行)。项目基于 Python 实现,接口简洁,易于集成到现有 AI 应用或微服务中。chitu 强调对硬件资源的充分利用,并提供了灵活的配置选项,以适应不同场景下的性能与成本平衡需求。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1下载 chitu.run
打开 GitHub Releases 页面,在对应版本的 Assets 中下载 chitu.run 可执行文件。README 明确建议使用 chitu.run 进行部署。
2查阅开发手册
README 未给出具体命令与参数,安装使用与配置细节全部以 docs/zh/DEVELOPMENT.md 为准,请先按手册核对环境。
3确认模型支持
在 docs/zh/SUPPORTED_MODELS.md 中核对你要部署的模型是否被支持,避免选到未适配的模型架构。
4启动推理服务
chitu.run 为单文件可执行程序,v0.6.0 起可启动多结点、多实例、PD 分离等任务;具体启动参数请以开发手册为准。
./chitu.run按 docs/zh/DEVELOPMENT.md 的说明确认 chitu.run 进程正常拉起、无报错,并可用自测负载成功请求到模型服务。
Q:chitu 应该怎么安装?
A:README 建议直接使用 chitu.run 部署,从 GitHub Releases 的 Assets 页面下载该可执行文件;完整安装使用说明见开发手册 docs/zh/DEVELOPMENT.md。
Q:支持哪些模型?
A:需查看 docs/zh/SUPPORTED_MODELS.md。里程碑显示已支持 DeepSeek、Qwen、GLM、Kimi 等模型,例如 DeepSeek-R1 671B、GLM-4.5 MoE、Qwen3 系列。
Q:支持哪些硬件?
A:README 提到多元算力适配,除了 NVIDIA 多系列产品外,还适配昇腾、沐曦、海光、摩尔线程等国产芯片,并提供纯 CPU 部署方案。
Q:遇到问题怎么获得技术支持?
A:可以致信 solution@chitu.ai 获取专业技术服务;项目团队也说明因精力有限,无法保证及时解决所有使用问题。
Q:性能数据在哪里看?
A:开发团队测试的性能数据见 docs/zh/PERFORMANCE.md,也可以到 GitHub Discussions 分享或查看自测数据。
vLLM、TensorRT-LLM、SGLang
chitu 是基础设施领域的开源项目,由 thu-pacman 开发,2025 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(3,008)位列前 30%,在基础设施分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。
它主要面向的使用场景是:云端LLM服务部署,提供高并发的API推理。同类可对比的替代方案包括 vLLM、TensorRT-LLM、SGLang。
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···