kimi-k3-in-c

在普通 CPU 上跑起万亿参数大模型,内存仅需 8G。

kimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78 万亿参数的模型。该项目不依赖任何 BLAS 库、深度学习框架或 GPU,完全通过极致的量化与内存优化,将超大规模模型的推理门槛降到普通消费级硬件。它解决了大模型部署中硬件成本高昂、依赖复杂的问题,核心能力包括模型量化、内存映射加载、纯 C 推理内核等,适合在资源受限或需要高度可控的环境中运行大模型。项目目前处于成长阶段,代码开源,便于研究者与开发者进行定制和移植。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8267
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队FareedKhan-dev
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用、修改和分发,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言C
技术栈/模型avx2,c99,cpu-inference,deep-learning,from-scratch,inference-engine,kimi-k3,linear-attention,llm,llm-inference,machine-learning,memory-efficient,mixture-of-experts,moe,mxfp4,quantization,simd,systems-programming,transformer,zero-dependencies
GitHub 星标★ 8267
30天Star增速
HF 下载量
上线时间2026-08-01 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:高级 约 20 分钟 部署方式:命令行工具 7 步

环境要求

  • Linux x86-64 平台(README 徽章标明 Platform: Linux x86-64)
  • C99 编译器与 OpenMP(make -j 只需编译器与 OpenMP,数个 C 文件在数秒内编译完成)
  • Python 3.9+ 与 numpy(仅在运行 tools/sim_cache.py 复现缓存容量表时需要)
  • 磁盘空间:checkpoint 在磁盘上约 1.56 TB,打包后的 trunk 文件约 109 GB
  • 内存:最小可行配置约 8.24 GB 峰值 RSS(--preset laptop),内存越大速度越快

安装与启动步骤

  1. 1克隆仓库

    把源码克隆到本地并进入目录,README 说明整个快速上手不需要 checkpoint、网络和 Python。

    git clone https://github.com/FareedKhan-dev/kimi-k3-in-c.git
    cd kimi-k3-in-c
  2. 2编译引擎

    执行默认目标,几秒钟完成,只需编译器与 OpenMP,不依赖 BLAS、框架或 GPU。

    make -j
  3. 3跑完整测试

    运行无权重测试套件,一分钟内结束,用来确认引擎与参考实现完全一致。

    make test
  4. 4环境自检

    k3-doctor.sh 可随时运行,会检查工具链、按预设评估内存大小、测量存储并打印下一步命令。

    ./scripts/k3-doctor.sh
  5. 5打包主干

    把 93 个稠密层重写成一个 109 GB 文件,约四分钟只做一次;输出目录要放在你最快的磁盘上。

    ./scripts/pack-trunk.sh ~/k3model ~/k3trunk
  6. 6运行推理

    用 laptop 预设跑最小可行配置,tokenizer 随 checkpoint 提供,所以 --tok 指向模型目录。

    ./bin/k3 ~/k3model --trunk ~/k3trunk --preset laptop 
             --tok ~/k3model --prompt "Hello! My name is" --gen 16 --incremental
  7. 7复现缓存测量

    可选步骤,从仓库内的 trace 文件复现 100,096 次专家请求的容量表,需要 Python 3.9+ 和 numpy。

    python3 tools/sim_cache.py tests/fixtures/expert_trace.bin

关键配置

配置项必填说明示例
--trunk是指向 pack-trunk.sh 生成的主干文件目录~/k3trunk
--preset是内存预设,用于确定驻留层数laptop
--tok是tokenizer 路径,指向模型目录本身~/k3model
--prompt否直接写在命令行的提示词"The capital of France is"
--gen否生成的 token 数量16
--incremental否启用增量解码,使用 KV cache 与携带的 KDA 状态--incremental

如何确认成功

make test 输出末尾出现 “ALL WEIGHTLESS TESTS PASSED” 及 “VERDICT: ENGINE MATCHES THE REFERENCE EXACTLY”,三个 GATE 均为满分。

常见问题

Q:需要 GPU 或深度学习框架吗?

A:不需要。项目是纯 C99 实现的 CPU 推理引擎,不依赖 BLAS、框架和 GPU,三者的数量都是 0。

Q:make test 需要先下载 1.56 TB 的模型吗?

A:不需要。测试完全无权重,不需要 checkpoint、网络和 Python,整件事大约一分钟,用的是仓库内提交的 fixtures 和 PyTorch 参考结果。

Q:8.24 GB 内存真的够吗?

A:README 给出的 8.24 GB 是实测峰值 RSS。用 --preset laptop 即最小可行运行;内存越多只是越快,不会改变答案。

Q:启动时报 REFUSING TO START 怎么办?

A:说明需求内存超过可用内存的 95%。可选方案是换更大的机器、调小 --cache-gb,或减少层数(--layers)。

Q:为什么 --trunk 和 --tok 都指向模型相关目录?

A:--trunk 指向打包输出的主干文件目录,--tok 指向模型目录,因为 tokenizer 是随 checkpoint 一起发布的。

注意事项

  • README 节选未给出 checkpoint 的下载地址,需自行准备模型并放到 ~/k3model 这类目录后再执行打包与运行。
  • pack-trunk.sh 约需四分钟并生成约 109 GB 文件,README 建议把输出放在最快的磁盘上。
  • 引擎在分配内存前会先做一次预测性检查,若预计需求超过可用内存 95% 会拒绝启动。
  • README 说明内存计划只是预测值,应以运行结束时打印的 PEAK RSS 作为真实内存占用。

核心亮点

  • 纯 C99 实现,无外部依赖,编译和部署极简
  • 内存占用极低(8.24GB),消费级 CPU 即可运行
  • 支持 2.78T 参数模型,展示极致的量化与压缩技术

不足之处

  • 推理速度可能较慢,实际性能待验证
  • 文档/社区待观察

适用场景

  • 在无 GPU 的服务器或边缘设备上部署大模型
  • 研究模型量化与内存优化的教学案例
  • 需要完全离线、可控的推理环境

替代项目

llama.cpp、ggml、whisper.cpp

项目介绍

kimi-k3-in-c 是基础设施领域的开源项目,由 FareedKhan-dev 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,267)位列前 6%,在基础设施分类的 1,132 个项目里位列前 8%。

近 41 天,它的 GitHub 星标从 5,187 增加到 8,267,净增 3,080。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可自由使用、修改和分发,无付费版本。

它主要面向的使用场景是:在无GPU的服务器或边缘设备上部署大模型。同类可对比的替代方案包括 llama.cpp、ggml、whisper.cpp。

上一篇:llm-d

下一篇:gigatoken

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09