kalosm

在 Rust 中本地跑 AI 模型,快、可控、隐私安全

kalosm 是一个用 Rust 编写的本地预训练 AI 模型推理框架,旨在让开发者能够以极低的延迟和完全可控的方式在本地运行大语言模型、语音识别和图像生成等模型。它解决了传统 AI 服务依赖云端 API 带来的延迟高、隐私泄露和成本不可控问题,同时弥补了 Rust 生态中缺乏易用、统一的本地模型推理库的空白。核心能力包括:支持多种模型格式(如 GGML、GGUF)和 Hugging Face 模型下载;提供流式生成、工具调用、结构化输出(如 JSON)等高级接口;内置语音输入(whisper)和文本转语音(piper)支持;并集成了检索增强生成(RAG)和向量数据库,方便构建知识库问答等应用。kalosm 强调“即时”和“可控”,允许开发者精细调整采样参数和模型行为,适合对性能和隐私有高要求的场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2230
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队floneum
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,本地部署,完全免费。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Rust
技术栈/模型ai,candle,constrained-generation,dioxus,floneum-v3,kalosm,llama,llamacpp,llm,mistral,rust,transcription,whisper
GitHub 星标★ 2230
30天Star增速
HF 下载量
上线时间2023-05-24 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 15 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Rust 工具链(cargo、rustc),安装方式见 https://rustup.rs/
  • 需要联网,首次运行会自动下载所用模型权重
  • 建议在 release 模式下编译运行以获得可用速度
  • 一个可创建并编辑文件的终端环境

安装与启动步骤

  1. 1安装 Rust 工具链

    访问 https://rustup.rs/ 按官方指引安装 Rust,安装完成后确认 cargo 命令可用。README 未给出具体安装命令。

  2. 2新建 Rust 项目

    用 cargo 创建名为 kalosm-hello-world 的新二进制项目,并进入该目录准备后续修改。

    cargo new kalosm-hello-world
    cd ./kalosm-hello-world
  3. 3添加依赖

    通过 cargo add 把 kalosm(启用 llama feature)和 tokio(启用 full feature)加入 Cargo.toml 依赖。

    cargo add kalosm --features llama
    cargo add tokio --features full
  4. 4写入示例代码

    把 README 的聊天机器人示例写入 src/main.rs,使用 Llama::phi_3() 加载模型并进入循环对话。

    use kalosm::language::*;
    
    #[tokio::main]
    async fn main() -> Result<(), Box> {
      let model = Llama::phi_3().await?;
      let mut chat = model.chat()
        .with_system_prompt("You are a pirate called Blackbeard");
    
      loop {
        chat(&prompt_input("
    > ")?)
          .to_std_out()
          .await?;
      }
    }
  5. 5编译并运行

    在项目目录执行 release 模式运行,首次会下载模型,随后可在终端中与聊天机器人对话。

    cargo run --release

如何确认成功

终端出现 "> " 输入提示符,输入内容后能看到模型流式输出回复,即表示运行成功。

常见问题

Q:第一次运行卡住很久没反应?

A:首次运行需要下载 phi-3 等模型权重并编译依赖,属于正常现象;请保持网络畅通并耐心等待。

Q:运行速度和响应很慢怎么办?

A:务必使用 README 给出的 cargo run --release,debug 模式下推理会非常慢;同时关闭占用资源的程序。

Q:提示找不到 tokio 或 async 相关错误?

A:确认已执行 cargo add tokio --features full,且 main.rs 中包含 #[tokio::main] 属性宏。

Q:想换其他模型或功能怎么办?

A:README 提供了更多示例,见 interfaces/kalosm/examples 目录以及官网 https://floneum.com/kalosm/。

注意事项

  • 示例默认使用 Llama::phi_3(),README 未说明其具体大小与硬件要求,请留意磁盘与内存占用。
  • 除 llama 外还有其他 feature 与模型支持,README 的模型表格列出了当前支持的模型。
  • 所有命令均来自 README 的 Quickstart,未在 README 中出现的参数请勿自行添加。

核心亮点

  • 纯 Rust 实现,性能高,内存安全,适合嵌入式和高并发场景
  • 支持流式生成、结构化输出和工具调用,便于构建复杂 Agent 应用
  • 内置语音识别与合成,以及 RAG 和向量数据库,功能全面

不足之处

  • 项目仍处于早期阶段,API 可能不稳定,文档和示例有待完善
  • 生态相对较小,模型支持范围不如 Python 生态广泛

适用场景

  • 本地私有化部署聊天机器人,保护数据隐私
  • 构建低延迟的实时语音交互应用
  • 在资源受限的边缘设备上运行轻量级 AI 模型

替代项目

llama.cpp、candle、mistral.rs

项目介绍

kalosm 是开源模型领域的开源项目,由 floneum 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,230)位列前 30%,在开源模型分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,本地部署,完全免费。

它主要面向的使用场景是:本地私有化部署聊天机器人,保护数据隐私。同类可对比的替代方案包括 llama.cpp、candle、mistral.rs。

上一篇:KG-LLM-Papers

下一篇:Chinese-Llama-2-7b

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10