
yzma
Go 里直接跑本地大模型,无需 Python 和网络
yzma 是一个用 Go 语言直接封装 llama.cpp 的本地推理框架,目标是让 Go 开发者无需依赖 CGO 或外部服务,就能在应用中嵌入大语言模型和多模态模型。它通过 purego 动态加载 llama.cpp 的共享库,支持 GGUF 格式模型,并利用 CUDA、Metal、Vulkan、ROCm 等后端在 Linux、macOS、Windows 以及 WebAssembly 上实现硬件加速推理。项目覆盖从树莓派、Jetson Orin Nano 到桌面 GPU 的多种设备,适合需要把 LLM 能力直接编译进 Go 二进制、追求低延迟和离线运行的场景。核心能力包括模型加载、文本生成、视觉语言模型推理,以及跨平台构建,省去了 Python 运行时和网络调用的开销,让 Go 服务端或边缘程序可以像调用普通库一样调用本地模型。
项目数据
使用教程
核心亮点
- 用 purego 动态加载 llama.cpp,避免 CGO 交叉编译地狱,Go 项目集成成本低
- 覆盖 CUDA/Metal/Vulkan/ROCm 和 WebAssembly,同一套 API 跨桌面、边缘设备与浏览器
- 支持 GGUF 和 VLM,能直接加载量化模型做文本与视觉推理,适合离线场景
不足之处
- 仍处于早期阶段,API 可能随 llama.cpp 上游变动而调整
- 文档和示例相对有限,复杂部署场景需要自行摸索
适用场景
- Go 编写的桌面或 CLI 工具内嵌本地聊天/摘要模型,完全离线运行
- 边缘设备如树莓派、Jetson 上跑轻量 VLM 做图像识别或语音交互
- WebAssembly 环境中在浏览器端直接执行小模型推理,保护数据隐私
替代项目
ollama、llama.cpp、LocalAI
项目介绍
同类项目推荐
ComfyUI_Custom_Nodes_AlekPet
开源
给 ComfyUI 装上语音翻译和姿态检测,工作流更全能
Custom nodes that extend the capabilities of Comfyui
langchain
开源
组装 AI 应用的乐高积木,从想法到上线不换工具
The agent engineering platform.
transformers
开源
全球最大的模型仓库全家桶,想用的模型一把抓
Transformers: the model-definition framework for state-of-the-art machine learning m···
bruno
开源
把 API 测试当代码管理,用 Git 搞定协作与版本追踪
Opensource IDE For Exploring and Testing API's (lightweight alternative to Postman/I···