LLamaSharp

在 .NET 里本地跑大模型,一行代码接入聊天

LLamaSharp 是一个面向 C#/.NET 开发者的本地大语言模型推理库,基于 llama.cpp 的高效 C++ 内核封装,提供纯托管代码的 API 接口。它解决了 .NET 生态中缺乏原生 LLM 推理能力的问题,让开发者无需依赖 Python 或外部服务,即可在 Windows、Linux、macOS 等平台上加载并运行 LLaMA、LLaVA 等多模态模型。核心能力包括:支持多种量化格式(如 GGUF)、提供高级 API(如对话会话、语义内核集成)、支持 GPU 加速(CUDA/OpenCL)及 CPU 推理,并具备流式输出、文本嵌入、多模态输入等功能。通过 NuGet 包即可快速集成,适合构建本地智能应用、聊天机器人或边缘计算场景。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3799
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队SciSharp
所属国家
定价模式free
价格说明开源库,MIT许可证,本地部署,完全免费。
访问状态
是否开源是
开源协议MIT
主要语言C#
技术栈/模型chatbot,gpt,llama,llama-cpp,llama2,llama3,llamacpp,llava,llm,multi-modal,semantic-kernel
GitHub 星标★ 3799
30天Star增速
HF 下载量
上线时间2023-05-09 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 15 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 .NET 开发环境与 Visual Studio(可使用 NuGet 包管理器控制台)
  • 目标平台为 Windows、Linux 或 macOS
  • 如需 GPU 加速,本机需安装与后端包匹配的 CUDA 11 / CUDA 12,或支持 Vulkan / Metal 的显卡
  • 已准备好 GGUF 等格式的模型权重文件(README 中未给出具体下载来源)

安装与启动步骤

  1. 1安装 LLamaSharp 主包

    在 Visual Studio 的 NuGet 包管理器控制台中执行,安装 LLamaSharp 核心库。也可在 NuGet 页面搜索同名包安装。

    Install-Package LLamaSharp
  2. 2安装 CPU 后端包

    LLamaSharp 通过 llama.cpp 编译的原生后端库运行。CPU 后端支持 Windows、Linux、macOS,macOS 上还可用 Metal。

    Install-Package LLamaSharp.Backend.Cpu
  3. 3按显卡安装 GPU 后端

    若需 GPU 加速,按本机 CUDA 版本选装 Cuda11 或 Cuda12(Windows/Linux),或安装 Vulkan 后端,可与 CPU 后端共存。

    Install-Package LLamaSharp.Backend.Cuda12
  4. 4开启原生库加载日志

    在代码最前面加上日志回调,可打印实际加载的原生库文件,用于排查 GPU 未被使用的问题。

    NativeLibraryConfig.All.WithLogCallback(delegate (LLamaLogLevel level, string message) { Console.Write($"{level}: {message}"); } )
  5. 5参照官方快速上手文档

    按照官网 Quick start 与 Tutorial 完成模型加载和推理调用;仓库中另有 Console Demo 可直接体验对话效果。

关键配置

配置项必填说明示例
GpuLayerCount否加载模型权重时指定放入 GPU 的层数,大于 0 才会真正使用 GPU。GpuLayerCount = 20
LLamaSharp.Backend.Cuda11 / Cuda12 / Vul是选择与本机硬件和 CUDA 版本匹配的后端包,不匹配会导致退回 CPU 推理。LLamaSharp.Backend.Cuda12

如何确认成功

运行程序后查看日志回调输出,确认加载的是预期的原生库文件(如 CUDA 库而非 CPU 库)且 GpuLayerCount 大于 0。

常见问题

Q:装好 CUDA 后 GPU 仍未被使用?

A:先确认安装的后端包与本机 CUDA 版本一致;再用 NativeLibraryConfig 的日志回调查看加载的原生库是否为 CPU 库,并检查加载模型时 GpuLayerCount 是否大于 0。

Q:没有与我设备匹配的已发布后端怎么办?

A:README 建议到仓库提 issue 说明情况;如果会编译 C++,也可以参照 ContributingGuide 自行编译后端并在 LLamaSharp 中使用。

Q:使用 LLamaSharp 必须自己编译 C++ 吗?

A:不需要。官方已为 Windows、Linux、Mac 提供 CPU、CUDA、Metal、Vulkan 后端包,直接通过 NuGet 安装即可。

注意事项

  • LLamaSharp 是库/依赖形式,不是独立的聊天程序,需要在你自己的 .NET 应用中调用 API。
  • 后端包必须与目标平台和 CUDA 版本匹配,README 未提及的后端组合需自行编译。
  • 详细安装、模型加载与参数说明请以官网 Quick start、FAQ 和 Tutorial 文档为准。

核心亮点

  • 原生 C# API,无需 Python 环境,集成到 .NET 项目非常顺畅
  • 基于 llama.cpp,推理性能接近原生 C++,支持 GPU 加速
  • 提供高级会话管理和语义内核集成,简化复杂应用开发

不足之处

  • 文档和示例相对较少,新手入门需要参考社区
  • 部分高级功能(如多模态)支持不够完善,依赖上游 llama.cpp 更新

适用场景

  • 在 .NET 桌面应用中嵌入本地聊天助手
  • 构建离线智能客服或文档问答系统
  • 用于边缘设备上的轻量级 AI 推理

替代项目

LLamaSharp 的替代:llama.cpp(C++ 原生)、LangChain.NET(框架)、Microsoft Semantic Kernel(.NET 集成)

项目介绍

LLamaSharp 是基础设施领域的开源项目,由 SciSharp 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,799)位列前 30%,在基础设施分类中处于中上游。

近 42 天,它的 GitHub 星标从 3,779 增加到 3,799,净增 20。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。开源库,MIT许可证,本地部署,完全免费。

它主要面向的使用场景是:在.NET桌面应用中嵌入本地聊天助手。同类可对比的替代方案包括 LLamaSharp 的替代:llama.cpp(C++ 原生)、LangChain.NET(框架)、Microsoft Semantic Kernel(.NE…。

上一篇:GPTCache

下一篇:ChatGPTAPIFree

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09