foundry-local

把云端 AI 搬到本地,离线也能跑大模型和语音识别

foundry-local 是一个面向本地设备的高性能 AI 推理基础设施,基于 C++ 构建,核心目标是让大语言模型和语音识别模型在本地硬件上高效运行。它利用 ONNX Runtime 和 GPU 加速,支持 Chat Completions 和 Speech-to-Text 等常见 AI 任务,并提供与 Microsoft AI SDK 兼容的接口,使开发者无需修改代码即可将云端 AI 服务平滑迁移到本地。项目解决了数据隐私、网络延迟和云端依赖等问题,让 AI 应用在边缘设备上也能获得接近实时的响应。其核心能力包括模型优化、硬件适配和轻量级部署,适合需要离线运行或对数据安全有严格要求的场景。

开源 unknown 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2561
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类基础设施
开发团队microsoft
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言C++
技术栈/模型ai-sdk,chat-completions,foundry-local,gpu-acceleration,local-ai,microsoft,on-device-inference,onnx-runtime,speech-to-text,whisper
GitHub 星标★ 2561
30天Star增速
HF 下载量
上线时间2025-03-31 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Node.js 与 npm(使用 JavaScript SDK 时)
  • Python 与 pip(使用 Python SDK 时)
  • 本地设备可运行 ONNX Runtime 推理,运行时约 20 MB
  • 官方也提供 C#、Rust 语言绑定以及安装包下载

安装与启动步骤

  1. 1安装 JS SDK

    在 Node.js 项目中执行安装,包名 foundry-local-sdk,安装后即可在代码中引入 FoundryLocalManager。

    npm install foundry-local-sdk
  2. 2运行 JS 对话示例

    把 README 示例存为 js 文件用 Node 运行;会自动按硬件选择最佳模型变体并下载 qwen2.5-0.5b。

    import { FoundryLocalManager } from 'foundry-local-sdk';
    
    const manager = FoundryLocalManager.create({ appName: 'my-app' });
    
    // Download and load a model (auto-selects best variant for user's hardware)
    const model = await manager.catalog.getModel('qwen2.5-0.5b');
    await model.download((progress) => {
        process.stdout.write(`
    Downloading... ${progress.toFixed(2)}%`);
    });
    await model.load();
    
    // Create a chat client and get a completion
    const chatClient = model.createChatClient();
    const response = await chatClient.completeChat([
        { role: 'user', content: 'What is the golden ratio?' }
    ]);
    
    console.log(response.choices[0]?.message?.content);
    
    // Unload the model when done
    await model.unload();
  3. 3安装 Python SDK

    使用 pip 安装官方 Python 包 foundry-local-sdk,用于在 Python 应用中调用本地模型推理。

    pip install foundry-local-sdk
  4. 4运行 Python 对话示例

    把示例保存为 py 文件运行;先初始化 Manager,再从模型目录选取 qwen2.5-0.5b 下载并加载。

    from foundry_local_sdk import Configuration, FoundryLocalManager
    
    config = Configuration(app_name="foundry_local_samples")
    FoundryLocalManager.initialize(config)
    manager = FoundryLocalManager.instance
    
    # Select and load a model from the catalog
    model = manager.catalog.get_model("qwen2.5-0.5b")
    model.download()
    model.load()
    
    # Get a chat client
    client = model.get_chat_client()
    
    # Create and send message
    messages = [
        {"role": "user", "content": "What is the golden ratio?"}
    ]
    response = client.complete_chat(messages)
    print(f"Response: {response.choices[0].message.content}")
    
    model.unload()
  5. 5获取完整安装包

    如需完整的本地运行时或非 npm/pip 的安装方式,可从官方下载页获取安装程序,文档见官方文档站。

关键配置

配置项必填说明示例
appName是JavaScript 侧的应用名,用于标识调用方应用my-app
app_name是Python 侧的应用名,用于初始化 Configurationfoundry_local_samples
模型 ID是从模型目录中选择要下载加载的模型qwen2.5-0.5b

如何确认成功

示例程序控制台打印出模型对 “What is the golden ratio?” 的回答内容,即表示本地推理链路已跑通。

常见问题

Q:使用 Foundry Local 需要 API Key 或联网吗?

A:不需要 API Key、不需要 Azure 订阅,也没有按 token 计费;应用可离线运行,但首次仍需下载所选模型。

Q:可以把 Foundry Local 部署成服务器给多用户用吗?

A:它面向单用户设备端推理,不提供并发排队、连续批处理和 GPU 共享;多用户场景请用 vLLM 或 Triton Inference Server。

Q:支持哪些编程语言?

A:官方提供 C#、JavaScript、Python、Rust 四种原生 SDK,README 的快速开始演示了 JavaScript 和 Python,其余见 samples 目录。

Q:支持哪些 AI 任务?

A:支持 Chat Completions 与 Speech-to-Text 等常见任务,底层通过 ONNX Runtime 执行并自动做硬件加速适配。

Q:数据会上传到云端吗?

A:不会,用户数据始终留在设备本地,响应零网络延迟,没有后端基础设施需要维护。

注意事项

  • 运行时体积很小(约 20 MB),便于随应用分发给最终用户。
  • 模型首次使用需要下载,示例中用进度回调打印下载百分比。
  • 示例代码用完后调用 unload() 释放模型,避免长期占用本地内存与显存。
  • 本项目面向硬件受限的单用户设备优化,不适合作为高并发服务端推理栈。

核心亮点

  • GPU 加速推理,本地响应快,不依赖网络
  • 兼容 Microsoft AI SDK 接口,迁移成本低
  • 支持语音转文字和聊天补全,覆盖常见 AI 场景

不足之处

  • 文档/社区待观察
  • C++ 实现,对非 C++ 开发者上手门槛较高

适用场景

  • 数据敏感的企业内部 AI 助手,需本地处理
  • 边缘设备上的实时语音交互,如智能家居
  • 离线环境下的智能客服或文档问答

替代项目

llama.cpp、Ollama、ONNX Runtime

项目介绍

foundry-local 是基础设施领域的开源项目,由 microsoft 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,561)位列前 30%,在基础设施分类中处于中上游。

近 45 天,它的 GitHub 星标从 2,503 增加到 2,561,净增 58。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:数据敏感的企业内部AI助手,需本地处理。同类可对比的替代方案包括 llama.cpp、Ollama、ONNX Runtime。

上一篇:surrealdb

下一篇:llamafile

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09