runanywhere-sdks

本地跑AI,生产级工具包,低延迟高隐私

runanywhere-sdks 是一个面向生产环境的 C++ 工具包,旨在让 AI 模型在本地设备上高效运行。它解决了云端推理带来的延迟、隐私和成本问题,提供了一套完整的本地推理解决方案。其核心能力包括模型加载与优化、硬件加速(如 CPU、GPU、NPU)以及跨平台支持,使开发者能够轻松地将 AI 功能集成到桌面、移动或嵌入式应用中。该工具包强调生产就绪,意味着它经过了性能优化和稳定性测试,适合直接部署到实际产品中。通过提供简洁的 API 和丰富的示例,它降低了本地 AI 开发的门槛,让开发者无需深入底层细节即可快速构建本地智能应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 10311
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队RunanywhereAI
所属国家
定价模式free
价格说明开源项目,本地部署,完全免费
访问状态
是否开源是
开源协议NOASSERTION
主要语言C++
技术栈/模型android,apple-intelligence,cpp,diffusion-models,edge,flutter,inference,ios,kotlin,llamacpp,llm,multimodal,ollama,on-device-ai,react-native,swift,vlm,voice-ai,web,websdk
GitHub 星标★ 10311
30天Star增速
HF 下载量
上线时间2025-07-22 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境(Windows / macOS / Linux 均可),用于 Python SDK
  • Node.js 与 npm,用于 Web 端 TypeScript + WASM SDK
  • 支持 WebGPU 的浏览器(不可用时 SDK 自动回退到 WASM)
  • Electron 端目前为 Windows x64 预览版,需要从源码构建
  • 可选:RunAnywhere Console 的 API Key,不配置也能完全离线运行

安装与启动步骤

  1. 1安装 Python SDK

    用 pip 安装官方 Python 包,装好后即可在本地加载并运行模型;onnx、mlx、qhexrt 等后端按需另行引入。

    pip install runanywhere
  2. 2初始化 Python SDK

    导入 runanywhere 并调用 ra.initialize() 完成本地初始化,之后即可继续加载模型;LlmOptions 用于传入推理参数。

    import runanywhere as ra
    from runanywhere import LlmOptions
    
    ra.initialize()
  3. 3安装 Web SDK

    在 Web/TypeScript 项目里安装 web 主包与 llamacpp 后端包,两个包版本号需保持一致。

    npm install @runanywhere/web@0.20.11 @runanywhere/web-llamacpp@0.20.11
  4. 4Web 端初始化与生成

    先 initialize 再注册 LlamaCPP 后端(自动优选 WebGPU),完成服务初始化后加载模型并生成文本。

    import { RunAnywhere, SDKEnvironment } from '@runanywhere/web';
    import { LlamaCPP } from '@runanywhere/web-llamacpp';
    
    await RunAnywhere.initialize({ environment: SDKEnvironment.SDK_ENVIRONMENT_DEVELOPMENT });
    await LlamaCPP.register({ acceleration: 'auto' });
    await RunAnywhere.completeServicesInitialization();
    
    await RunAnywhere.loadModel({ modelId: 'qwen2.5-0.5b' });
    
    const result = await RunAnywhere.generate({
      prompt: 'What is the capital of France?',
    });
    console.log(result.text);
  5. 5运行环境体检

    在已克隆的仓库根目录执行官方提供的 setup 与 doctor 助手脚本,检查本地依赖与环境是否就绪。

    ./run setup
    ./run doctor
  6. 6接入 Console(可选)

    在 Console 生成 API Key,SDK 用它认证、上报设备硬件信息并按需拉取模型;不接入也完全可离线使用。

关键配置

配置项必填说明示例
API Key否Console 控制面认证凭证,用于下发模型与遥测上报,可留空。ra_live_xxxxxxxxxxxx
environment否SDK 运行环境标识,示例使用开发环境常量。SDKEnvironment.SDK_ENVIRONMENT_DEVELOPMENT
acceleration否推理加速后端选择,auto 表示有 WebGPU 就用,否则回退 WASM。auto
modelId是要加载的模型标识,可用目录 ID 或本地路径。qwen2.5-0.5b

如何确认成功

Python 脚本执行无报错即初始化成功;Web 端运行示例应打印出 “Paris is the capital of France.”;./run doctor 会输出环境检查结果。

常见问题

Q:必须要有 Console 的 API Key 才能用吗?

A:不需要。README 明确说明 Console 是可选的,所有 SDK 在没有 API Key 的情况下都能完全离线运行,只有启用后才会上报分模态遥测。

Q:Web 端没有 WebGPU 显卡能用吗?

A:可以。注册 LlamaCPP 时使用 acceleration: 'auto',SDK 会在有 WebGPU 时优先使用,否则自动回退到 WASM 执行。

Q:Electron 桌面端怎么安装?

A:npm 未提供现成安装命令,README 说明需从源码构建,目前是 Windows x64 预览版,CUDA 支持需要以 opt-in 方式自行源码编译。

Q:除了 LLM 还支持哪些能力?

A:README 列出的能力包括 LLM、视觉(VLM)、语音识别与合成、语音代理、RAG、向量嵌入和图像生成,Web 端另有 @runanywhere/web-onnx 处理 STT/TTS/VAD/嵌入。

Q:Python 端还需要装别的包吗?

A:基础使用只需 pip install runanywhere。onnx、mlx、qhexrt 属于可选后端,README 中标注为 optional backends,需要时再单独引入。

注意事项

  • 所有推理都在设备本地完成,默认保护隐私、可完全离线,不需要把数据发到云端。
  • Python 端的 @runanywhere/onnx、@runanywhere/mlx、@runanywhere/qhexrt 是可选后端,不装不影响基础 LLM 使用。
  • Web 端两个 npm 包版本要一致(示例为 0.20.11),版本错配可能导致加载后端失败。
  • ./run setup 与 ./run doctor 需在获取到仓库源码后的根目录执行,README 未给出克隆命令,请自行获取源码。

核心亮点

  • 针对生产环境优化,性能稳定可靠
  • 支持多种硬件加速,充分利用设备算力
  • 跨平台设计,覆盖桌面、移动和嵌入式场景

不足之处

  • C++ 接口对非 C++ 开发者有一定学习成本
  • 文档/社区待观察

适用场景

  • 隐私敏感型应用,如本地人脸识别或文档分析
  • 离线环境下的 AI 推理,如工业设备或车载系统
  • 低延迟交互场景,如实时语音助手或游戏 AI

替代项目

llama.cpp、ONNX Runtime、TensorFlow Lite

项目介绍

runanywhere-sdks 是基础设施领域的开源项目,由 RunanywhereAI 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(10,311)位列前 5%,在基础设施分类的 1,132 个项目里位列前 7%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。本地部署,完全免费。

它主要面向的使用场景是:隐私敏感型应用,如本地人脸识别或文档分析。同类可对比的替代方案包括 llama.cpp、ONNX Runtime、TensorFlow Lite。

上一篇:mistral-inference

下一篇:PowerInfer

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09