web-llm

在浏览器里直接跑大模型,无需服务器,隐私又省钱

web-llm 是一个高性能的浏览器端大语言模型推理引擎,基于 WebGPU 和 TVM 技术,让 LLM 无需服务器即可直接在浏览器中运行。它解决了传统 LLM 依赖云端 API 带来的隐私、延迟和成本问题,同时通过 WebGPU 硬件加速和底层优化,实现了接近原生性能的推理速度。核心能力包括:支持多种主流模型(如 Llama、Phi、Gemma 等)的加载与运行,提供流式输出、结构化生成、嵌入计算等丰富 API,并支持模型缓存、多模型切换和自定义模型适配。项目采用 TypeScript 编写,API 简洁易用,可轻松集成到前端应用中,适合构建离线优先、隐私敏感或低成本的 AI 应用。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 19162
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类对话助手
开发团队mlc-ai
所属国家
定价模式free
价格说明开源项目,提供在线演示,核心功能免费,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型chatgpt,deep-learning,language-model,llm,tvm,webgpu,webml
GitHub 星标★ 19162
30天Star增速
HF 下载量
上线时间2023-04-13 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 支持 WebGPU 的现代浏览器(如最新版 Chrome / Edge)
  • 具备 GPU 硬件加速的设备,WebLLM 依赖 WebGPU 运行
  • 如需在自己项目中集成,需 Node.js / npm 环境(README 说明其提供 npm 包)

安装与启动步骤

  1. 1检查浏览器支持

    在浏览器控制台执行该表达式,能返回 GPU 对象说明支持 WebGPU,否则 WebLLM 无法运行。

    navigator.gpu
  2. 2查看官方文档

    README 的 Installation 章节未给出具体安装步骤,请以官方文档和 examples 目录为准了解接入方式。

  3. 3获取源码与示例

    克隆仓库后查看 examples 目录,参考示例代码了解如何在前端项目中集成 WebLLM。

    git clone https://github.com/mlc-ai/web-llm.git
  4. 4在线体验验证

    打开官方 Chat 页面,直接用浏览器体验模型推理,确认当前环境可正常运行。

如何确认成功

浏览器打开 https://chat.webllm.ai/ 能正常加载模型并对话输出,即说明环境可用。

常见问题

Q:运行 WebLLM 需要服务器或 API Key 吗?

A:不需要。README 说明所有推理都在浏览器内完成,无需服务器支持,也不依赖云端 API Key。

Q:哪些浏览器可以使用?

A:需要浏览器支持 WebGPU 并具备 GPU 加速;README 未列出具体版本,建议使用最新版 Chrome 或 Edge 并在控制台执行 navigator.gpu 自测。

Q:它能兼容 OpenAI 的接口写法吗?

A:可以。README 明确说明 WebLLM 完全兼容 OpenAI API,可在本地开源模型上使用流式输出、JSON-mode、function-calling(开发中)等功能。

Q:可以在自己的网页项目里用吗?

A:可以。README 指出 WebLLM 提供 npm 包,可基于它构建自己的 Web 应用,具体安装与用法请参阅官方文档与示例。

注意事项

  • README 节选中 Installation 章节为空白,未提供安装命令,本次步骤均为可推断的通用准备动作,具体安装请以官方文档 https://webllm.mlc.ai/docs/ 为准。
  • 模型权重需首次下载并缓存在浏览器中,注意流量占用;README 提到支持模型缓存。
  • 必须运行在支持 WebGPU 的浏览器中,不支持时无法推理。
  • README 提到 WebLLM 是 MLC LLM 的配套项目,可作为 npm 包 @mlc-ai/web-llm 使用(安装命令 README 未给出)。

核心亮点

  • 基于 WebGPU 硬件加速,推理速度接近原生,远超纯 JS 方案
  • 支持多种主流开源模型(Llama、Phi、Gemma 等),且有模型缓存机制
  • API 设计简洁,支持流式输出、结构化生成,易于集成到前端项目

不足之处

  • 受限于浏览器内存和显存,无法运行超大模型(如 70B 以上)
  • 依赖 WebGPU,对浏览器版本和硬件有要求,兼容性待提升
  • 文档/社区待观察

适用场景

  • 隐私敏感的本地 AI 助手,数据不出浏览器
  • 离线可用的网页应用,如文档摘要、聊天机器人
  • 低成本 AI 演示或教育场景,免去服务器部署

替代项目

Transformers.js、ONNX Runtime Web、WasmEdge

项目介绍

web-llm 是基础设施领域的开源项目,由 mlc-ai 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(19,162)位列前 3%,在基础设施分类的 1,130 个项目里位列前 4%。

近 44 天,它的 GitHub 星标从 18,534 增加到 19,162,净增 628。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。提供在线演示,核心功能免费,无付费版本。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:隐私敏感的本地AI助手,数据不出浏览器。同类可对比的替代方案包括 Transformers.js、ONNX Runtime Web、WasmEdge。

上一篇:steedos-platform

下一篇:midjourney-proxy

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09