lucebox

消费级显卡也能跑出更快的本地大模型推理

lucebox 是一个面向异构硬件与消费级 GPU 的 LLM 投机推理服务器,用 C++ 编写并深度依赖 CUDA 与自定义内核。它要解决的问题是:在非数据中心级显卡(如消费级 GPU、多型号混插机器)上跑大模型推理时,显存带宽和算力往往成为瓶颈,标准推理框架难以吃满硬件。lucebox 通过投机解码(speculative inference)配合自研的 megakernel、dflash、pflash 等技术,把草稿模型与目标模型的验证流程做成高效内核,从而在异构设备上提升吞吐、降低单 token 延迟。项目兼容 llama.cpp 生态,支持 Qwen 等主流模型,定位本地 AI 与边缘部署,让普通玩家也能在自家机器上获得更快的推理体验。

开源 unknown 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2867
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类基础设施
开发团队Luce-Org
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言C++
技术栈/模型cuda,cuda-kernels,dflash,heterogeneous-computing,kernel,llama-cpp,local-ai,luce,megakernel,pflash,poolside,qwen,r9700,rocm,rtx3090,spark,speculative-decoding,speculative-prefill,strix-halo
GitHub 星标★ 2867
30天Star增速
HF 下载量
上线时间2026-04-03 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

难度:高级 约 30 分钟 部署方式:Docker 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • NVIDIA GPU(CUDA 12+)或 AMD GPU(ROCm 6+),需能运行自研 CUDA 内核
  • 已安装 Docker,可拉取 GHCR(ghcr.io)上的镜像
  • 准备好目标模型权重及其匹配的草稿(drafter)模型权重
  • 足够容纳目标模型与草稿模型的显存

安装与启动步骤

  1. 1克隆项目仓库

    把 lucebox 仓库拉到本地,推荐配置文档与服务指南都在仓库内,后续步骤都基于该目录。

    git clone https://github.com/Luce-Org/lucebox.git
    cd lucebox
  2. 2查阅推荐配置

    README 指向推荐服务器配置矩阵,先确认自己的单卡或混插 GPU 属于哪套 profile,再决定镜像与参数。

    cat server/docs/RECOMMENDED_SETUPS.md
  3. 3准备模型权重

    按 README 要求,目标模型放在 server/models/ 下,与之匹配的草稿模型放在 server/models/draft/ 下。

    mkdir -p server/models/draft
  4. 4选择对应镜像标签

    GHCR 预构建镜像跟踪 main 分支,NVIDIA(CUDA 12+)用 :cuda12,AMD(ROCm 6+)用 :rocm;README 节选中拉取命令被截断,镜像完整名称请以仓库文档或 GHCR 页面为准。

  5. 5挂载权重并启动服务

    运行时挂载模型目录并对外暴露 8000 端口,服务提供 OpenAI 兼容 API;完整可用参数见 server/README.md 的 server parameter reference。

关键配置

配置项必填说明示例
server/models/目标模型权重目录,需挂载进容器server/models/
server/models/draft/与目标模型匹配的草稿模型目录,用于投机推理server/models/draft/
8000OpenAI 兼容 API 的监听端口8000
镜像标签 :cuda12 / :rocm按 GPU 厂商与驱动选择对应镜像:cuda12

如何确认成功

容器启动后请求 http://localhost:8000/v1/models,能返回模型列表即表示 OpenAI 兼容 API 已正常服务。

常见问题

Q:NVIDIA 和 AMD 显卡分别用哪个镜像?

A:README 给出两个标签:NVIDIA(CUDA 12+)用 :cuda12,AMD(ROCm 6+)用 :rocm;预构建镜像托管在 GHCR 并跟踪 main 分支。

Q:必须准备草稿模型吗?

A:投机推理需要目标模型加匹配的草稿模型,README 要求目标放 server/models/、草稿放 server/models/draft/,两者都要准备好再启动。

Q:PFlash 会影响输出准确性吗?

A:PFlash 是有损的提示压缩,在需要精确检索或做匹配真实上下文的基准测试时应关闭;README 提到它已与 Qwen3-0.6B 集成。

Q:参数和机型矩阵在哪里查?

A:完整参数见 server/README.md 的 server parameter reference,单卡与混插 GPU、模型与硬件矩阵见 server/docs/RECOMMENDED_SETUPS.md。

注意事项

  • 必须使用 NVIDIA CUDA 12+ 或 AMD ROCm 6+,依赖自定义内核,不是纯 CPU 方案。
  • 预构建镜像跟踪 main 分支,内容会变化,生产使用建议固定具体 tag。
  • README 节选中 docker run 命令被截断,未给出完整镜像名与参数,正式部署前请以仓库 server/README.md 为准。
  • 项目为 Apache 2.0 协议,官网 lucebox.com,模型权重在 HuggingFace 的 Lucebox 组织下。

核心亮点

  • 针对消费级 GPU 与异构硬件做内核级优化,而非简单套壳推理框架
  • 集成投机解码与 megakernel/dflash/pflash 等自研技术,主打吞吐与延迟
  • 兼容 llama.cpp 生态与 Qwen 等主流模型,本地部署门槛相对可控

不足之处

  • 强依赖 CUDA 与特定硬件,非 NVIDIA 或老卡用户基本无法使用
  • 项目较新、星标规模有限,文档与社区支持仍在早期阶段

适用场景

  • 个人开发者在家用多卡/混插机器上部署本地大模型服务
  • 边缘设备或消费级 GPU 场景下追求更低推理延迟的应用
  • 需要兼容 llama.cpp 模型格式、又想提升吞吐的本地 AI 项目

替代项目

llama.cpp、vLLM

项目介绍

lucebox 是基础设施领域的开源项目,由 Luce-Org 开发,是 2026 年新上线的项目。

在全站 12,753 个收录项目中,它的 GitHub 星标数(2,867)位列前 30%,在基础设施分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。

它主要面向的使用场景是:个人开发者在家用多卡/混插机器上部署本地大模型服务。同类可对比的替代方案包括 llama.cpp、vLLM。

上一篇:TurboLLM

下一篇:llmserve

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8576 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 437 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181269 2026-08-09