lucebox 是基础设施领域的开源项目,由 Luce-Org 开发,是 2026 年新上线的项目。
在全站 12,753 个收录项目中,它的 GitHub 星标数(2,867)位列前 30%,在基础设施分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。
它主要面向的使用场景是:个人开发者在家用多卡/混插机器上部署本地大模型服务。同类可对比的替代方案包括 llama.cpp、vLLM。

消费级显卡也能跑出更快的本地大模型推理
lucebox 是一个面向异构硬件与消费级 GPU 的 LLM 投机推理服务器,用 C++ 编写并深度依赖 CUDA 与自定义内核。它要解决的问题是:在非数据中心级显卡(如消费级 GPU、多型号混插机器)上跑大模型推理时,显存带宽和算力往往成为瓶颈,标准推理框架难以吃满硬件。lucebox 通过投机解码(speculative inference)配合自研的 megakernel、dflash、pflash 等技术,把草稿模型与目标模型的验证流程做成高效内核,从而在异构设备上提升吞吐、降低单 token 延迟。项目兼容 llama.cpp 生态,支持 Qwen 等主流模型,定位本地 AI 与边缘部署,让普通玩家也能在自家机器上获得更快的推理体验。
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1克隆项目仓库
把 lucebox 仓库拉到本地,推荐配置文档与服务指南都在仓库内,后续步骤都基于该目录。
git clone https://github.com/Luce-Org/lucebox.git
cd lucebox2查阅推荐配置
README 指向推荐服务器配置矩阵,先确认自己的单卡或混插 GPU 属于哪套 profile,再决定镜像与参数。
cat server/docs/RECOMMENDED_SETUPS.md3准备模型权重
按 README 要求,目标模型放在 server/models/ 下,与之匹配的草稿模型放在 server/models/draft/ 下。
mkdir -p server/models/draft4选择对应镜像标签
GHCR 预构建镜像跟踪 main 分支,NVIDIA(CUDA 12+)用 :cuda12,AMD(ROCm 6+)用 :rocm;README 节选中拉取命令被截断,镜像完整名称请以仓库文档或 GHCR 页面为准。
5挂载权重并启动服务
运行时挂载模型目录并对外暴露 8000 端口,服务提供 OpenAI 兼容 API;完整可用参数见 server/README.md 的 server parameter reference。
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
server/models/ | 是 | 目标模型权重目录,需挂载进容器 | server/models/ |
server/models/draft/ | 是 | 与目标模型匹配的草稿模型目录,用于投机推理 | server/models/draft/ |
8000 | 是 | OpenAI 兼容 API 的监听端口 | 8000 |
镜像标签 :cuda12 / :rocm | 是 | 按 GPU 厂商与驱动选择对应镜像 | :cuda12 |
容器启动后请求 http://localhost:8000/v1/models,能返回模型列表即表示 OpenAI 兼容 API 已正常服务。
Q:NVIDIA 和 AMD 显卡分别用哪个镜像?
A:README 给出两个标签:NVIDIA(CUDA 12+)用 :cuda12,AMD(ROCm 6+)用 :rocm;预构建镜像托管在 GHCR 并跟踪 main 分支。
Q:必须准备草稿模型吗?
A:投机推理需要目标模型加匹配的草稿模型,README 要求目标放 server/models/、草稿放 server/models/draft/,两者都要准备好再启动。
Q:PFlash 会影响输出准确性吗?
A:PFlash 是有损的提示压缩,在需要精确检索或做匹配真实上下文的基准测试时应关闭;README 提到它已与 Qwen3-0.6B 集成。
Q:参数和机型矩阵在哪里查?
A:完整参数见 server/README.md 的 server parameter reference,单卡与混插 GPU、模型与硬件矩阵见 server/docs/RECOMMENDED_SETUPS.md。
llama.cpp、vLLM
lucebox 是基础设施领域的开源项目,由 Luce-Org 开发,是 2026 年新上线的项目。
在全站 12,753 个收录项目中,它的 GitHub 星标数(2,867)位列前 30%,在基础设施分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。
它主要面向的使用场景是:个人开发者在家用多卡/混插机器上部署本地大模型服务。同类可对比的替代方案包括 llama.cpp、vLLM。
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···