
MiniCPM
手机就能跑的小模型,离线对话不联网
MiniCPM 是面壁智能推出的端侧大模型系列,主打在手机、平板、边缘设备等资源受限环境本地运行。它解决的核心问题是:云端大模型延迟高、隐私风险大、离线不可用,而传统小模型能力又太弱。MiniCPM 通过高质量数据配方和训练策略,让小参数量模型在推理、代码、数学、多语言等任务上达到同尺寸领先水平,并支持量化部署、端侧推理框架适配。项目仓库以 Jupyter Notebook 为主,提供模型权重、推理示例、微调脚本和评测结果,方便开发者快速验证与二次开发。其定位是“小而强”,在消费级硬件上实现可用的对话、摘要、翻译和轻量 Agent 能力,适合对隐私、成本和离线场景有要求的应用。
项目数据
使用教程
环境要求
- Python 环境(可用 pip 安装依赖)
- NVIDIA GPU(使用 vLLM / SGLang 后端时)
- pip 能安装 vllm>=0.21 或 transformers>=5.6 等依赖
- 可联网访问 Hugging Face 下载 openbmb/MiniCPM5-1B 权重
安装与启动步骤
-
1选择推理后端
README 给出 Transformers、vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX、LiteRT-LM 等后端,按硬件和场景选择其一即可,无需全部安装。
-
2安装并启动 vLLM
适用于 NVIDIA GPU,启动 OpenAI 兼容服务,默认监听 8000 端口,首次运行会自动下载模型权重。
pip install "vllm>=0.21" && vllm serve openbmb/MiniCPM5-1B --port 8000 -
3测试 vLLM 服务
用 curl 向本地 8000 端口发一条聊天请求,确认服务可正常返回内容。
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{ "model": "openbmb/MiniCPM5-1B", "messages": [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}], "max_tokens": 128, "temperature": 0.7 }' -
4安装并启动 SGLang
另一个 NVIDIA GPU 方案,README 推荐用于工具调用场景,服务监听 30000 端口。
pip install "sglang[srt]>=0.5.12" && python -m sglang.launch_server --model-path openbmb/MiniCPM5-1B --port 30000 -
5测试 SGLang 服务
同样用 curl 请求 30000 端口的 OpenAI 兼容接口,验证输出是否符合预期。
curl http://localhost:30000/v1/chat/completions -H "Content-Type: application/json" -d '{ "model": "openbmb/MiniCPM5-1B", "messages": [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}], "max_tokens": 128, "temperature": 0.7 }' -
6安装 Transformers 依赖
不用起服务、直接用 Python 本地推理时安装这三个包,支持 CPU 或 GPU,需 transformers>=5.6。
pip install -U "transformers>=5.6" accelerate torch -
7运行本地推理脚本
调用标准 Transformers 接口加载模型并对话,device_map="auto" 会自动选择可用设备。
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "openbmb/MiniCPM5-1B" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", ) messages = [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}] inputs = tokenizer.apply_chat_template( messages, tokenize=True, add_generation_prompt=True, enable_thinking=False, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=128) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
temperature | 是 | 采样温度,README 推荐生成时使用 1.0 | 1.0 |
top_p | 是 | 核采样阈值,README 推荐 0.95 | 0.95 |
min_p | 否 | 最小概率采样阈值,README 推荐 0.0 | 0.0 |
repetition_penalty | 否 | 输出重复时加上,README 建议 1.05 | 1.05 |
enable_thinking | 否 | 是否开启思考模式,Think 用 True,No Think 用 False | False |
如何确认成功
curl 请求 /v1/chat/completions 能返回模型自我介绍内容,或本地脚本打印出回答,即部署成功。
常见问题
Q:输出一直重复怎么办?
A:在采样参数中加上 repetition_penalty=1.05,即使用 temperature=1.0, top_p=0.95, min_p=0.0, repetition_penalty=1.05。
Q:需要改模型代码或编译自定义算子吗?
A:不需要。README 说明 MiniCPM5-1B 使用标准 LlamaForCausalLM 架构,主流推理引擎可直接加载,无自定义 kernel、无需 fork 模型代码。
Q:所有推理框架都支持同样的采样参数吗?
A:不是。README 明确提示采样参数的支持情况因推理框架而异,具体以各后端 cookbook 为准。
Q:想用 Ollama、llama.cpp 或 MLX 怎么部署?
A:README 提供了对应 cookbook(如 docs/deployment/ollama.md、llama_cpp.md、mlx.md)以及配套的 Agent Skill,按表格中的链接查看即可。
注意事项
- README 中的示例命令统一使用 openbmb/MiniCPM5-1B 与端口 8000 / 30000,实际使用可替换为其他 MiniCPM5 权重。
- 量化模型不作为独立后端列出,README 将其归到能够加载对应格式的推理后端中说明。
- 本仓库以 Jupyter Notebook 为主,部署相关的详细步骤放在 docs/deployment 下的各后端 cookbook 中。
- Cursor / Claude Code 里可用 @minicpm5-deploy、@minicpm5-finetune 让 Agent 自动选择部署或微调路线。
核心亮点
- 同尺寸下推理、代码、数学等基准表现领先,端侧可用性强
- 提供量化与端侧部署示例,覆盖手机和边缘设备实际落地路径
- 仓库含微调与评测脚本,方便开发者按场景定制
不足之处
- 以 Notebook 为主,工程化封装和文档结构对新手不够友好
- 端侧生态适配依赖第三方推理框架,跨平台一致性待观察
适用场景
- 手机离线语音助手与本地对话
- 隐私敏感场景的本地文档摘要与翻译
- 边缘设备上的轻量 Agent 与信息抽取
替代项目
Qwen2.5、Phi-3、Gemma
项目介绍
上一篇:gemma
下一篇:recursive-llm
同类项目推荐
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···