MiniCPM

手机就能跑的小模型,离线对话不联网

MiniCPM 是面壁智能推出的端侧大模型系列,主打在手机、平板、边缘设备等资源受限环境本地运行。它解决的核心问题是:云端大模型延迟高、隐私风险大、离线不可用,而传统小模型能力又太弱。MiniCPM 通过高质量数据配方和训练策略,让小参数量模型在推理、代码、数学、多语言等任务上达到同尺寸领先水平,并支持量化部署、端侧推理框架适配。项目仓库以 Jupyter Notebook 为主,提供模型权重、推理示例、微调脚本和评测结果,方便开发者快速验证与二次开发。其定位是“小而强”,在消费级硬件上实现可用的对话、摘要、翻译和轻量 Agent 能力,适合对隐私、成本和离线场景有要求的应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11083
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队OpenBMB
所属国家
官网地址
定价模式free
价格说明开源模型,免费使用,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型
GitHub 星标★ 11083
30天Star增速
HF 下载量
上线时间2024-01-29 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:模型权重 7 步

环境要求

  • Python 环境(可用 pip 安装依赖)
  • NVIDIA GPU(使用 vLLM / SGLang 后端时)
  • pip 能安装 vllm>=0.21 或 transformers>=5.6 等依赖
  • 可联网访问 Hugging Face 下载 openbmb/MiniCPM5-1B 权重

安装与启动步骤

  1. 1选择推理后端

    README 给出 Transformers、vLLM、SGLang、llama.cpp、Ollama、LM Studio、MLX、LiteRT-LM 等后端,按硬件和场景选择其一即可,无需全部安装。

  2. 2安装并启动 vLLM

    适用于 NVIDIA GPU,启动 OpenAI 兼容服务,默认监听 8000 端口,首次运行会自动下载模型权重。

    pip install "vllm>=0.21" && vllm serve openbmb/MiniCPM5-1B --port 8000
  3. 3测试 vLLM 服务

    用 curl 向本地 8000 端口发一条聊天请求,确认服务可正常返回内容。

    curl http://localhost:8000/v1/chat/completions 
      -H "Content-Type: application/json" 
      -d '{
        "model": "openbmb/MiniCPM5-1B",
        "messages": [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}],
        "max_tokens": 128,
        "temperature": 0.7
      }'
  4. 4安装并启动 SGLang

    另一个 NVIDIA GPU 方案,README 推荐用于工具调用场景,服务监听 30000 端口。

    pip install "sglang[srt]>=0.5.12" && python -m sglang.launch_server --model-path openbmb/MiniCPM5-1B --port 30000
  5. 5测试 SGLang 服务

    同样用 curl 请求 30000 端口的 OpenAI 兼容接口,验证输出是否符合预期。

    curl http://localhost:30000/v1/chat/completions 
      -H "Content-Type: application/json" 
      -d '{
        "model": "openbmb/MiniCPM5-1B",
        "messages": [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}],
        "max_tokens": 128,
        "temperature": 0.7
      }'
  6. 6安装 Transformers 依赖

    不用起服务、直接用 Python 本地推理时安装这三个包,支持 CPU 或 GPU,需 transformers>=5.6。

    pip install -U "transformers>=5.6" accelerate torch
  7. 7运行本地推理脚本

    调用标准 Transformers 接口加载模型并对话,device_map="auto" 会自动选择可用设备。

    from transformers import AutoModelForCausalLM, AutoTokenizer
    
    model_id = "openbmb/MiniCPM5-1B"
    tokenizer = AutoTokenizer.from_pretrained(model_id)
    model = AutoModelForCausalLM.from_pretrained(
        model_id,
        torch_dtype="auto",
        device_map="auto",
    )
    
    messages = [{"role": "user", "content": "Who are you? Please briefly introduce yourself."}]
    inputs = tokenizer.apply_chat_template(
        messages,
        tokenize=True,
        add_generation_prompt=True,
        enable_thinking=False,
        return_dict=True,
        return_tensors="pt",
    ).to(model.device)
    
    outputs = model.generate(**inputs, max_new_tokens=128)
    print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))

关键配置

配置项必填说明示例
temperature采样温度,README 推荐生成时使用 1.01.0
top_p核采样阈值,README 推荐 0.950.95
min_p最小概率采样阈值,README 推荐 0.00.0
repetition_penalty输出重复时加上,README 建议 1.051.05
enable_thinking是否开启思考模式,Think 用 True,No Think 用 FalseFalse

如何确认成功

curl 请求 /v1/chat/completions 能返回模型自我介绍内容,或本地脚本打印出回答,即部署成功。

常见问题

Q:输出一直重复怎么办?

A:在采样参数中加上 repetition_penalty=1.05,即使用 temperature=1.0, top_p=0.95, min_p=0.0, repetition_penalty=1.05。

Q:需要改模型代码或编译自定义算子吗?

A:不需要。README 说明 MiniCPM5-1B 使用标准 LlamaForCausalLM 架构,主流推理引擎可直接加载,无自定义 kernel、无需 fork 模型代码。

Q:所有推理框架都支持同样的采样参数吗?

A:不是。README 明确提示采样参数的支持情况因推理框架而异,具体以各后端 cookbook 为准。

Q:想用 Ollama、llama.cpp 或 MLX 怎么部署?

A:README 提供了对应 cookbook(如 docs/deployment/ollama.md、llama_cpp.md、mlx.md)以及配套的 Agent Skill,按表格中的链接查看即可。

注意事项

  • README 中的示例命令统一使用 openbmb/MiniCPM5-1B 与端口 8000 / 30000,实际使用可替换为其他 MiniCPM5 权重。
  • 量化模型不作为独立后端列出,README 将其归到能够加载对应格式的推理后端中说明。
  • 本仓库以 Jupyter Notebook 为主,部署相关的详细步骤放在 docs/deployment 下的各后端 cookbook 中。
  • Cursor / Claude Code 里可用 @minicpm5-deploy、@minicpm5-finetune 让 Agent 自动选择部署或微调路线。

核心亮点

  • 同尺寸下推理、代码、数学等基准表现领先,端侧可用性强
  • 提供量化与端侧部署示例,覆盖手机和边缘设备实际落地路径
  • 仓库含微调与评测脚本,方便开发者按场景定制

不足之处

  • 以 Notebook 为主,工程化封装和文档结构对新手不够友好
  • 端侧生态适配依赖第三方推理框架,跨平台一致性待观察

适用场景

  • 手机离线语音助手与本地对话
  • 隐私敏感场景的本地文档摘要与翻译
  • 边缘设备上的轻量 Agent 与信息抽取

替代项目

Qwen2.5、Phi-3、Gemma

项目介绍

MiniCPM 是一个开源模型领域的开源项目,官方简介:MiniCPM5: SOTA on-device LLMs, small yet powerful.。项目使用 Jupyter Notebook 开发,在 GitHub 上获得 10987 星标。

上一篇:gemma

下一篇:recursive-llm

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1870 2026-08-10