ChatGLM2-6B

消费级显卡跑双语大模型,对话推理快人一步

ChatGLM2-6B 是智谱AI推出的第二代开源双语对话模型,基于通用语言模型(GLM)架构,拥有62亿参数,支持中英文双语。它解决了大模型部署门槛高、资源消耗大的问题,可在消费级显卡上运行,提供高效的推理和训练能力。核心能力包括:更强的对话流畅性和逻辑性,支持长上下文(32K),推理速度提升42%,并引入函数调用和代码解释器等工具调用能力。模型采用MIT协议开源,允许商用,并提供量化版本和多种部署方案,方便开发者快速集成到实际应用中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 15515
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队zai-org
所属国家
官网地址
定价模式free
价格说明开源模型,可本地部署,完全免费使用。
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型chatglm,chatglm-6b,large-language-models,llm
GitHub 星标★ 15515
30天Star增速
HF 下载量
上线时间2023-06-24 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(需可运行 pip)
  • transformers 库推荐 4.30.2
  • torch 推荐 2.0 及以上版本
  • 若使用 API 部署需额外安装 fastapi、uvicorn
  • CPU 推理需约 32GB 内存,GPU 推理建议显存充足(半精度约 13GB)

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 ChatGLM2-6B 源码并进入项目目录,后续所有命令都在该目录执行。

    git clone https://github.com/THUDM/ChatGLM2-6B
    cd ChatGLM2-6B
  2. 2安装基础依赖

    按 requirements.txt 安装运行所需 Python 包;建议先确认 transformers 为 4.30.2、torch 为 2.0 以上。

    pip install -r requirements.txt
  3. 3安装 API 依赖

    只有需要以 HTTP 接口方式部署时才执行,为 api.py 提供 fastapi 与 uvicorn。

    pip install fastapi uvicorn
  4. 4启动 API 服务

    运行仓库中的 api.py,服务默认监听本地 8000 端口,模型首次加载会下载权重、耗时较长。

    python api.py
  5. 5调用接口验证

    另开一个终端,用 POST 请求向 127.0.0.1:8000 发送 prompt,成功会返回 response 与 history 字段。

    curl -X POST "http://127.0.0.1:8000" 
         -H 'Content-Type: application/json' 
         -d '{"prompt": "你好", "history": []}'
  6. 6可选:OpenAI 格式部署

    如需接入 ChatGPT-Next-Web 等基于 ChatGPT 的应用,可改用 openai_api.py 启动流式 API。

    python openai_api.py

关键配置

配置项必填说明示例
openai.api_baseOpenAI 兼容接口地址,指向本地服务http://localhost:8000/v1
openai.api_key本地部署无需真实密钥,可填任意字符串none
model调用时指定的模型名称chatglm2-6b

如何确认成功

curl 返回 JSON,含 response、history、status、time 字段,且 response 为模型中文回复即成功。

常见问题

Q:没有 GPU 能跑吗?

A:可以,在 CPU 上推理速度较慢,需要约 32GB 内存;内存不足可改用 THUDM/chatglm2-6b-int4 量化模型,并需安装 gcc 与 openmp。

Q:Mac 上怎么部署?

A:Apple Silicon 或 AMD GPU 的 Mac 可用 MPS 后端,需按 Apple 官方说明装 PyTorch-Nightly,且目前只支持从本地路径加载模型。

Q:显存不够放不下整个模型怎么办?

A:安装 accelerate 后调用 utils 中的 load_model_on_gpus,把 num_gpus 设为希望使用的 GPU 数,即可将模型切分到多张卡。

Q:API 默认端口是多少,怎么调用?

A:默认部署在本地 8000 端口,用 POST 方法发送 JSON,包含 prompt 与 history 字段。

Q:响应太慢是什么原因?

A:可能是内存不足导致使用硬盘虚拟内存,建议换用量化模型或减少并发;也可在 Mac 上改用 ChatGLM.cpp。

注意事项

  • README 明确推荐 transformers 4.30.2、torch 2.0 及以上,以获得最佳推理性能。
  • CPU 上运行量化模型需安装 gcc 与 openmp,Windows 安装 TDM-GCC 时需勾选 openmp。
  • MacOS 上目前只支持从本地加载模型,量化 kernel 基于 CUDA,无法在 Mac 上使用 GPU 量化推理。
  • 本模型为 MIT 协议开源,允许商用;README 中另有 GLM-4 系列的更新说明可供参考。

核心亮点

  • 推理速度较初代提升42%,单卡即可流畅运行
  • 支持32K长上下文,处理长文档和复杂对话更从容
  • MIT协议,可自由商用,部署方案丰富(含量化版)

不足之处

  • 模型参数规模较小,复杂推理和知识广度弱于更大模型
  • 文档/社区待观察

适用场景

  • 本地私有化部署聊天机器人或客服系统
  • 学术研究中的对话生成和语言理解实验
  • 边缘设备或低资源环境下的智能助手

替代项目

LLaMA 2、Qwen-7B、Baichuan2-7B

项目介绍

ChatGLM2-6B 是开源模型领域的开源项目,由 zai-org 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(15,515)位列前 4%,在开源模型分类的 422 个项目里位列前 4%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。可本地部署,完全免费使用。

它主要面向的使用场景是:本地私有化部署聊天机器人或客服系统。同类可对比的替代方案包括 LLaMA 2、Qwen-7B、Baichuan2-7B。

上一篇:kubesphere

下一篇:Llama-Chinese

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10