Qwen

下载即用的中文大模型,多尺寸可选,轻松落地各类场景。

Qwen(通义千问)是阿里巴巴云推出的开源大语言模型系列,包含对话模型和预训练模型。该项目提供了从0.5B到72B多种规模的模型权重,支持中英文及多语言,覆盖聊天、指令跟随、代码生成、数学推理等任务。其核心能力包括高质量的多语言理解与生成、长上下文处理(如32K)、以及通过量化技术实现高效部署。Qwen系列在多个基准测试中表现优异,尤其在中文场景下具有明显优势。项目还提供了与Hugging Face Transformers、vLLM等主流框架的集成,方便开发者微调和部署。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 21818
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队QwenLM
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可免费本地部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型chinese,flash-attention,large-language-models,llm,natural-language-processing,pretrained-models
GitHub 星标★ 21818
30天Star增速
HF 下载量
上线时间2023-08-03 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:Docker 8 步

环境要求

  • 已安装 Docker 并可正常启动服务
  • NVIDIA GPU 与驱动,且已安装 nvidia-container-toolkit
  • 已下载 Qwen 模型权重(如 Qwen-7B-Chat)到本地目录
  • 非 Docker 方式需 Python 环境并安装 requirements.txt 依赖

安装与启动步骤

  1. 1安装 Python 依赖

    非 Docker 方式部署时,先在项目根目录安装依赖库;Docker 方式可跳过此步。

    pip install -r requirements.txt
  2. 2可选装 flash-attention

    设备支持 fp16/bf16 时安装可降低显存、提升效率;不装也能正常运行,编译较慢。

    git clone https://github.com/Dao-AILab/flash-attention
    cd flash-attention && pip install .
  3. 3启动 Docker 服务

    在宿主机上启动 Docker 守护进程,确保后续容器命令可用。

    sudo systemctl start docker
  4. 4验证 Docker 与 GPU

    先跑 hello-world 确认 Docker 正常,再用 nvidia 运行时确认容器可用 GPU。

    sudo docker run hello-world
    sudo docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smi
  5. 5下载模型权重

    按官方 DownloadModel 说明把模型权重和代码下载到本地,得到 CHECKPOINT_PATH 目录。

  6. 6配置部署变量

    在终端设置镜像名、端口和模型权重路径,后续脚本会引用这三个变量。

    IMAGE_NAME=qwenllm/qwen:cu117
    PORT=8901
    CHECKPOINT_PATH=/path/to/Qwen-7B-Chat
  7. 7启动 OpenAI API

    脚本会自动拉取镜像并在后台启动 OpenAI 兼容接口,端口由 PORT 决定。

    bash docker/docker_openai_api.sh -i ${IMAGE_NAME} -c ${CHECKPOINT_PATH} --port ${PORT}
  8. 8启动 Web UI 与 CLI

    二选一执行:Web UI 浏览器访问,CLI Demo 在终端直接对话;服务会自动重启。

    bash docker/docker_web_demo.sh -i ${IMAGE_NAME} -c ${CHECKPOINT_PATH} --port ${PORT}
    bash docker/docker_cli_demo.sh -i ${IMAGE_NAME} -c ${CHECKPOINT_PATH}

关键配置

配置项必填说明示例
IMAGE_NAME是预置环境的 Docker 镜像名称与标签qwenllm/qwen:cu117
PORT是Web UI 与 API 对外暴露的端口8901
CHECKPOINT_PATH是本地已下载的模型权重目录路径/path/to/Qwen-7B-Chat

如何确认成功

看到 Successfully started web demo 输出后,浏览器打开 http://localhost:${PORT} 即可;用 docker logs qwen 查看运行状态。

常见问题

Q:flash-attention 必须安装吗?

A:不必须。README 明确说明它是可选项,项目不安装也能正常运行,只是效率和显存占用不如安装后。

Q:微调时出现依赖冲突怎么办?

A:使用 DeepSpeed 可能与新版 pydantic 冲突,需确保 pydantic<2.0,并用 pip install "peft<0.8.0" deepspeed 安装。

Q:如何停止并删除正在运行的 Demo?

A:执行 docker rm -f qwen 即可停止服务并移除容器,之后重新运行启动脚本即可。

Q:想在多张 GPU 上跑推理怎么办?

A:可改用 vLLM + FastChat,在 vllm_worker 命令中加 --tensor-parallel-size 指定 GPU 数量,如 4。

注意事项

  • 本仓库已不再积极维护,官方建议关注并迁移到 QwenLM/Qwen2。
  • Docker 脚本会自动下载镜像并以后台方式启动,服务具备自动重启能力。
  • 微调脚本 finetune.py 支持全参数微调、LoRA 和 Q-LoRA,需先把样本整理成 JSON 列表。
  • flash-attention 的 csrc/layer_norm 与 csrc/rotary 为可选组件,安装可能较慢。

核心亮点

  • 模型尺寸覆盖0.5B到72B,适配不同算力需求,从端侧到云端均可部署
  • 中文能力突出,在中文理解、生成和知识问答上表现优于多数同规模开源模型
  • 支持长上下文(32K),适合处理长文档和复杂对话

不足之处

  • 部分高级功能(如工具调用)文档不够详细,社区支持主要依赖官方渠道
  • 模型迭代较快,旧版本兼容性需关注

适用场景

  • 中文客服对话系统
  • 企业知识库问答助手
  • 代码生成与辅助编程

替代项目

ChatGLM、Baichuan、LLaMA

项目介绍

Qwen 是开源模型领域的开源项目,由 QwenLM 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(21,818)位列前 3%,在开源模型分类的 424 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 21,582 增加到 21,818,净增 236。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0许可,可免费本地部署使用。

它主要面向的使用场景是:中文客服对话系统。同类可对比的替代方案包括 ChatGLM、Baichuan、LLaMA。

上一篇:unilm

下一篇:architecture.of.internet-product

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10