Chinese-Llama-2-7b

下载即用的中文 LLaMA2,让中文对话开箱即跑

Chinese-Llama-2-7b 是开源社区第一个提供可下载、可运行的中文 LLaMA2 模型,基于 Meta 的 LLaMA2-7B 进行中文增强训练。它解决了原始 LLaMA2 在中文任务上表现不佳的问题,通过扩充中文词表、在大规模中文语料上继续预训练和指令微调,使模型具备流畅的中文理解和生成能力。项目提供了完整的模型权重、训练代码和推理示例,支持 Hugging Face Transformers 直接加载,方便开发者快速集成。核心能力包括中文对话、文本生成、知识问答等,适合作为中文 NLP 应用的基础模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2204
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队LinkSoul-AI
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可自由下载、部署和使用,完全免费。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型deep-learning,llama2,llama2-docker,llm,pytorch
GitHub 星标★ 2204
30天Star增速
HF 下载量
上线时间2023-07-20 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:Docker 6 步

环境要求

  • 带 NVIDIA 显卡的机器,并安装可用的 CUDA 驱动(docker run 使用 --gpus all)
  • 已安装 Docker 与 NVIDIA Container Toolkit(nvidia-container-runtime)
  • 已获取 Chinese-Llama-2-7b 模型权重(HuggingFace / ModelScope / 始智AI 任一渠道下载)
  • API 方式部署还需 Python 环境,可 pip 安装 fastapi、uvicorn
  • 构建镜像需要能访问 nvcr.io 上的 pytorch:23.06-py3 基础镜像

安装与启动步骤

  1. 1下载模型权重

    从 README 给出的 HuggingFace、ModelScope 或始智AI 链接下载 Chinese-Llama-2-7b 权重到本地目录,供容器挂载使用。

  2. 2构建 Docker 镜像

    在项目目录(含 Dockerfile)下执行,基于 nvcr.io/nvidia/pytorch:23.06-py3 构建中文 LLaMA2 镜像,首次构建耗时较长。

    docker build -t linksoul/chinese-llama2-chat .
  3. 3运行容器

    启用全部 GPU 并放开共享内存限制,把当前目录下的 LinkSoul 挂载到容器 /app/LinkSoul,映射 7860 端口并启动 Demo。

    docker run --gpus all --ipc=host --ulimit memlock=-1 --ulimit stack=67108864 --rm -it -v `pwd`/LinkSoul:/app/LinkSoul -p 7860:7860 linksoul/chinese-llama2-chat
  4. 4安装 API 依赖

    如改用 API 方式部署,需先安装 README 指定的额外依赖 fastapi 与 uvicorn。

    pip install fastapi uvicorn
  5. 5启动 API 服务

    运行仓库中的 api.py,服务默认部署在本地 8000 端口,通过 POST 方法调用。

    python api.py
  6. 6调用接口验证

    用 curl 以 POST 方式提交 prompt 与 history 字段,返回 JSON 中包含 response、history、status、time。

    curl -X POST "http://127.0.0.1:8000" -H 'Content-Type: application/json' -d '{"prompt": "你好", "history": []}'

关键配置

配置项必填说明示例
7860:7860否Docker 运行时映射的端口,用于访问内置 Demo 页面-p 7860:7860
8000否api.py 默认监听的本地端口,只能用 POST 调用http://127.0.0.1:8000
prompt是API 请求体中的用户输入文本字段你好
history是API 请求体中的历史对话字段,首轮传空数组[]

如何确认成功

容器启动后浏览器访问 http://127.0.0.1:7860 可打开 Demo;API 方式执行 curl 后返回 status 为 200 的 JSON。

常见问题

Q:docker run 提示找不到 GPU 或 --gpus all 不生效?

A:说明宿主机未正确配置 NVIDIA 驱动与 NVIDIA Container Toolkit,需先安装驱动和 nvidia-container-runtime 后再运行容器。

Q:没有 GPU 能跑吗?

A:README 提供了 INT4 量化版本与 Colab 在线试玩链接,但 Colab 需要开启高 RAM,免费版无法使用。

Q:模型权重下载慢怎么办?

A:README 同时给出始智AI、ModelScope 两个国内渠道,可任选其一下载 Chinese Llama2 Chat Model 权重。

Q:API 启动后 curl 连不上?

A:确认 api.py 已启动且未被其他进程占用 8000 端口,请求需使用 POST 方法并带 Content-Type: application/json 头。

注意事项

  • 输入格式严格遵循 llama-2-chat 格式,兼容针对原版 llama-2-chat 的各类优化。
  • 模型与中英文 SFT 数据集全部开源,可完全商用。
  • Docker 镜像基于 nvcr.io/nvidia/pytorch:23.06-py3,构建环境需能访问该镜像源。
  • api.py 返回的 history 中会包含系统提示词原文,集成时注意长度控制。

核心亮点

  • 首个可下载运行的中文 LLaMA2,降低了使用门槛
  • 扩充了中文词表,中文生成流畅度显著提升
  • 提供完整训练代码和推理示例,便于二次开发

不足之处

  • 基于 LLaMA2-7B,模型规模较小,复杂任务能力受限
  • 文档/社区待观察

适用场景

  • 中文聊天机器人开发
  • 中文文本生成与摘要
  • 中文知识问答系统

替代项目

Chinese-LLaMA-Alpaca、BELLE、MOSS

项目介绍

Chinese-Llama-2-7b 是开源模型领域的开源项目,由 LinkSoul-AI 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,204)位列前 30%,在开源模型分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。Apache-2.0许可,可自由下载、部署和使用,完全免费。

它主要面向的使用场景是:中文聊天机器人开发。同类可对比的替代方案包括 Chinese-LLaMA-Alpaca、BELLE、MOSS。

上一篇:kalosm

下一篇:xlstm

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10