Llama-Chinese

让中文开发者轻松上手 Llama,构建中文大模型生态

Llama-Chinese 是 Llama 中文社区维护的开源项目,旨在构建最好的中文 Llama 大模型开源生态。它实时汇总最新的 Llama 学习资料,提供中文版本的模型权重、训练代码、微调脚本、推理示例和部署指南,帮助中文开发者快速上手 Llama 系列模型。项目解决了 Llama 原生模型中文能力不足、中文资料分散的问题,通过整理和汉化,降低了中文用户的使用门槛。核心能力包括:提供中文预训练模型和指令微调模型、详细的本地部署教程、多场景应用示例(如对话、文本生成)、以及社区驱动的持续更新。项目完全开源可商用,适合研究、教学和商业应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 14760
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队LlamaChinese
所属国家
定价模式free
价格说明完全开源可商用,无付费版本,免费使用。
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型agent,llama,llama4,llm,pretraining,rl
GitHub 星标★ 14760
30天Star增速
HF 下载量
上线时间2023-07-19 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 3.10 以上版本
  • 已安装 git
  • 网络可访问 HuggingFace / ModelScope / WiseModel 以下载模型
  • 建议具备 NVIDIA GPU(推理代码会优先使用 CUDA 并启用 8bit 加载)

安装与启动步骤

  1. 1克隆仓库装依赖

    克隆 Llama-Chinese 仓库并进入目录,按 requirements.txt 安装所需 Python 软件包;请先确认 Python 版本在 3.10 以上。

    git clone https://github.com/LlamaFamily/Llama-Chinese.git
    cd Llama-Chinese
    pip install -r requirements.txt
  2. 2下载中文模型

    从 HuggingFace、ModelScope 或 WiseModel 下载 Atom-7B-Chat 模型权重到本地;README 未给出下载命令,需按对应页面指引下载。

  3. 3运行推理脚本

    新建 quick_start.py,把 README 中的 transformers 推理示例代码粘贴进去,保存后运行,即可看到对“介绍一下中国”的回答。

    python quick_start.py
  4. 4启动Gradio界面

    运行 chat_gradio.py 并传入模型名称,即可打开支持流式输出的网页问答界面;换模型只需改 model_name_or_path。

    python examples/chat_gradio.py --model_name_or_path FlagAlpha/Atom-7B-Chat
  5. 5Docker方式部署

    先克隆仓库并用 docker/Dockerfile 构建镜像,再进入 docker 目录用 docker-compose 后台启动 chat_gradio 服务。

    git clone https://github.com/LlamaFamily/Llama-Chinese.git
    cd Llama-Chinese
    docker build -f docker/Dockerfile -t flagalpha/llama2-chinese:gradio .
    cd docker
    docker-compose up -d --build
  6. 6ollama一键运行

    按 ollama 官网说明先安装 ollama 工具,再用一条命令拉取并运行社区提供的中文微调模型,适合快速体验。

    ollama run llamafamily/llama3-chinese-8b-instruct

关键配置

配置项必填说明示例
model_name_or_pathGradio 脚本加载的模型名称或本地路径FlagAlpha/Atom-7B-Chat
CUDA_VISIBLE_DEVICES指定推理使用的 GPU 编号,多卡时按需设置0

如何确认成功

运行 python quick_start.py 后终端能打印出模型生成的中文文本,即表示模型加载与推理成功。

常见问题

Q:没有 GPU 可以跑吗?

A:可以。推理代码中 device_map 会在 CUDA 不可用时自动切换为 auto,但纯 CPU 运行 7B 模型速度很慢,建议使用 GPU。

Q:模型下载不下来怎么办?

A:README 提供了 HuggingFace、ModelScope、WiseModel 三个下载来源,国内网络可选择 ModelScope 或 WiseModel 下载。

Q:中文效果不理想怎么选模型?

A:README 推荐优先使用中文预训练对话模型 Atom-7B-Chat,其中文效果比原生 Llama 更好。

Q:推理速度慢怎么加速?

A:README 列出了 lmdeploy、TensorRT-LLM、vLLM、JittorLLMs 等加速框架,其中 lmdeploy 文档见 inference-speed/GPU/lmdeploy_example。

注意事项

  • README 中的克隆地址为 LlamaFamily/Llama-Chinese,请以 README 给出的命令为准。
  • 推荐使用 Atom-7B-Chat 等中文微调模型,直接使用原生 Llama 中文效果较差。
  • Docker 部署的详细说明见仓库 docs/chat_gradio_guide.md。
  • 项目完全开源可商用,适合研究、教学和商业应用。

核心亮点

  • 提供中文版模型权重和微调脚本,直接可用,省去从零训练成本
  • 学习资料实时汇总,教程详细,覆盖部署、微调、推理全流程
  • 社区活跃,持续更新,紧跟 Llama 版本迭代

不足之处

  • 文档/社区待观察:部分教程可能滞后于最新模型版本
  • 中文模型效果与原生英文模型相比仍有差距,需自行评估

适用场景

  • 中文大模型研究和教学,快速搭建实验环境
  • 企业需要私有化部署中文对话或文本生成服务
  • 开发者学习 Llama 架构和微调技术,参考社区最佳实践

替代项目

Chinese-LLaMA-Alpaca、BELLE、Qwen

项目介绍

Llama-Chinese 是开源模型领域的开源项目,由 LlamaChinese 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(14,760)位列前 4%,在开源模型分类的 422 个项目里位列前 4%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全开源可商用,无付费版本,免费使用。

它主要面向的使用场景是:中文大模型研究和教学,快速搭建实验环境。同类可对比的替代方案包括 Chinese-LLaMA-Alpaca、BELLE、Qwen。

上一篇:ChatGLM2-6B

下一篇:Halfrost-Field

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10