Linly 是开源模型领域的开源项目,由 CVI-SZU 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(3,037)位列前 30%,在开源模型分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。
它主要面向的使用场景是:中文NLP学术研究,如文本分类、命名实体识别。同类可对比的替代方案包括 Chinese-LLaMA-Alpaca、BELLE、MOSS。

1安装 LFS 并拉取权重
先启用 git-lfs,再从 HuggingFace 克隆 ChatFlow-7B 权重,模型体积较大需耐心等待并保证磁盘空间
git lfs install
git clone https://huggingface.co/Linly-AI/ChatFlow-7B2克隆推理代码
下载官方 llama_inference 推理仓库,权重与代码需放在同级或可相对寻址的目录下
git clone https://github.com/ProjectD-AI/llama_inference3准备输入提示词
进入推理目录,编辑 prompts.txt 写入用户输入,例如“上海有什么好玩的地方?”
cd llama_inference
vi prompts.txt4运行命令行推理
指定权重、配置、tokenizer 与序列长度执行推理,结果写入 result.txt,解码参数详见 llama_inference
python3 llama_infer.py --test_path prompts.txt --prediction_path result.txt --load_model_path ../ChatFlow-7B/chatflow_7b.bin --config_path config/llama_7b_config.json --spm_model_path ../ChatFlow-7B/tokenizer.model --seq_length 5125安装 Flask 依赖
微服务部署需要 flask,先在当前 Python 环境安装
pip install flask6启动微服务
在 llama_inference 目录下启动 HTTP 服务,监听本机 8888 端口,参数与推理脚本一致
python3 llama_server.py --load_model_path ../ChatFlow-7B/chatflow_7b.bin --config_path config/llama_7b_config.json --spm_model_path ../ChatFlow-7B/tokenizer.model --seq_length 5127调用接口测试
用 curl 向 /chat 发送 JSON 问题,验证服务是否正常返回模型回复
curl -H 'Content-Type: application/json' http://127.0.0.1:8888/chat -d '{"question": "北京有什么好玩的地方?"}'| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--load_model_path | 是 | 模型权重文件路径,如 chatflow_7b.bin | ../ChatFlow-7B/chatflow_7b.bin |
--config_path | 是 | 模型结构配置文件路径 | config/llama_7b_config.json |
--spm_model_path | 是 | 分词模型文件路径 | ../ChatFlow-7B/tokenizer.model |
--seq_length | 是 | 推理序列长度,README 示例为 512 | 512 |
--test_path | 否 | 命令行推理的输入提示词文件 | prompts.txt |
--prediction_path | 否 | 命令行推理的结果输出文件 | result.txt |
命令行推理后查看 result.txt 是否生成回答;微服务启动后 curl 请求 /chat 能返回 JSON 回复即成功。
Q:这套流程能用在最新的 Linly-Chinese-LLaMA-2 上吗?
A:不能。README 明确说明本流程使用 TencentPretrain 格式权重,不适用于最新版 Linly-Chinese-LLaMA-2 的 hf 格式权重,后者请按 HuggingFace 页面说明使用。
Q:没有 GPU 能部署吗?
A:可以尝试 Int4 CPU 本地部署,ChatFlow 支持通过 llama.cpp 将 Int4 量化权重放在本地 CPU 推理,详见项目 wiki 的 int4 推理页面。
Q:微服务调用返回失败怎么排查?
A:先确认 flask 已安装、启动命令中的三个路径参数正确,并用 127.0.0.1:8888 访问;启动报错信息通常能直接指出路径或依赖问题。
Q:提示词文件怎么改?
A:直接编辑 prompts.txt,写入想提问的句子,例如“上海有什么好玩的地方?”,保存后重新运行推理命令即可。
Chinese-LLaMA-Alpaca、BELLE、MOSS
Linly 是开源模型领域的开源项目,由 CVI-SZU 开发,2023 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(3,037)位列前 30%,在开源模型分类中处于中上游。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。本地部署,完全免费。
它主要面向的使用场景是:中文NLP学术研究,如文本分类、命名实体识别。同类可对比的替代方案包括 Chinese-LLaMA-Alpaca、BELLE、MOSS。
Machine-Learning
开源
跟着博客笔记,边看边跑机器学习代码
All content related to machine learning from my blog
awesome-claude-fable-5-prompt-va···
开源
一站式掌握 Claude Fable 5 玩法,快速选型不踩坑
Ultimate Claude Fable 5 Guide 2026: Use Cases, Integrations & Benchmarks
Diffusion-Models-Papers-Survey-T···
开源
学视频生成怕绕路?这份资料库帮你理清
Diffusion model papers, survey, and taxonomy
CoreML-Models
开源
下载即用的苹果端 AI 模型库,免去转换烦恼
Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···