jev

笔记本本地跑,秒回是或否

jev 是一个可在笔记本本地运行的开源二分类决策模型,定位为 Jev 的替代方案,专门回答“是/否”这类简单判断问题。它基于 llama.cpp 与 GGUF 量化格式,支持纯 CPU 推理,无需 GPU 或联网,通过 FastAPI 暴露接口,方便集成到应用里。相比调用大模型 API 做简单判断,它体积小、延迟低、隐私安全,适合边缘设备或离线环境。项目用 Python 编写,技术栈覆盖二分类、决策模型、边缘 AI 等方向,目标是让开发者用极低成本获得稳定的二元决策能力,而不是让通用大模型去猜答案。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1053
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队feder-cr
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型binary-classification,classification,cpu-inference,decision-model,edge-ai,fastapi,gguf,jev,llama-cpp,llm,llm-inference,local-llm,minicpm,nlp,offline,on-device-ai,python,self-hosted,text-classification,yes-no
GitHub 星标★ 1053
30天Star增速
HF 下载量
上线时间2024-08-15 00:00:00
最近更新2026-09-27 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-28
浏览次数0

使用教程

难度:入门 约 15 分钟 部署方式:命令行工具 6 步

环境要求

  • Python 环境(README 使用 uv 管理依赖)
  • 已安装 uv 工具
  • 下载 jevos-q4_k_m.gguf 模型文件(来自 GitHub release)
  • 纯 CPU 即可运行,无需 GPU 或联网

安装与启动步骤

  1. 1下载模型文件

    从 GitHub release 页面下载 jevos-q4_k_m.gguf,放到当前工作目录,后续启动命令直接引用该文件名。

  2. 2同步依赖

    在项目根目录执行 uv sync,按 README 说明安装 Python 依赖,确保后续 jev 命令可用。

    uv sync
  3. 3下载运行时

    拉取适配本机平台的 llama.cpp 运行时,--only runtime 表示只下载运行所需的二进制。

    uv run jev download --only runtime
  4. 4启动服务

    用 CPU 推理启动 FastAPI 服务,--threads 16 按机器核数调整,服务默认监听 127.0.0.1:8017。

    uv run jev serve --gguf jevos-q4_k_m.gguf --device cpu --threads 16
  5. 5调用接口测试

    用 curl 向 /v1/systemone 发送 JSON,state 填文本、questions 填是/否问题,返回 noul 概率值。

    curl http://127.0.0.1:8017/v1/systemone -H 'Content-Type: application/json' -d '{
      "model": "jev-latest",
      "state": "I was charged twice for the same order.",
      "questions": {"billing": {"type": "noul", "instructions": "Is this a billing problem?"}}}'
  6. 6打开演示页面

    在浏览器访问 /dino 路径,可观看模型在 CPU 上玩 Chrome 恐龙小游戏的演示效果。

关键配置

配置项必填说明示例
--gguf是指定 GGUF 量化模型文件路径jevos-q4_k_m.gguf
--device是推理设备,纯 CPU 填 cpucpu
--threads否CPU 推理线程数,按机器核数调整16

如何确认成功

服务启动后访问 http://127.0.0.1:8017/dino 能看到恐龙游戏页面;curl 调用 /v1/systemone 返回含 noul 概率的 JSON 即成功。

常见问题

Q:显存/显卡不够能用吗?

A:可以。项目支持纯 CPU 推理,--device cpu 即可,笔记本上单次判断约 50–220 ms,无需 GPU 和联网。

Q:模型文件从哪里获取?

A:从 GitHub release 页面下载 jevos-q4_k_m.gguf:https://github.com/feder-cr/jev/releases/tag/jevos,放到运行目录即可。

Q:接口返回的 noul 是什么?

A:noul 类型表示是/否二分类,返回值如 0.9 代表该问题为真的概率 P(yes),可按阈值自行判定。

Q:支持多选题和打分吗?

A:README 对比表中标注 Multiple choice 与 Scores 为 Soon,当前版本主要支持是/否判断。

注意事项

  • context 上限为 8,192 tokens,超长文本需自行截断。
  • 默认监听 127.0.0.1:8017,对外服务时注意端口与访问控制。
  • docs 未给出额外配置文件说明,参数通过命令行传入。

核心亮点

  • 纯 CPU 推理,无需 GPU,普通笔记本即可运行
  • 基于 GGUF 量化,模型体积小、启动快、延迟低
  • 提供 FastAPI 接口,方便嵌入现有服务或应用

不足之处

  • 仅支持二分类是/否,无法处理开放问答或多类别任务
  • 项目处于成长阶段,生态与文档完善度待观察

适用场景

  • 本地应用中的规则判断替代,如内容是否合规
  • 边缘设备上的离线决策,如传感器触发确认
  • 隐私敏感场景下的二元分类,如用户意图是否同意

替代项目

llama.cpp、Ollama

项目介绍

jev 是开源模型领域的开源项目,由 feder-cr 开发,2024 年首次发布。

在全站 13,199 个收录项目中,它的 GitHub 星标数(1,053)位列前 30%,在开源模型分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。开源免费,需自行部署。

它主要面向的使用场景是:本地应用中的规则判断替代,如内容是否合规。同类可对比的替代方案包括 llama.cpp、Ollama。

上一篇:awesome-mobile-llm

下一篇:没有了!

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1875 2026-08-10