prometheus-eval

用 Prometheus 或 GPT-4 自动给 LLM 回复打分,快速筛选最佳模型。

Prometheus-Eval 是一个用于评估大语言模型(LLM)回复质量的工具,基于 Prometheus 模型和 GPT-4 作为评判标准。它解决了 LLM 评估中依赖人工标注成本高、自动化评估不准确的问题,提供了一套可复现、可扩展的评估框架。核心能力包括:支持使用 Prometheus 开源评估模型或 GPT-4 对模型输出进行打分和排序,提供细粒度的评估维度(如相关性、事实性、逻辑性等),并支持自定义评估标准。项目采用 Python 实现,易于集成到现有 LLM 开发流程中,帮助开发者快速筛选最优模型或提示词。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1117
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队prometheus-eval
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用和部署,无收费计划。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型evaluation,gpt4,litellm,llm,llm-as-a-judge,llm-as-evaluator,llmops,python,vllm
GitHub 星标★ 1117
30天Star增速
HF 下载量
上线时间2024-04-18 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • 可用的 Python 环境与 pip
  • 如需本地推理,需自行准备 vllm 运行环境
  • 如需 API 推理,需具备通过 litellm 调用的模型 API(如 GPT-4)

安装与启动步骤

  1. 1安装 prometheus-eval

    README 的 Installation 章节给出的唯一安装方式是 pip 安装,库目前处于 beta 阶段。

    pip install prometheus-eval
  2. 2选择推理后端

    README 说明支持 vllm 本地推理,也支持通过 litellm 调用 LLM API,按需选择其一。

  3. 3准备评估数据

    README 指出可对任意 instruction 与 response 组合进行评估,需先准备好待评估的指令与回复对。

  4. 4编写评估脚本

    在 Python 中调用 prometheus-eval 完成打分或排序,具体代码参见仓库 README 与示例。

如何确认成功

在 Python 中执行 import prometheus_eval 不报错,即说明库已成功安装。

常见问题

Q:只能用 GPT-4 做评判模型吗?

A:不是,README 说明既可用 vllm 在本地跑 Prometheus 系列开源评估模型,也可通过 litellm 调用 LLM API 做评判。

Q:安装或使用中报错怎么办?

A:该库处于 beta 阶段,README 建议在 GitHub 仓库提交 issue 反馈问题。

Q:本地跑评估需要 GPU 吗?

A:README 未说明硬件要求;走 vllm 本地推理通常需要相适配的硬件,走 API 方式则不需要。

注意事项

  • prometheus-eval 目前为 beta 阶段,接口可能变化,遇到问题建议到仓库提 issue
  • 最新 M-Prometheus 提供 3B、7B、14B 版本,可在 Hugging Face 组织页获取
  • README 节选中未给出完整可复制的快速开始代码,实际调用方式请以仓库示例为准

核心亮点

  • 支持 Prometheus 开源模型和 GPT-4 两种评估后端,灵活选择成本与精度
  • 提供多维度细粒度评分,可自定义评估标准,适配不同业务需求
  • API 设计简洁,易于集成到现有评估流水线,支持批量评估

不足之处

  • 依赖外部模型(GPT-4)时会产生 API 费用,且评估速度受限于网络
  • 文档和社区生态尚在早期,示例和最佳实践不够丰富

适用场景

  • 在 LLM 开发中对比多个候选模型的回复质量,选择最优模型
  • 在 RAG 或 Agent 系统中评估生成回复的相关性和事实性
  • 在提示词工程中迭代优化 prompt,自动量化改进效果

替代项目

OpenAI Evals、LangChain Evaluators、DeepEval

项目介绍

prometheus-eval 是评测安全领域的开源项目,由 prometheus-eval 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,117)位列前 30%,在评测安全分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0 许可证,可自由使用和部署,无收费计划。

它主要面向的使用场景是:在LLM开发中对比多个候选模型的回复质量,选择最优模型。同类可对比的替代方案包括 OpenAI Evals、LangChain Evaluators、DeepEval。

上一篇:athina-evals

下一篇:awesome-ai-safety

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12