deepeval

像写单元测试一样评测你的 LLM 应用,快速发现质量回归。

DeepEval 是一个开源的 LLM(大语言模型)评测框架,旨在帮助开发者系统化地测试和评估基于 LLM 的应用。它解决了 LLM 应用质量难以量化、回归测试困难的问题,提供了一套类似 Pytest 的测试范式,让开发者可以像编写单元测试一样编写 LLM 评测用例。核心能力包括:支持 14 种以上的评测指标(如答案相关性、忠实度、上下文相关性等),内置合成数据生成器,支持 Pytest 集成,提供全面的 CI/CD 集成能力,以及一个可选的托管评估平台(Confident AI)用于集中管理和分析测试结果。DeepEval 强调易用性,通过简单的 Python 装饰器即可快速构建评测流程,并支持自定义指标和多种 LLM 提供商。

开源 freemium 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 18394
维护状态 活跃
是否开源 是
定价模式 freemium

项目数据

分类评测安全
开发团队confident-ai
所属国家
定价模式freemium
价格说明开源框架免费,提供在线平台,基础功能免费,高级功能需付费,具体价格未明确。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型evaluation-framework,evaluation-metrics,llm-evaluation,llm-evaluation-framework,llm-evaluation-metrics,python
GitHub 星标★ 18394
30天Star增速
HF 下载量
上线时间2023-08-10 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.9 或更高版本(README 明确要求 Python>=3.9+)
  • 已安装 pip 包管理工具
  • 一个可调用的 LLM 应用或 Agent(如 RAG 客服机器人、LangChain/LangGraph 应用)
  • 可选:Confident AI 托管评估平台账号,用于集中管理测试结果

安装与启动步骤

  1. 1确认 Python 版本

    DeepEval 要求 Python 3.9 及以上,先确认本地版本,低于 3.9 需先升级再安装。

    python --version
  2. 2安装 DeepEval

    通过 pip 安装并升级到最新版 DeepEval,这是 README 给出的唯一安装方式。

    pip install -U deepeval
  3. 3接入你的 LLM 应用

    在现有应用循环中挂上评测指标,示例为 LangChain 集成,其他框架参考 README 的 Integrations 折叠块。

    from deepeval.integrations.langchain import CallbackHandler
    from deepeval.metrics import TaskCompletionMetric
    
    for golden in dataset.evals_iterator():
        llm.invoke(
            golden.input,
            config={"callbacks": [CallbackHandler(metrics=[TaskCompletionMetric()])]},
        )
  4. 4运行评测

    用 deepeval 命令行执行评测套件,观察各指标的通过或失败情况。

    deepeval test run
  5. 5迭代修复失败指标

    针对未通过的指标调整提示词或流程后重跑评测,README 的 vibe-coder 指南即为此流程。

如何确认成功

运行 deepeval test run 无报错,并能看到各条评测指标的通过/失败结果。

常见问题

Q:需要什么 Python 版本?

A:README 明确说明 DeepEval 支持 Python>=3.9+,建议使用 3.9 及以上版本安装。

Q:支持哪些 LLM 框架集成?

A:README 列出了 OpenAI、OpenAI Agents、Anthropic、LangChain、LangGraph、Pydantic AI、CrewAI、LlamaIndex、Google ADK、Strands、AWS AgentCore,以及 TypeScript 的 AI SDK 和 Mastra。

Q:能让编码 Agent 自动写评测吗?

A:可以,README 提到安装 DeepEval skill 后让 Agent 生成数据集、编写评测套件、运行 deepeval test run 并迭代失败指标,另有 5 分钟 vibe-coder 指南。

Q:评测结果能集中管理吗?

A:可以,项目提供可选的托管评估平台 Confident AI 用于集中管理和分析测试结果,README 中只给出了官网链接。

注意事项

  • DeepEval 以 Python 库形式分发,README 未提供 Docker 或独立服务端部署方式。
  • README 节选中未列出评测所需 API Key 的环境变量名,使用前请以官方文档为准。
  • 部分示例代码中的 dataset、llm、agent 等对象需由你自己的项目和数据集提供。
  • Confident AI 平台为可选项,不接入也可本地运行评测。

核心亮点

  • 提供类似 Pytest 的测试体验,学习成本低,易于集成到现有测试流程。
  • 内置 14+ 种常用评测指标,覆盖答案相关性、忠实度、上下文相关性等关键维度。
  • 支持合成数据生成,可自动创建测试用例,减少手动标注成本。

不足之处

  • 评测结果依赖所选 LLM 的判断,可能引入主观性和不稳定性。
  • 文档和社区生态相对较新,部分高级功能需使用商业平台。

适用场景

  • 在 CI/CD 流水线中自动运行 LLM 回归测试,防止应用质量下降。
  • 开发阶段快速验证 prompt 或模型调整对输出质量的影响。
  • 对比不同 LLM 或 prompt 策略,选择最优方案。

替代项目

Ragas、Promptfoo、LangSmith

项目介绍

deepeval 是评测安全领域的开源项目,由 confident-ai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(18,394)位列前 3%,在评测安全分类的 466 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 17,559 增加到 18,394,净增 835。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源框架免费,提供在线平台,基础功能免费,高级功能需付费,具体价格未明确。从国内网络环境看,可直接访问。

它主要面向的使用场景是:在CI/CD流水线中自动运行LLM回归测试,防止应用质量下降。同类可对比的替代方案包括 Ragas、Promptfoo、LangSmith。

上一篇:evals

下一篇:garak

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12