athina-evals

给 LLM 响应做质检,快速发现模型输出问题

athina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量的问题。该工具提供了一套丰富的评估指标和测试用例,支持对响应进行多维度检测,包括事实一致性、相关性、有害性、幻觉等。开发者可以轻松集成到现有测试流程中,通过简单的 API 调用运行评估,并获取详细的报告,从而快速定位模型输出的薄弱环节。核心能力包括:预置多种评估模板、支持自定义评估逻辑、与主流 LLM 框架兼容、提供本地和云端两种运行模式。它旨在帮助团队在开发周期中持续监控和提升 LLM 应用的可靠性。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 302
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队athina-ai
所属国家
定价模式free
价格说明开源项目,可自行部署使用,无付费版本。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型evaluation,evaluation-framework,evaluation-metrics,llm-eval,llm-evaluation,llm-evaluation-toolkit,llm-ops,llmops
GitHub 星标★ 302
30天Star增速
HF 下载量
上线时间2023-11-22 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 提供开箱即用的多种评估指标,覆盖事实性、相关性、有害性等关键维度
  • API 设计简洁,几行代码即可集成到现有测试流程
  • 支持自定义评估逻辑,灵活适配不同业务场景

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 评估指标依赖外部 LLM 调用,可能产生额外成本

适用场景

  • 在 CI/CD 流程中自动评估模型输出质量,防止回归
  • 对比不同 Prompt 或模型版本的效果,辅助调优
  • 对生产环境中的 LLM 响应进行抽样监控,发现潜在风险

替代项目

LangChain Evals、Promptfoo、DeepEval

项目介绍

athina-evals 是评测安全领域的开源项目,由 athina-ai 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 302。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。可自行部署使用,无付费版本。

它主要面向的使用场景是:在CI/CD流程中自动评估模型输出质量,防止回归。同类可对比的替代方案包括 LangChain Evals、Promptfoo、DeepEval。

上一篇:llm-leaderboard

下一篇:prometheus-eval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12