athina-evals 是评测安全领域的开源项目,由 athina-ai 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 302。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。可自行部署使用,无付费版本。
它主要面向的使用场景是:在CI/CD流程中自动评估模型输出质量,防止回归。同类可对比的替代方案包括 LangChain Evals、Promptfoo、DeepEval。

给 LLM 响应做质检,快速发现模型输出问题
athina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量的问题。该工具提供了一套丰富的评估指标和测试用例,支持对响应进行多维度检测,包括事实一致性、相关性、有害性、幻觉等。开发者可以轻松集成到现有测试流程中,通过简单的 API 调用运行评估,并获取详细的报告,从而快速定位模型输出的薄弱环节。核心能力包括:预置多种评估模板、支持自定义评估逻辑、与主流 LLM 框架兼容、提供本地和云端两种运行模式。它旨在帮助团队在开发周期中持续监控和提升 LLM 应用的可靠性。
LangChain Evals、Promptfoo、DeepEval
athina-evals 是评测安全领域的开源项目,由 athina-ai 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 302。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。可自行部署使用,无付费版本。
它主要面向的使用场景是:在CI/CD流程中自动评估模型输出质量,防止回归。同类可对比的替代方案包括 LangChain Evals、Promptfoo、DeepEval。
上一篇:llm-leaderboard
下一篇:prometheus-eval
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.