contextcheck 是评测安全领域的开源项目,由 Addepto 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 97。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-31。MIT 许可证,完全免费开源,可自行部署使用。
它主要面向的使用场景是:在CI流水线中自动检测LLM回答的准确性和安全性,防止回归。同类可对比的替代方案包括 Promptfoo、DeepEval、Ragas。

用 YAML 配置测试用例,把 LLM 测试塞进 CI 流水线,自动跑完收工。
contextcheck 是一个基于 MIT 许可的开源框架,用于测试大型语言模型(LLM)、检索增强生成(RAG)系统以及聊天机器人。它通过 YAML 文件进行灵活配置,能够定义测试用例、预期行为以及评估指标,并支持集成到 CI 流水线中,实现自动化测试。该框架旨在帮助开发者在部署前验证模型输出的准确性、安全性和一致性,解决 LLM 应用测试难、评估标准不统一的问题。其核心能力包括:结构化测试用例管理、可定制的评估逻辑、与现有开发流程的无缝对接,以及清晰的测试报告输出。
Promptfoo、DeepEval、Ragas
contextcheck 是评测安全领域的开源项目,由 Addepto 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 97。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-31。MIT 许可证,完全免费开源,可自行部署使用。
它主要面向的使用场景是:在CI流水线中自动检测LLM回答的准确性和安全性,防止回归。同类可对比的替代方案包括 Promptfoo、DeepEval、Ragas。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···