langtest 是评测安全领域的开源项目,由 PacificAI 开发,2022 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 560。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:大模型上线前的安全合规评估。同类可对比的替代方案包括 DeepEval、PromptBench、lm-evaluation-harness。

给大模型做全面体检,上线前揪出安全漏洞
LangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系统性评估的问题,帮助开发者自动生成测试用例,覆盖模型在公平性、鲁棒性、偏见、事实性、敏感信息泄露等方面的表现。核心能力包括:提供统一的测试接口,支持多种主流模型(如OpenAI、HuggingFace等),内置丰富的测试套件和可扩展的自定义测试机制,并能生成结构化报告以辅助模型迭代。通过简单的API调用,开发者可以快速对模型进行压力测试,发现潜在风险,从而保障模型在实际应用中的可靠与合规。
DeepEval、PromptBench、lm-evaluation-harness
langtest 是评测安全领域的开源项目,由 PacificAI 开发,2022 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 560。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。Apache-2.0 许可证,可免费使用和部署。
它主要面向的使用场景是:大模型上线前的安全合规评估。同类可对比的替代方案包括 DeepEval、PromptBench、lm-evaluation-harness。
上一篇:Omni-SafetyBench
下一篇:MMMU
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···