langtest

给大模型做全面体检,上线前揪出安全漏洞

LangTest 是一个专注于语言模型安全性与有效性的开源测试框架。它解决的是大语言模型在部署前缺乏系统性评估的问题,帮助开发者自动生成测试用例,覆盖模型在公平性、鲁棒性、偏见、事实性、敏感信息泄露等方面的表现。核心能力包括:提供统一的测试接口,支持多种主流模型(如OpenAI、HuggingFace等),内置丰富的测试套件和可扩展的自定义测试机制,并能生成结构化报告以辅助模型迭代。通过简单的API调用,开发者可以快速对模型进行压力测试,发现潜在风险,从而保障模型在实际应用中的可靠与合规。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 560
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队PacificAI
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型ai-safety,ai-testing,artificial-intelligence,benchmark-framework,benchmarks,ethics-in-ai,large-language-models,llm,llm-as-evaluator,llm-evaluation-toolkit,llm-test,llm-testing,ml-safety,ml-testing,mlops,model-assessment,nlp,responsible-ai,trustworthy-ai
GitHub 星标★ 560
30天Star增速
HF 下载量
上线时间2022-11-18 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 内置覆盖偏见、鲁棒性、事实性等10+类测试,开箱即用
  • 支持OpenAI、HuggingFace等主流模型,接入成本低
  • 可自定义测试用例,灵活适配业务场景

不足之处

  • 文档/社区待观察
  • 早期项目,测试场景覆盖可能不够全面

适用场景

  • 大模型上线前的安全合规评估
  • 模型迭代时的回归测试
  • 对比不同模型或版本的性能差异

替代项目

DeepEval、PromptBench、lm-evaluation-harness

项目介绍

langtest 是评测安全领域的开源项目,由 PacificAI 开发,2022 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 560。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-16。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:大模型上线前的安全合规评估。同类可对比的替代方案包括 DeepEval、PromptBench、lm-evaluation-harness。

上一篇:Omni-SafetyBench

下一篇:MMMU

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24