promptbench

一套框架,全面测出大模型真实力与弱点

PromptBench 是一个面向大语言模型的统一评估框架,旨在解决当前 LLM 评估碎片化、缺乏标准化的问题。它提供了一套模块化、可扩展的工具,支持对模型进行多维度、多层次的性能测试,包括对抗性攻击下的鲁棒性评估、提示工程策略的效果对比、以及不同任务场景下的基准测试。核心能力包括:丰富的内置攻击方法(如文本扰动、语义攻击)、灵活的提示模板管理、自动化评估流程、以及详细的指标报告。通过统一的接口,用户可以便捷地评估不同模型(如 GPT、LLaMA)在各类任务上的表现,从而更全面地理解模型的能力边界和弱点。该框架特别强调对模型鲁棒性的量化分析,帮助开发者发现模型在面临恶意或意外输入时的脆弱性,进而指导模型改进和部署决策。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2822
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队microsoftarchive
所属国家
定价模式free
价格说明开源框架,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型adversarial-attacks,benchmark,chatgpt,evaluation,large-language-models,prompt,prompt-engineering,robustness
GitHub 星标★ 2822
30天Star增速
HF 下载量
上线时间2023-06-13 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • Python 3.9(README 中 conda 环境指定版本)
  • pip 包管理工具,用于安装 promptbench 及依赖
  • conda(可选,用于创建隔离环境)
  • 能够访问 GitHub 的网络环境
  • 如需使用 Prompt Attacks 功能,还需额外安装 TextAttack

安装与启动步骤

  1. 1pip 快速安装

    最省事的方式,直接安装官方发布的 Python 包,适合只想快速开始评估的用户。

    pip install promptbench
  2. 2克隆仓库

    想使用最新特性或基于源码开发时,从 GitHub 克隆项目。

    git clone git@github.com:microsoft/promptbench.git
  3. 3进入项目目录

    切换到克隆下来的仓库根目录,后续命令都在此目录执行。

    cd promptbench
  4. 4创建 conda 环境

    README 指定使用 Python 3.9 创建名为 promptbench 的隔离环境。

    conda create --name promptbench python=3.9
  5. 5激活环境

    激活刚创建的环境,确保依赖装在隔离环境中。

    conda activate promptbench
  6. 6安装依赖包

    安装基础 Python 依赖,这一步只装基础包,不含攻击相关组件。

    pip install -r requirements.txt
  7. 7验证导入

    在 Python 交互环境中导入 promptbench,确认安装成功。

    import promptbench as pb

如何确认成功

执行 import promptbench as pb 不报错,即表示基础库安装成功。

常见问题

Q:pip 安装和 GitHub 安装该选哪个?

A:pip 安装最省事,但版本可能落后于仓库最新更新;需要最新特性或二次开发时选 GitHub 源码安装。

Q:为什么安装完还不能跑 Prompt Attacks?

A:requirements.txt 只包含基础 Python 包,攻击功能还需要额外安装 TextAttack,README 中未给出具体命令,请参考其官方文档安装。

Q:clone 时提示权限被拒绝怎么办?

A:README 使用的是 SSH 地址,需要本机已配置 GitHub SSH 密钥;未配置可改用 HTTPS 地址克隆。

Q:必须在 conda 环境里安装吗?

A:conda 是 README 推荐做法,用于版本隔离并锁定 Python 3.9;已有满足要求的 Python 3.9 环境也可直接安装依赖。

注意事项

  • pip 安装的版本可能落后于 GitHub 仓库的最新代码。
  • Prompt Attacks 相关功能需要额外安装 TextAttack 才能使用。
  • README 给出的克隆地址为 SSH 形式(git@github.com:...),需先配置 SSH 密钥。
  • 切换环境后请确认使用的是 promptbench 这个 conda 环境,避免依赖装到全局环境。

核心亮点

  • 内置多种对抗攻击方法,能系统评估模型鲁棒性
  • 模块化设计,支持自定义任务、模型和攻击策略
  • 提供详细评估报告,便于对比不同模型和提示词效果

不足之处

  • 文档和社区生态尚在成长,部分功能使用需自行探索
  • 对中文场景的适配和示例相对较少

适用场景

  • 大模型选型时对比不同模型的鲁棒性和综合能力
  • 开发提示工程策略时验证提示词在不同攻击下的稳定性
  • 研究对抗攻击方法时快速搭建评估基准

替代项目

lm-evaluation-harness、OpenCompass、HELM

项目介绍

promptbench 是评测安全领域的开源项目,由 microsoftarchive 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,822)位列前 30%,在评测安全分类的 458 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:大模型选型时对比不同模型的鲁棒性和综合能力。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass、HELM。

上一篇:ChatGPT_DAN

下一篇:AgentBench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12