FollowBench

用多级细粒度约束,精准测出大模型指令遵循的真实水平

FollowBench 是一个用于评估大型语言模型(LLM)遵循细粒度指令能力的基准测试集,由 ACL 2024 论文提出。它针对现有基准测试中指令约束过于简单、单一的问题,设计了多层级(从单一约束到五重约束)的细粒度约束体系,并配套了自动评估方法。该基准包含 500 条精心设计的指令,每条指令包含多个约束条件,能够系统性地测试模型在复杂指令下的遵循能力。核心能力包括:约束自动拆解与验证、多层级难度递进、以及基于 GPT-4 的自动评分机制。它解决了传统基准无法区分模型在简单与复杂指令遵循上的性能差异的问题,为 LLM 的指令遵循能力提供了更精细的度量工具。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 121
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队YJiangcm
所属国家
官网地址
定价模式free
价格说明开源基准测试项目,Apache-2.0许可,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型benchmark,constraints,instruction-following,large-language-models,multi-level
GitHub 星标★ 121
30天Star增速
HF 下载量
上线时间2023-10-31 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 设计了从简单到复杂的多层级约束(1-5个约束),能细致区分模型能力差异
  • 提供自动评估脚本,基于GPT-4打分,无需人工标注,可复现性强
  • 数据公开且配套代码,便于研究者直接使用和扩展

不足之处

  • 依赖GPT-4作为评估器,存在一定成本和偏差风险
  • 测试集规模较小(500条),覆盖场景有限

适用场景

  • 学术研究:比较不同LLM的指令遵循能力
  • 模型开发:在发布前测试模型对复杂指令的处理能力
  • 基准测试:作为LLM评估套件的一部分,补充细粒度约束维度

替代项目

IFEval、InstructionFollowing-Eval、ComplexBench

项目介绍

FollowBench 是评测安全领域的开源项目,由 YJiangcm 开发,2023 年首次发布。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 121。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。开源基准测试项目,Apache-2.0许可,完全免费,无付费版本。

它主要面向的使用场景是:学术研究:比较不同LLM的指令遵循能力。同类可对比的替代方案包括 IFEval、InstructionFollowing-Eval、ComplexBench。

上一篇:LLMeBench

下一篇:UHGEval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12