eval-assist

用网页交互调教 LLM 当裁判,迭代出靠谱评估标准

EvalAssist 是一个开源工具,旨在简化使用大语言模型作为评估者(LLM-as-a-Judge)来评判其他大语言模型输出的过程。它解决的核心问题是:直接让 LLM 打分往往标准模糊、结果不稳定,而手动设计评估标准又很繁琐。EvalAssist 提供基于 Web 的交互界面,让用户能迭代式地定义、修改和细化评估标准,并即时查看 LLM 评估结果,从而逐步对齐评估意图。核心能力包括:支持自定义评估维度与评分规则、实时反馈与调整、以及将评估流程标准化。项目采用 TypeScript 开发,适合需要自动化评测 LLM 输出质量的研究者、产品团队和开发者,尤其适用于模型对比、提示词优化和内容安全审核等场景。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 103
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队IBM
所属国家
定价模式free
价格说明开源免费,提供网页版评估体验
访问状态
是否开源是
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型
GitHub 星标★ 103
30天Star增速
HF 下载量
上线时间2025-05-05 00:00:00
最近更新2026-09-24 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-25
浏览次数0

使用教程

核心亮点

  • 提供可视化 Web 界面,降低 LLM-as-a-Judge 的使用门槛
  • 支持迭代式细化评估标准,能逐步对齐人类意图
  • 基于 TypeScript 开发,前后端技术栈统一,便于二次开发

不足之处

  • 项目尚处早期,星标仅 103,社区生态和文档完善度有限
  • 依赖 LLM 作为评估者,评估结果仍受模型自身偏见和稳定性影响

适用场景

  • 模型输出质量对比:快速定义标准并批量评估不同模型的回答
  • 提示词工程优化:迭代评估标准以筛选最佳提示词
  • 内容安全审核:自定义安全维度,让 LLM 自动筛查违规内容

替代项目

promptfoo、DeepEval

项目介绍

eval-assist 是评测安全领域的开源项目,由 IBM 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 103。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,提供网页版评估体验。从国内网络环境看,可直接访问。

它主要面向的使用场景是:模型输出质量对比:快速定义标准并批量评估不同模型的回答。同类可对比的替代方案包括 promptfoo、DeepEval。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12