eval-assist 是评测安全领域的开源项目,由 IBM 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 103。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,提供网页版评估体验。从国内网络环境看,可直接访问。
它主要面向的使用场景是:模型输出质量对比:快速定义标准并批量评估不同模型的回答。同类可对比的替代方案包括 promptfoo、DeepEval。

用网页交互调教 LLM 当裁判,迭代出靠谱评估标准
EvalAssist 是一个开源工具,旨在简化使用大语言模型作为评估者(LLM-as-a-Judge)来评判其他大语言模型输出的过程。它解决的核心问题是:直接让 LLM 打分往往标准模糊、结果不稳定,而手动设计评估标准又很繁琐。EvalAssist 提供基于 Web 的交互界面,让用户能迭代式地定义、修改和细化评估标准,并即时查看 LLM 评估结果,从而逐步对齐评估意图。核心能力包括:支持自定义评估维度与评分规则、实时反馈与调整、以及将评估流程标准化。项目采用 TypeScript 开发,适合需要自动化评测 LLM 输出质量的研究者、产品团队和开发者,尤其适用于模型对比、提示词优化和内容安全审核等场景。
promptfoo、DeepEval
eval-assist 是评测安全领域的开源项目,由 IBM 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 103。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。开源免费,提供网页版评估体验。从国内网络环境看,可直接访问。
它主要面向的使用场景是:模型输出质量对比:快速定义标准并批量评估不同模型的回答。同类可对比的替代方案包括 promptfoo、DeepEval。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.