synbad

同一模型多家推理服务商,跑一轮评测看谁更靠谱

synbad 是一个用 TypeScript 编写的 LLM 评测工具,专门用来测试开源推理服务商(inference providers)的实际表现。它解决的核心问题是:同一批开源模型在不同托管平台上,输出质量、响应速度、稳定性可能差异很大,开发者很难判断该选哪家。synbad 通过内置的评测集和统一调用接口,把多个推理服务商放在同一标准下对比,帮助用户发现哪家服务在特定任务上更可靠。项目定位偏轻量,适合在选型阶段快速跑一轮基准测试,也适合持续监控已接入服务商的质量波动。核心能力包括:统一的 provider 适配层、可配置的评测任务、结果对比输出。作为早期项目,它更偏向实用工具而非完整评测平台,适合开发者按需扩展自己的测试用例。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 130
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类评测安全
开发团队synthetic-lab
所属国家
官网地址
定价模式free
价格说明开源免费,无定价信息
访问状态
是否开源是
开源协议
主要语言TypeScript
技术栈/模型
GitHub 星标★ 130
30天Star增速
HF 下载量
上线时间2025-11-26 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 专注推理服务商横向对比,填补了模型评测之外的服务层评测空白
  • TypeScript 实现,前端/Node 开发者容易上手和二次开发
  • 轻量工具定位,适合快速跑基准而非重型评测平台

不足之处

  • 早期项目,评测集和 provider 覆盖范围有限
  • 文档和社区生态待观察

适用场景

  • 选型阶段对比多家开源模型托管平台的实际输出质量
  • 持续监控已接入推理服务商的响应稳定性和质量波动
  • 团队内部建立推理服务准入的标准化评测流程

替代项目

lm-evaluation-harness、promptfoo

项目介绍

synbad 是评测安全领域的开源项目,由 synthetic-lab 开发,2025 年首次发布。

它收录于评测安全分类,该分类目前共有 498 个项目,GitHub 星标数为 130。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。开源免费,无定价信息。

它主要面向的使用场景是:选型阶段对比多家开源模型托管平台的实际输出质量。同类可对比的替代方案包括 lm-evaluation-harness、promptfoo。

上一篇:augustus

下一篇:没有了!

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1527 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2992 2026-09-12