tribunal

在 Elixir 里像写测试一样评测 LLM 输出

tribunal 是一个面向 Elixir 生态的 LLM 评测框架,解决在 Elixir 应用中缺乏统一方式评估和测试大模型输出的问题。它把评测能力直接嵌入 Elixir 项目,让开发者可以像写单元测试一样对 LLM 输出做断言和打分。核心能力包括:对模型回答进行质量度量、检测幻觉内容、对比不同提示词或模型版本的输出差异,并支持把评测结果纳入现有测试流程。对于使用 Phoenix 或 Nx 等技术栈的团队,tribunal 提供了无需切换到 Python 工具链的评测路径,降低了跨语言维护成本。项目目前处于早期阶段,API 和功能仍在演进,适合愿意跟进新工具、且主力语言为 Elixir 的团队尝鲜使用。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 114
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队georgeguimaraes
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源
开源协议MIT
主要语言Elixir
技术栈/模型
GitHub 星标★ 114
30天Star增速
HF 下载量
上线时间2026-01-12 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

核心亮点

  • 原生 Elixir 实现,可直接融入 ExUnit 测试流程,无需引入 Python 评测栈
  • 内置幻觉检测与回答质量度量,覆盖评测常见需求
  • 对 Phoenix/Nx 等 Elixir 生态项目集成成本低

不足之处

  • 项目早期,API 可能不稳定,功能覆盖有限
  • 社区和文档规模较小,遇到问题可参考的案例不多

适用场景

  • Elixir 后端服务中对 LLM 接口做回归测试
  • 对比不同提示词或模型版本的输出质量
  • 在 CI 中自动检测模型回答是否出现幻觉

替代项目

promptfoo、DeepEval

项目介绍

tribunal 是一个评测安全领域的开源项目,官方简介:LLM evaluation framework for Elixir: evaluate and test LLM outputs, detect hallucinations, measure response quality。项目使用 Elixir 开发,在 GitHub 上获得 113 星标。

上一篇:Eval

下一篇:LLMEvaluation

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24