
tribunal
在 Elixir 里像写测试一样评测 LLM 输出
tribunal 是一个面向 Elixir 生态的 LLM 评测框架,解决在 Elixir 应用中缺乏统一方式评估和测试大模型输出的问题。它把评测能力直接嵌入 Elixir 项目,让开发者可以像写单元测试一样对 LLM 输出做断言和打分。核心能力包括:对模型回答进行质量度量、检测幻觉内容、对比不同提示词或模型版本的输出差异,并支持把评测结果纳入现有测试流程。对于使用 Phoenix 或 Nx 等技术栈的团队,tribunal 提供了无需切换到 Python 工具链的评测路径,降低了跨语言维护成本。项目目前处于早期阶段,API 和功能仍在演进,适合愿意跟进新工具、且主力语言为 Elixir 的团队尝鲜使用。
项目数据
使用教程
核心亮点
- 原生 Elixir 实现,可直接融入 ExUnit 测试流程,无需引入 Python 评测栈
- 内置幻觉检测与回答质量度量,覆盖评测常见需求
- 对 Phoenix/Nx 等 Elixir 生态项目集成成本低
不足之处
- 项目早期,API 可能不稳定,功能覆盖有限
- 社区和文档规模较小,遇到问题可参考的案例不多
适用场景
- Elixir 后端服务中对 LLM 接口做回归测试
- 对比不同提示词或模型版本的输出质量
- 在 CI 中自动检测模型回答是否出现幻觉
替代项目
promptfoo、DeepEval
项目介绍
上一篇:Eval
下一篇:LLMEvaluation
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents