leva

用线上真实数据回放评测,让 Rails 的 LLM 改动不再靠拍脑袋

leva 是一个面向 Ruby on Rails 应用的 LLM 评测框架,主打用生产数据做评测。它解决的核心问题是:Rails 项目接入大模型后,很难系统化地衡量提示词、模型或参数变更带来的效果变化。leva 让开发者把线上真实请求与响应沉淀为评测数据集,在本地或 CI 中回放这些样本,对比不同版本的表现,从而在发布前发现质量回退。核心能力包括:与 Rails 应用自然集成、基于生产数据构建评测集、对 LLM 输出做批量对比与打分、支持在开发流程中持续回归。相比通用评测工具,它更贴近 Rails 技术栈,减少胶水代码,适合已有线上流量、希望用真实场景而非合成数据来验证 LLM 功能的小型团队。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 147
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类评测安全
开发团队kieranklaassen
所属国家
官网地址
定价模式free
价格说明开源免费,无在线服务
访问状态
是否开源是
开源协议MIT
主要语言Ruby
技术栈/模型llm,llm-evaluation,ruby-on-rails
GitHub 星标★ 147
30天Star增速
HF 下载量
上线时间2024-08-13 00:00:00
最近更新2026-09-21 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-25
浏览次数0

使用教程

核心亮点

  • 专为 Rails 设计,能直接复用应用内的模型、服务和业务逻辑做评测,集成成本低
  • 以生产数据为核心,评测样本来自真实用户请求,比人工构造的测试集更贴近实际分布
  • 支持在开发或 CI 流程中回放对比,便于在提示词或模型变更时快速发现效果回退

不足之处

  • 项目处于早期,星标约 147,生态与文档成熟度有限
  • 仅面向 Ruby on Rails,非 Rails 技术栈无法直接使用

适用场景

  • 上线前用线上真实对话样本回归测试新提示词,避免效果变差
  • 在 CI 中对不同模型或参数配置做批量对比,量化选择更优方案
  • 把用户反馈差的生产请求沉淀为评测集,持续跟踪修复效果

替代项目

promptfoo、DeepEval

项目介绍

leva 是评测安全领域的开源项目,由 kieranklaassen 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 147。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-21。开源免费,无在线服务。

它主要面向的使用场景是:上线前用线上真实对话样本回归测试新提示词,避免效果变差。同类可对比的替代方案包括 promptfoo、DeepEval。

上一篇:compute-eval

下一篇:awesome-ai-testing

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12