uptrain

给 LLM 应用打分找茬,快速定位并修复质量问题。

UpTrain 是一个开源的统一平台,用于评估和改进生成式 AI 应用。它提供 20 多种预配置检查项,覆盖语言、代码、嵌入等场景,可为 LLM 输出打分,并对失败案例进行根因分析,给出改进建议。该工具旨在解决 LLM 应用质量评估难、调试难的问题,帮助开发者系统性地测试和优化提示词、模型和检索流程。其核心能力包括自动化检查、根因分析和可操作的洞察,能有效提升应用的可靠性、安全性和性能。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2365
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队uptrain-ai
所属国家
官网地址https://uptrain.ai
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型autoevaluation,evaluation,experimentation,hallucination-detection,jailbreak-detection,llm-eval,llm-prompting,llm-test,llmops,machine-learning,monitoring,openai-evals,prompt-engineering,root-cause-analysis
GitHub 星标★ 2365
30天Star增速
HF 下载量
上线时间2022-11-07 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(用于 pip 安装 uptrain 包)
  • OpenAI API Key(开源版本评估需要)
  • 能访问互联网以调用 OpenAI 接口

安装与启动步骤

  1. 1安装 uptrain 包

    使用 pip 从 PyPI 安装 uptrain,建议在虚拟环境中执行以避免依赖冲突。

    pip install uptrain
  2. 2配置 OpenAI 密钥

    在代码中填入你的 OpenAI API Key,开源版本通过它来执行各项评估检查。

    OPENAI_API_KEY = "sk-***************"
  3. 3编写评估数据

    准备待评估样本列表,每条包含 question、context、response 三个字段。

    data = [{'question': 'Which is the most popular global sport?', 'context': '...', 'response': 'Football is the most popular sport with around 4 billion followers worldwide'}]
  4. 4初始化 EvalLLM

    导入 EvalLLM 与 Evals,并用 API Key 实例化评估对象。

    from uptrain import EvalLLM, Evals
    eval_llm = EvalLLM(openai_api_key=OPENAI_API_KEY)
  5. 5执行评估检查

    调用 evaluate 方法,传入数据与所需检查项,例如上下文相关性、事实准确性、回答完整性。

    results = eval_llm.evaluate(
        data=data,
        checks=[Evals.CONTEXT_RELEVANCE, Evals.FACTUAL_ACCURACY, Evals.RESPONSE_COMPLETENESS]
    )
    print(json.dumps(results, indent=3))
  6. 6运行 Dashboard

    README 提供 run_uptrain.sh 脚本启动 UpTrain Dashboard,当前为 Beta 版本。

    bash run_uptrain.sh

关键配置

配置项必填说明示例
openai_api_key是OpenAI 密钥,开源版本评估所必需sk-xxxxxxxx

如何确认成功

运行评估脚本后能打印出各检查项的评分结果 JSON,即表示调用成功。

常见问题

Q:不填 OpenAI API Key 能用吗?

A:README 说明开源版本需提供 OpenAI API Key 才能运行评估,未提供则无法执行检查。

Q:Dashboard 是稳定版吗?

A:README 明确标注 UpTrain Dashboard 当前为 Beta 版本,欢迎反馈以改进。

Q:可以使用哪些评估项?

A:示例中使用了 CONTEXT_RELEVANCE、FACTUAL_ACCURACY、RESPONSE_COMPLETENESS,官方称提供 20+ 预配置评估项。

注意事项

  • README 未给出系统依赖或 Python 版本要求,建议使用较新的 Python 3 环境。
  • 评估会调用 OpenAI 接口,注意密钥安全与调用费用。
  • Dashboard 处于 Beta,功能可能变动。

核心亮点

  • 内置 20+ 预配置检查,覆盖多种 LLM 场景,开箱即用
  • 提供根因分析,能定位到具体失败原因,而非简单报错
  • 支持自定义检查,灵活适配不同业务需求

不足之处

  • 文档/社区待观察
  • 项目仍在成长中,功能稳定性可能需进一步验证

适用场景

  • LLM 应用上线前质量评估
  • RAG 系统检索与生成效果优化
  • 提示词迭代和回归测试

替代项目

LangSmith、PromptLayer、W&B Weave

项目介绍

uptrain 是评测安全领域的开源项目,由 uptrain-ai 开发,2022 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,365)位列前 30%,在评测安全分类的 458 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:LLM应用上线前质量评估。同类可对比的替代方案包括 LangSmith、PromptLayer、W&B Weave。

上一篇:empirical

下一篇:benchmarks

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24