langwatch

一站式搞定LLM评估与智能体测试,从开发到上线全程可控

LangWatch是一个面向LLM评估与AI智能体测试的开源平台,旨在解决大模型应用开发中评估难、调试烦、监控弱的问题。它提供从数据采集、数据集管理、评估实验到线上监控的全流程工具链,支持与OpenAI、DSPy等主流框架集成。核心能力包括:可视化评估工作流,可自定义评分规则与自动化测试;智能体行为追踪,逐步记录推理过程与工具调用;低代码界面降低使用门槛,同时提供Python SDK与API便于深度定制;内置分析与报表功能,帮助团队量化模型表现、定位失败案例。平台强调可观测性,将开发阶段的评估与生产环境的监控打通,形成闭环,适合需要系统化保障LLM应用质量的团队。

开源 freemium 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 4865
维护状态 活跃
是否开源 是
定价模式 freemium

项目数据

分类基础设施
开发团队langwatch
所属国家
定价模式freemium
价格说明提供免费社区版,含基础评估功能;付费版按席位或用量收费,提供高级功能与支持。
访问状态
是否开源是
开源协议Apache-2.0
主要语言TypeScript
技术栈/模型agent-testing,ai,analytics,datasets,dspy,evaluation,gpt,llm,llm-ops,llmops,low-code,observability,observability-platform,openai,prompt-engineering,simulation-testing
GitHub 星标★ 4865
30天Star增速
HF 下载量
上线时间2023-09-09 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 5 步

环境要求

  • Node.js(使用 npx 一键启动时唯一必需的环境)
  • Docker 与 Docker Compose(选择容器方式部署时需要)
  • 磁盘空间:默认开启 Langy 助手会额外占用约 45MB
  • 如需 PII 检测评估器需额外约 670MB 语言模型空间
  • 启动后所有文件位于 ~/.langwatch/ 目录下

安装与启动步骤

  1. 1一键本地启动

    最快方式,只需 Node.js。CLI 会自动把 uv、postgres、redis、clickhouse、AI 网关等装入 ~/.langwatch/,生成带随机密钥的 .env 并并行启动全部服务。

    npx @langwatch/server
  2. 2调整可选组件

    启动后编辑 ~/.langwatch/.env,按需开关 Langy 助手、PII 检测评估器、语言检测评估器;改完必须重启服务才生效。

  3. 3Docker Compose 部署

    不想用 CLI 时可用容器方式,克隆仓库后复制示例环境文件,再构建并后台启动,首次构建需要一定时间。

    git clone https://github.com/langwatch/langwatch.git
    cd platform/app
    cp platform/app/.env.example platform/app/.env
    docker compose up -d --wait --build
  4. 4进入控制台建项目

    服务就绪后浏览器访问本地地址,创建第一个项目和 API Key,即可接入评估与追踪。

  5. 5本地开发模式

    如需参与开发,先用 Docker 只启动数据库并保持运行,另开终端安装依赖并启动 LangWatch。

    docker compose up redis postgres opensearch
    make install
    make start

关键配置

配置项必填说明示例
LANGWATCH_ENABLE_LANGY否是否启用 Langy 助手,运行时约 45MB,worker 以当前用户身份在本机非沙箱运行true
LANGWATCH_ENABLE_PRESIDIO否是否启用 PII 检测评估器,会额外下载约 670MB 语言模型false
LANGWATCH_ENABLE_LINGUA否是否启用语言检测评估器,会额外下载约 95MB 语言模型false

如何确认成功

浏览器打开 http://localhost:5560,能正常加载控制台并成功创建第一个项目与 API Key 即启动成功。

常见问题

Q:想彻底重置本地环境怎么做?

A:直接删除 ~/.langwatch 目录即可,README 说明这是干净重置方式,所有服务数据与配置都存放在该目录。

Q:LangWatch 本地端口是多少?

A:默认为 http://localhost:5560,CLI 启动后会自动打开该地址,Docker Compose 方式启动后同样访问该端口。

Q:不装 PII 检测会漏掉敏感信息脱敏吗?

A:不会。README 明确说明 LangWatch 自身对 trace 的密钥与 PII 脱敏不依赖 Presidio,该评估器只是额外的 PII 检测能力。

Q:修改了 .env 为什么没有变化?

A:.env 中的三个开关需要重启服务后才会生效,重启后才会按新配置加载或跳过对应运行时。

Q:可以部署到服务器或云上吗?

A:可以。官方支持 Docker Compose、Kubernetes(Helm)以及 AWS、Google Cloud、Azure 的 OnPrem 方案,详见自托管文档。

注意事项

  • CLI 安装的服务、依赖与密钥全部位于 ~/.langwatch/ 下,rm -rf ~/.langwatch 即为干净重置。
  • Langy 助手的 worker 以当前用户身份在本机非沙箱运行,请自行评估安全边界。
  • 除三个可选开关外,其余评估器无论是否开启可选组件都会被安装。
  • Docker 方式克隆后需先 cp .env.example 为 .env,否则缺少必要配置。

核心亮点

  • 可视化评估工作流,无需从零搭建,低代码上手快
  • 深度集成DSPy与OpenAI,自动捕获实验数据,减少手动整理成本
  • 智能体逐步追踪,能定位到具体工具调用和推理节点,调试更精准

不足之处

  • 项目较年轻,生态和文档成熟度待观察
  • 高级功能可能依赖商业版,开源版功能边界需确认

适用场景

  • 团队开发LLM应用,需要系统化评估模型输出质量
  • 调试复杂AI智能体,追踪多步推理与工具调用过程
  • 上线后监控模型表现,快速发现回归与异常

替代项目

Langfuse、Helicone、Phoenix (Arize)

项目介绍

langwatch 是评测安全领域的开源项目,由 langwatch 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(4,865)位列前 9%,在评测安全分类的 458 个项目里位列前 6%。

近 45 天,它的 GitHub 星标从 3,480 增加到 4,865,净增 1,385。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。提供免费社区版,含基础评估功能;付费版按席位或用量收费,提供高级功能与支持。从国内网络环境看,可直接访问。

它主要面向的使用场景是:团队开发LLM应用,需要系统化评估模型输出质量。同类可对比的替代方案包括 Langfuse、Helicone、Phoenix (Arize)。

上一篇:trulens

下一篇:WindowsAgentArena

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12