monitoring
本站收录 58 个带「monitoring」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
Uptime KumaUptime Kuma 是开源自托管监控工具,监控网站、服务、端口与证书状态,支持 90 多种通知渠道。★ 91,957
grafanaGrafana 是一个开源的可观测性与数据可视化平台,旨在统一展示来自 Prometheus、Loki、Elasticsearch、InfluxDB、Postg★ 76,993
prometheusPrometheus 是一个开源的系统监控和告警工具包,最初由 SoundCloud 开发,现为 CNCF 的毕业项目。它解决了在动态云原生环境中收集、存储和查★ 66,307
langfuseLangfuse 是一个开源的 AI 工程平台,专注于 LLM 应用的可观测性、评估与提示词管理。它解决了 LLM 应用开发中调试困难、质量评估主观、提示词迭代★ 35,205
keepkeep 是一个开源的 AIOps 和告警管理平台,旨在解决运维团队在海量监控告警中的处理难题。它统一接入各类监控系统的告警,通过智能降噪、去重、聚合和路由,将★ 12,365
openllmetryopenllmetry 是一个面向 GenAI 和 LLM 应用的开源可观测性平台,基于 OpenTelemetry 标准构建。它解决了 LLM 应用在生产环境★ 7,460
hertzbeatHertzBeat 是一个 AI 驱动的下一代开源实时可观测性系统,专注于解决传统监控工具在易用性、告警准确性和智能化方面的不足。它无需 Agent,支持对网站★ 7,410
coze-loopcoze-loop 是一个面向 AI Agent 的全生命周期优化平台,旨在解决 Agent 开发中调试难、评估缺、监控弱的问题。它提供从开发、调试、评估到监控★ 5,752
holmesgptHolmesGPT 是一个面向 SRE(站点可靠性工程)场景的开源 AI 助手,已加入 CNCF Sandbox。它通过自然语言交互,帮助运维和开发人员快速诊断★ 3,480
lmnrLaminar 是一个专为 AI 智能体(Agent)设计的开源可观测性平台,来自 YC S24。它解决了 AI 应用在生产环境中调试困难、追踪复杂的问题,提供★ 3,287
pezzoPezzo 是一个开源、开发者优先的 LLMOps 平台,旨在简化大语言模型应用的整个生命周期管理。它解决了提示词设计、版本管理、即时交付、团队协作、故障排查和★ 3,276
kitekite 是一个轻量级、现代化的 Kubernetes 仪表盘,旨在将多集群与资源管理、企业级用户治理(OAuth、RBAC、审计日志)以及 AI 智能体统一到★ 3,150
uptrainUpTrain 是一个开源的统一平台,用于评估和改进生成式 AI 应用。它提供 20 多种预配置检查项,覆盖语言、代码、嵌入等场景,可为 LLM 输出打分,并对★ 2,365
nannymlnannyml 是一个用于机器学习模型部署后监控的 Python 库。它解决的是模型上线后性能下降、数据漂移等问题难以发现和定位的痛点。核心能力包括:检测特征和★ 2,156
testkubeTestkube 是一个开源的 Kubernetes 原生测试平台,专为 AI 驱动的工程团队设计。它解决了在云原生和 AI 应用开发中,测试工具碎片化、难以集★ 1,662
nvidia_gpu_exporternvidia_gpu_exporter 是一个用 Go 编写的 Prometheus 导出器,通过调用 nvidia-smi 二进制文件采集 NVIDIA GP★ 1,561
TracelyTracely 是一个面向 AI 智能体的原生 CI/CD 工具,旨在解决 LLM 应用在生产环境中失败后难以复现和回归测试的问题。它能自动检测生产环境中的 A★ 1,421
Tracely-aiTracely-ai 是一个面向 AI 代理(agent)的 CI/CD 原生可观测与评测工具,旨在解决 AI 应用在生产环境中出现故障后难以复现和回归测试的问★ 1,421
ongridongrid 是一个面向运维场景的 AI 智能体,它直接集成在 Slack、Telegram、飞书或钉钉等聊天工具中,帮助团队快速定位并解决基础设施问题。它能够★ 1,104
tempstemps 是一个 AI 原生的开源开发者平台,旨在替代 Vercel、Sentry、PostHog、Pingdom、Resend 和 E2B 等多个独立工具,★ 809
pandaprobePandaprobe 是一个开源的 AI Agent 工程平台,专注于解决 Agent 开发中「黑盒难调试、效果难量化」的问题。它提供 traces(调用链路追★ 785
neptune-clientneptune-client 是 Neptune.ai 的官方 Python 客户端库,用于跟踪和记录基础模型训练过程中的实验数据。它解决了机器学习团队在训练大★ 623
popmonpopmon 是一个用于监控 Pandas 或 Spark 数据框稳定性的开源库。它通过自动计算数据分布、统计指标和相关性等特征,并基于历史数据或预期值进行对比★ 511
openclaw-dashboardopenclaw-dashboard 是一个面向 OpenClaw AI 智能体的可视化指挥中心,用 Go 编写,主打零依赖和开箱即用。它解决的是多智能体运行时★ 456
clawmetryclawmetry 是一个面向 AI 智能体的实时可观测性平台,支持 OpenClaw、NVIDIA NemoClaw、Claude Code、Codex 等 ★ 423
ccLoadccLoad 是一个用 Go 编写的 AI API 网关,主要解决多模型 API 渠道管理中的手动切换问题。它提供智能路由、自动故障转移、指数冷却、多 URL ★ 418
openllmetry-jsOpenLLMetry-js 是 OpenLLMetry 的 TypeScript 姊妹项目,基于 OpenTelemetry 为 LLM 应用提供开源可观测性★ 412
agent-prismagent-prism 是一套基于 React 的组件库,专门用来可视化 AI Agent 的执行轨迹(trace)。随着 LLM 应用从单次问答走向多步骤、多★ 393
tautau 是一个用 TypeScript 编写的自适应 AI 智能体项目,定位为“为你工作服务的 AI 代理”。它面向开发者与日常办公场景,试图把大模型能力封装成★ 353
datastoriadatastoria 是一个 AI 原生的 ClickHouse 控制台,专为集群诊断、查询生成、优化和数据可视化而设计。它通过智能体技能(agent-skil★ 327
chmonitorchmonitor 是一个面向 ClickHouse 的开源运维顾问,提供实时监控与 AI 驱动的索引、分区、物化视图优化建议。它通过 Cloudflare W★ 297
skillsskills 是 Qdrant 官方推出的智能体技能包,旨在为 AI 编程助手(如 Claude Code、Codex、Cursor)提供关于 Qdrant 向★ 253
mcp-victoriametricsmcp-victoriametrics 是一个用 Go 语言实现的 Model Context Protocol (MCP) 服务器,专门为 VictoriaM★ 235
OpenTradeOpenTrade 是一个面向 Claude Code 和 Codex 等 AI 编程代理的开源交易控制框架。它解决的核心问题是:当 AI 代理被赋予投资或交易★ 220
zabbix-mcp-server这是一个将Zabbix监控系统接入AI助手(如ChatGPT、Claude等)的MCP服务器,基于Python实现。它封装了Zabbix完整的API,提供237★ 210
homelab-monitorhomelab-monitor 是一个即插即用的家庭实验室(homelab)仪表盘,以单个容器形式部署,集中展示 GPU 使用率、本地 AI 显存占用、Dock★ 207
phantasmphantasm 是一套用于构建“人在回路”审批层的工具包,旨在实时监控和引导 AI 代理的工作流程。它解决了 AI 代理在自动化执行任务时缺乏人工监督和干预的★ 196
C-SSHC-SSH 是一个用 Rust 编写的原生跨平台 SSH 运维工具,旨在解决传统 SSH 客户端在会话持久化、监控和智能化方面的不足。它集成了 tmux 持久化★ 184
mcp-sharkmcp-shark 是一个面向 Model Context Protocol(MCP)通信的取证分析工具,类似于 Wireshark 对网络流量的抓包分析。它主★ 179
dcs-coredcs-core 是一个开源的 Python 数据质量监控框架,旨在帮助数据团队持续跟踪和验证数据的准确性、完整性和一致性。它解决了数据管道中因数据异常(如缺失★ 179
whiteboxWhitebox 是一个开源的端到端机器学习监控平台,特别强调边缘计算能力,并能与 Kubernetes 良好集成。它旨在解决 ML 模型从训练到部署后的全生命★ 179
oss-llmops-stackoss-llmops-stack 是一个模块化的开源 LLMOps 技术栈,旨在将 LLM 应用开发中的不同关注点分离,解决工具碎片化和集成复杂的问题。它整合了★ 153
ruby_llm-agentsruby_llm-agents 是一个面向 Ruby on Rails 的 AI Agent 开发框架,基于 RubyLLM 构建,帮助 Ruby 开发者在熟悉★ 139
athina-sdkathina-sdk 是一个用于 LLM 应用生产环境监控与测试的 Python SDK。它主要解决大语言模型应用在真实使用中出现的性能退化、输出质量不稳定、成★ 131
agentwatchagentwatch 是一个面向 AI 智能体的可观测性框架,旨在帮助开发者深入洞察智能体与各平台之间的交互过程。它解决了 AI 应用调试和优化中“黑盒”问题,★ 125
rocketplaneIOrocketplaneIO 是一个面向 Kubernetes 的自托管 AI 站点可靠性工程师(SRE)工具,它利用 eBPF 技术实现零插桩的可观测性,无需修★ 123
hermes-webuiHermes WebUI 是 Hermes Agent 的配套监控与配置仪表盘,基于 FastAPI 和 React 构建。它解决了 Hermes Agent ★ 114
monitoring-mlmonitoring-ml 是一个面向机器学习系统监控的教育型开源项目,主要解决模型上线后因数据漂移导致的性能衰减问题。它通过 Jupyter Notebook★ 104
log10log10 是一个 Python 客户端库,旨在提升 LLM 应用的准确性。它通过提供数据记录、调试、评估和反馈收集等功能,帮助开发者系统性地改进基于大语言模型★ 97