sre
本站收录 20 个带「sre」标签的 AI 开源项目
holmesgptHolmesGPT 是一个面向 SRE(站点可靠性工程)场景的开源 AI 助手,已加入 CNCF Sandbox。它通过自然语言交互,帮助运维和开发人员快速诊断★ 3,480
ai-infra-engineer-learning面向生产级 ML 基础设施的系统学习路线,专为有 2~4 年经验的工程师设计。课程涵盖模型训练、推理服务、算力调度、可观测性等基础设施核心主题,帮助工程师补齐从★ 1,746
ongridongrid 是一个面向运维场景的 AI 智能体,它直接集成在 Slack、Telegram、飞书或钉钉等聊天工具中,帮助团队快速定位并解决基础设施问题。它能够★ 1,104
OpenDeriskOpenDerisk 是一个 AI 原生的风险智能系统,旨在为应用程序提供 7*24 小时的全面深度防护。它解决的是传统安全工具依赖规则、响应滞后、难以应对复杂★ 971
versus-incidentVersus Incident 是一个自托管的 AI SRE(站点可靠性工程)智能体,用 Go 语言编写。它通过持续学习系统的正常行为模式,自动识别并仅上报真正★ 782
auroraAurora 是一个开源的 AI 驱动的事件管理与根因分析平台,专为 SRE(站点可靠性工程师)设计。它利用 LangGraph 构建智能体,能够自动调查 AW★ 428
nudgebeeNudgebee 是一个统一的云运维平台,旨在解决多云环境下工具碎片化、上下文切换频繁以及模型锁定等问题。它将 AI 驱动的 SRE(站点可靠性工程)、FinO★ 397
auraAURA 是一个面向生产环境的 SRE(站点可靠性工程)智能体平台,用 Rust 编写,可在几分钟内部署。它解决了将 AI 安全应用于生产基础设施时面临的护栏、★ 392
clankerclanker 是一个面向多云环境的自主系统运维 CLI 智能体,用 Go 编写,支持 AWS、GCP、Cloudflare 等主流云平台。它旨在将 AI 代理★ 377
ai-infra-junior-engineer-learning这是一个面向初级AI基础设施工程师(0-2年经验)的完整学习路线图项目。它解决了入门者面对AI基础设施领域知识庞杂、不知从何学起的问题,提供了一套结构化的课程体★ 241
siclawsiclaw 是一个由 AI 驱动的 SRE(站点可靠性工程)平台,专注于只读的基础设施诊断。它通过深度调查、安全治理和团队协作能力,帮助运维和开发团队快速定位★ 236
opsyOpsy 是一个用 Go 编写的 AI 驱动的 SRE 同事,运行在终端里,帮助运维和开发人员通过自然语言与 Kubernetes 集群交互。它解决了传统 ku★ 206
rocketplaneIOrocketplaneIO 是一个面向 Kubernetes 的自托管 AI 站点可靠性工程师(SRE)工具,它利用 eBPF 技术实现零插桩的可观测性,无需修★ 123
skyfloskyflo 是一个自托管的 AI 智能体,专为 Kubernetes 和 DevOps 场景设计。它解决的是在云原生环境中引入 AI 自动化时常见的失控风险问★ 120
awesome-ai-sreawesome-ai-sre 是一个精选资源列表,收录了 100 多个用于站点可靠性工程(SRE)的 AI 驱动工具、平台和资源。它系统性地整理了 AI 在 S★ 106
awesome-agentic-devops这是一个精选并评分的 DevOps 智能体资源列表,聚焦于官方 MCP 服务器和智能体,覆盖 DevOps、云、SRE 和平台工程领域。项目为每个条目提供生产访★ 79
ai-infra-performance-learning这是一个面向AI基础设施性能工程师的学习路线图,聚焦GPU优化、推理优化和成本降低三大主题。项目以Python为主要技术栈,通过整理和串联相关的学习资源、实践案★ 74
awesome-ai-sreawesome-ai-sre 是一个精选列表,汇总了用于站点可靠性工程(SRE)的 AI 工具,涵盖根本原因分析(RCA)、事件响应、成本优化、基础设施管理和 ★ 72
hermes-incident-commanderHermes Incident Commander 是一个基于 Hermes 框架构建的自主 SRE 智能体,用于自动化处理生产环境故障。它能够主动检测异常、执★ 70
qualityfolioqualityfolio 是一个面向 QA 工程师、SRE 和 DevOps 团队的 AI 原生测试管理平台。它解决的核心问题是:在监管严格的行业中,测试资产分★ 62