metrics

本站收录 24 个带「metrics」标签的 AI 开源项目

grafanaGrafana 是一个开源的可观测性与数据可视化平台,旨在统一展示来自 Prometheus、Loki、Elasticsearch、InfluxDB、Postg★ 76,993prometheusPrometheus 是一个开源的系统监控和告警工具包,最初由 SoundCloud 开发,现为 CNCF 的毕业项目。它解决了在动态云原生环境中收集、存储和查★ 66,307supervisionsupervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者在目标检测、分割、分类等任务中重复编写样板代码的问题,提★ 51,079openllmetryopenllmetry 是一个面向 GenAI 和 LLM 应用的开源可观测性平台,基于 OpenTelemetry 标准构建。它解决了 LLM 应用在生产环境★ 7,460hertzbeatHertzBeat 是一个 AI 驱动的下一代开源实时可观测性系统,专注于解决传统监控工具在易用性、告警准确性和智能化方面的不足。它无需 Agent,支持对网站★ 7,410Object-Detection-MetricsObject-Detection-Metrics 是一个用于评估目标检测算法性能的 Python 工具库,主要实现了 PASCAL VOC 竞赛中定义的平均精度★ 5,103logfireLogfire 是一个面向生产环境 LLM 和智能体系统的 AI 可观测性平台,旨在解决 AI 应用调试难、追踪难、评估难的问题。它提供开箱即用的日志、指标、追★ 4,496serveServe 是一个用于在生产环境中部署、优化和扩展 PyTorch 模型的开源基础设施项目。它解决了将训练好的 PyTorch 模型高效、稳定地服务化的问题,提★ 4,344long-form-factuality这是一个用于评估大语言模型长文本事实性(long-form factuality)的基准测试工具,来自论文《Long-form factuality in la★ 693common_metrics_on_video_quality这是一个用于评估视频生成或预测质量的Python工具库,专注于计算FVD、PSNR、SSIM、LPIPS等核心指标。它解决了视频生成领域缺乏统一、易用的评估工具★ 587Awesome-Radiology-Report-GenerationAwesome-Radiology-Report-Generation 是一个面向放射学报告生成(Radiology Report Generation)方向的★ 486open-rag-evalopen-rag-eval 是一个用于评估检索增强生成(RAG)系统的开源工具,核心特点是无需人工标注的“黄金答案”即可进行评测。它通过自动生成合成查询和评估指★ 412openllmetry-jsOpenLLMetry-js 是 OpenLLMetry 的 TypeScript 姊妹项目,基于 OpenTelemetry 为 LLM 应用提供开源可观测性★ 412PySODEvalToolkitPySODEvalToolkit 是一个基于 Python 的显著性目标检测(SOD)与伪装目标检测(COD)评测工具箱。该领域论文中常用 MAE、F-meas★ 354SDMetricsSDMetrics 是一个用于评估合成数据质量的 Python 库,由 SDV 团队开发。它提供了一套全面的指标,从统计相似性、数据隐私、数据完整性和机器学习效★ 263AgentMeasureAgentMeasure 是一个面向智能体(Agent)软件的开放测量基础设施,旨在解决当前 AI Agent 应用中“测量混乱”的问题。它将操作与尝试、证据与★ 218dcs-coredcs-core 是一个开源的 Python 数据质量监控框架,旨在帮助数据团队持续跟踪和验证数据的准确性、完整性和一致性。它解决了数据管道中因数据异常(如缺失★ 179tma1TMA1 是一个面向 AI 代理的本地优先可观测性工具,用 Go 编写。它记录每一个 LLM 调用,并通过钩子(hooks)和 MCP 将观察到的信息注入到代理★ 119fasttrackmlfasttrackml 是一个专注于速度和可扩展性的实验跟踪服务器,用 Go 语言编写。它解决机器学习团队在大量实验场景下,传统跟踪工具(如 MLflow)性能★ 119text2image-benchmarktext2image-benchmark 是一个用于生成式图像模型的基准测试工具,专注于文本到图像生成任务。它解决了生成模型评估标准不统一、指标计算复杂的问题,★ 110dialog-evaldialog-eval 是一个用于评估对话模型的 Python 库,提供 17 种自动化评估指标,覆盖流畅性、相关性、信息量、多样性等维度。它旨在解决对话系统开★ 97parea-sdk-pyParea AI 是一个面向 LLM 应用的开发工具链,提供 Python SDK 来支持实验、测试、评估和监控。它解决的是 LLM 应用开发中缺乏系统化测试与★ 82google-cloud-mcpgoogle-cloud-mcp 是一个基于 Model Context Protocol (MCP) 的服务器实现,专门为 Google Cloud Plat★ 80MirrorMetricsMirrorMetrics 是一个针对 Stable Diffusion LoRA 训练的可视化诊断工具,利用 InsightFace 人脸识别技术来评估 Lo★ 62