
Tracely-ai
把生产事故变成回归测试,合并前自动拦截 AI 故障
Tracely-ai 是一个面向 AI 代理(agent)的 CI/CD 原生可观测与评测工具,旨在解决 AI 应用在生产环境中出现故障后难以复现和回归测试的问题。它自动检测生产环境中的 agent 失败案例,进行聚类分析,并将这些失败冻结为封闭的回归测试用例,然后在 CI 流程中零成本重放,从而在代码合并前阻断问题。核心能力包括:自动故障检测与聚类、将生产事故转化为可复现的测试用例、与 CI/CD 流水线深度集成、基于 LLM-as-judge 的评测机制、以及使用 ClickHouse 存储可观测数据。项目采用 Python 编写,技术栈覆盖 agent 可观测性、LLM 评估和持续集成,旨在降低 AI 应用迭代中的回归风险,提升生产稳定性。
项目数据
核心亮点
- 自动将生产失败案例聚类并转化为封闭测试,无需手动构造用例
- 与 CI/CD 深度集成,在 PR 阶段即可阻断回归,成本为零
- 基于 ClickHouse 存储,支持大规模 agent 行为追踪和回放
不足之处
- 文档/社区待观察
- 依赖特定 CI/CD 环境,集成配置可能有一定学习成本
适用场景
- AI agent 应用上线后,快速定位并复现生产环境偶发故障
- 在 CI 流程中自动添加回归测试,防止旧问题随代码更新复发
- 团队需要统一管理 agent 行为日志和评测结果的场景
替代项目
LangSmith、Arize Phoenix、Helicone
项目介绍
上一篇:NiceEval
下一篇:没有了!
同类项目推荐
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
parea-sdk-py
开源
一站式搞定 LLM 应用的测试、评估与监控
Python SDK for experimenting, testing, evaluating & monitoring LLM-powered applicati···
trulens
开源
给LLM应用装上仪表盘,量化评估效果,快速定位问题。
Evaluation and Tracking for LLM Experiments and AI Agents