agent-evaluation
本站收录 16 个带「agent-evaluation」标签的 AI 开源项目
iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623
giskard-ossGiskard 是一个面向 LLM 智能体和应用的自动化评估与测试开源库。它解决了大模型应用上线前缺乏系统性质量保障的问题,提供从单元测试到红队攻击的全链路测试★ 5,846
coze-loopcoze-loop 是一个面向 AI Agent 的全生命周期优化平台,旨在解决 Agent 开发中调试难、评估缺、监控弱的问题。它提供从开发、调试、评估到监控★ 5,752
trulensTruLens 是一个面向 LLM 实验和 AI Agent 的评估与追踪工具,旨在解决大模型应用开发中‘效果难衡量、问题难定位’的痛点。它提供了一套统一的反馈★ 3,579
future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102
any-agentany-agent 是一个 Python 开发框架,目标是给不同 AI Agent 框架提供统一的使用与评估接口。当前 Agent 生态碎片化严重,LangCh★ 1,241
intelligent-audit-systemAuditPilot 是一个面向企业的可审计 AI 智能体系统,旨在解决 AI 在关键业务流程中缺乏透明度、可控性和合规性的问题。它提供了一套完整的框架,让企业★ 1,171
awesome-evals这是一个由 BenchFlow 维护的精选资源列表,专注于 AI 智能体的构建与评估。它汇集了论文、博客、演讲、工具和基准测试等高质量资源,旨在为开发者提供一份★ 936
ClawBenchClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表现。它解决了当前浏览器智能体缺乏统一、贴近真实场景★ 904
pandaprobePandaprobe 是一个开源的 AI Agent 工程平台,专注于解决 Agent 开发中「黑盒难调试、效果难量化」的问题。它提供 traces(调用链路追★ 785
AgentMeasureAgentMeasure 是一个面向智能体(Agent)软件的开放测量基础设施,旨在解决当前 AI Agent 应用中“测量混乱”的问题。它将操作与尝试、证据与★ 218
ai-agents-tutorial这是一个从零开始学习AI Agent的教程项目,旨在帮助开发者系统掌握智能体开发的完整知识体系。内容覆盖从基础的工具调用(function calling)到复★ 185
DM-Code-AgentDM-Code-Agent 是一个本地优先、可审计的 Python 代码智能体项目。它旨在解决 AI 编程助手在真实软件开发中表现不稳定、结果难以复现的问题。项★ 153
every_eval_everEvery Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是:当前 AI 评测结果散落在各类排行榜、学术论文★ 132
FlownessFlowness 是一个以工作为中心(work-centered)的智能体软件工程运行时。它解决的核心问题是:在复杂的智能体工作流中,工作本身(如任务、数据、状★ 105
ai-eval-platform这是一个开源的 AI 应用评测平台,专注于解决 RAG、AI Agent、多轮对话等复杂场景的评估难题。它提供 LLM-as-Judge、接口评测、评测报告和人★ 11