evals

本站收录 42 个带「evals」标签的 AI 开源项目

mastraMastra 是一个基于 TypeScript 的现代 AI 应用开发框架,旨在帮助开发者快速构建和部署 AI 驱动的应用与智能体。它解决了 AI 开发中常见的★ 28,426phoenixPhoenix 是一个面向 AI 应用的可观测性与评估平台,由 Arize AI 开发。它解决了 LLM 应用在生产环境中难以调试、评估和优化的问题,为开发者提★ 11,654agentopsAgentOps 是一个面向 AI 智能体(Agent)的 Python 监控与可观测性 SDK,旨在解决 LLM 应用开发中调试困难、成本不可控、性能难以评估★ 5,847harborHarbor 是一个用于评估和改进智能体(agents)的框架,主要面向终端环境下的任务。它提供了一套标准化的评测流程和强化学习环境,帮助开发者量化智能体在真实★ 5,696failproofaifailproofai 是一个面向 AI 编码代理的运行时故障解决方案库,通过钩子(hooks)机制集成到 Claude Code、Codex、Cursor 等★ 5,234KilnKiln 是一个面向 AI 系统的全流程开发平台,旨在解决从数据准备到模型优化过程中工具链割裂、协作困难的问题。它提供数据集管理、人工标注与协作、评估(eval★ 5,130logfireLogfire 是一个面向生产环境 LLM 和智能体系统的 AI 可观测性平台,旨在解决 AI 应用调试难、追踪难、评估难的问题。它提供开箱即用的日志、指标、追★ 4,496trulensTruLens 是一个面向 LLM 实验和 AI Agent 的评估与追踪工具,旨在解决大模型应用开发中‘效果难衡量、问题难定位’的痛点。它提供了一套统一的反馈★ 3,579ai-system-design-guide这是一份面向工程师的AI系统设计指南,专注于帮助开发者构建生产级AI系统和评估体系。项目系统性地整理了从需求分析、架构设计到模型评估、部署运维的完整知识框架,涵★ 3,430lmnrLaminar 是一个专为 AI 智能体(Agent)设计的开源可观测性平台,来自 YC S24。它解决了 AI 应用在生产环境中调试困难、追踪复杂的问题,提供★ 3,287agent-skill-creatoragent-skill-creator 是一个用于构建、测试和治理 AI 智能体技能(skills)的开源工具。它解决的是智能体技能开发中缺乏标准化流程和生命周★ 2,401agent-skills-platformagent-skills-platform 是一个用于构建、测试和治理 AI 智能体技能(skills)的开源平台。它解决了智能体技能在开发后缺乏统一测试、分发★ 2,401inspectorinspector 是一个用于测试和评估 MCP(模型上下文协议)服务器、MCP 应用及 ChatGPT 应用的调试与验证平台。它主要解决开发者在构建基于 MC★ 2,230future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102waku-agentWaku agent 是一个本地优先的个人 AI 智能体框架,用 Python 编写,代码量少到可以在一个下午读完。它由四个核心模块组成:harness(运行环★ 1,878simbaSimba 是一个开源的、生产就绪的客服系统,基于 TypeScript 构建,内置了评估(Evals)和监控功能。它旨在解决客服场景中 AI 助手质量难以把控★ 1,543TracelyTracely 是一个面向 AI 智能体的原生 CI/CD 工具,旨在解决 LLM 应用在生产环境中失败后难以复现和回归测试的问题。它能自动检测生产环境中的 A★ 1,421Tracely-aiTracely-ai 是一个面向 AI 代理(agent)的 CI/CD 原生可观测与评测工具,旨在解决 AI 应用在生产环境中出现故障后难以复现和回归测试的问★ 1,421heymHeym 是一个用于构建和运行智能体系统的开源框架,旨在解决企业级 AI 自动化中可靠性、可观测性和人工控制缺失的问题。它提供智能体编排、业务流程自动化、执行过★ 1,314ragliteRAGLite 是一个面向检索增强生成(RAG)场景的 Python 工具包,核心特点是基于 DuckDB 或 PostgreSQL 作为向量存储与元数据存储,★ 1,208paperthinpaperthin 是一个聚焦于智能体底层设计模式的开源项目,旨在将传统工程智慧转化为智能体可自主调用的“反射”能力。它解决的是智能体开发中常见的“提示词堆砌”★ 1,117awesome-evals这是一个由 BenchFlow 维护的精选资源列表,专注于 AI 智能体的构建与评估。它汇集了论文、博客、演讲、工具和基准测试等高质量资源,旨在为开发者提供一份★ 936SkillForgeSkillForge 是一个面向 Claude Code 和 Codex 的技能创建与验证工具,核心解决 AI 技能(skill)开发中“无法证明技能是否有效”★ 902ai-engineer-notebooks这是一个面向AI工程师和前沿部署工程师(FDE)的实战型Jupyter Notebook合集,完全基于免费Groq API运行,无需框架依赖。项目覆盖了从模型A★ 662opensyncopensync 是一个面向 AI 编程工具 OpenCode 和 Claude Code 的云端同步仪表盘。它解决的核心问题是:开发者在使用这些 AI 编码助★ 410benchflowbenchflow 是一个面向强化学习(RL)研究的开源基础设施,旨在简化 RL 环境的创建、后训练(post-training)和评测(evals)流程。它解★ 351AutomationBenchAutomationBench 是一个用于评估 AI 智能体在真实业务流程中表现的基准测试框架。它由 Prime Intellect 开发,主要解决当前 AI ★ 314hud-pythonhud-python 是一个为 AI 智能体提供强化学习环境和评估工具的开源项目。它旨在解决智能体训练中环境定义和评估标准不统一的问题,允许开发者定义一次环境,★ 304evaleval 是 FrontierHarness 项目的评测结果与任务定义公开仓库,专注于大语言模型(LLM)在真实编码环境中的能力评估。它解决的核心问题是:传统基★ 282craft-skillscraft-skills 是一个为 AI 智能体提供研究驱动、评估驱动的技能库的开源项目。它旨在解决 AI 智能体在执行具体任务时缺乏可靠、可复用技能的问题,通★ 217promptpexpromptpex 是一个专注于提示词(Prompt)测试生成的开源项目,旨在为 LLM 应用开发者提供系统化的提示词评估与测试方案。它解决的核心问题是:提示词★ 165agentevalsagentevals 是一个与框架无关的 LLM 智能体评估解决方案,它基于 OpenTelemetry 追踪数据来工作。该项目解决的核心问题是:在复杂的智能体★ 162NiceEvalNiceEval 是一个面向 AI Agent 的轻量级评测框架,旨在帮助开发者快速构建和运行评估任务。它解决了 AI Agent 开发中缺乏标准化评测手段的问★ 156AgentEvalAgentEval 是一个面向 .NET 生态的 AI Agent 评测工具包,旨在为 .NET 开发者提供与 Python 生态中 RAGAS、PromptF★ 151adlc-team-skillsADLC Team Skills 是一个面向工程团队的 Agentic SDLC(软件开发生命周期)开源项目,基于 Shell 语言实现。它旨在将 AI 代理(★ 139openbenchopenbench 是一个从零构建的基准测试项目,用于横向对比不同编码智能体框架(如 codex、pi、opencode、cursor、devin)以及开放模型★ 136my-pimy-pi 是一个可组合的编程智能体(coding agent),基于 TypeScript 构建。它旨在解决开发者在日常编码中需要灵活、可扩展的 AI 辅助工★ 132suede-creator-skillssuede-creator-skills 是一个面向 Claude Code 和 Codex 的开源智能体技能库,提供 71 个预构建的 Agent Skill★ 126superpowers-evalssuperpowers-evals 是 superpowers 项目的行为评估实验室(Quorum),用于驱动真实编码智能体 CLI(如 Claude、Code★ 122inferock-benchinferock-bench 是一个面向本地 LLM 调用的成本追踪代理,支持 OpenAI、Anthropic、Gemini 以及固定的 OpenRouter★ 122evalsevals 是一个用于评估编码模型解决真实 React Native 任务能力的基准测试套件。它通过一系列实际开发场景,自动化测试 AI 编码助手或智能体在 R★ 110lumenLumen 是一个以学习者为中心的 AI 教育平台,旨在解决传统在线课程内容固定、缺乏个性化的问题。用户只需告诉 AI 想学什么,它能在约一分钟内生成一个专属的★ 88