ai-eval-platform

一站式评测 AI 应用,让质量看得见

这是一个开源的 AI 应用评测平台,专注于解决 RAG、AI Agent、多轮对话等复杂场景的评估难题。它提供 LLM-as-Judge、接口评测、评测报告和人工盲测等核心能力,帮助开发者在开发过程中客观衡量模型与应用质量。平台支持多种评测方式,既能自动化评估,也支持人工介入,覆盖从技术指标到用户体验的多个维度。其设计目标是让 AI 应用的质量评估更系统、更可信,适合需要精细评估 AI 产品的团队使用。

开源 free 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类智能体
开发团队huangyiminghappy
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent-evaluation,ai-agent,ai-evaluation,ai-infra,blind-test,human-evaluation,llm-as-judge,llm-evaluation,multi-turn-conversation,openai-compatible,rag,rag-evaluation
GitHub 星标★ 11
30天Star增速
HF 下载量
上线时间2026-06-17 00:00:00
最近更新2026-09-03 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

核心亮点

  • 支持 RAG、Agent、多轮对话等复杂场景,覆盖全面
  • 集成 LLM-as-Judge 和人工盲测,兼顾自动化与主观体验
  • 提供评测报告,便于追踪和对比模型迭代效果

不足之处

  • 项目处于早期阶段,文档和社区生态待观察
  • 功能丰富但可能上手门槛较高,需一定配置成本

适用场景

  • RAG 系统检索质量与回答准确性评估
  • AI Agent 任务完成率与多轮交互体验测试
  • 模型版本迭代前后的效果对比与回归测试

替代项目

Promptfoo、DeepEval、Ragas

项目介绍

ai-eval-platform 是评测安全领域的开源项目,由 huangyiminghappy 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 11。

项目仍在小幅维护中,最近一次代码更新于 2026-09-03。Apache-2.0 许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:RAG系统检索质量与回答准确性评估。同类可对比的替代方案包括 Promptfoo、DeepEval、Ragas。

上一篇:RiOSWorld

下一篇:AutoControl-Arena

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24