eva

一套框架,全面衡量语音代理表现,快速定位短板。

eva 是一个用于评估语音代理(Voice Agents)的全新端到端框架。它解决的核心问题是:语音代理系统(如语音助手、对话机器人)在真实场景中的表现难以全面、客观地衡量。eva 提供了一整套评估工具和方法论,支持从语音识别(ASR)、自然语言理解(NLU)到语音合成(TTS)的完整链路评估,并针对 agentic AI 场景设计了专门的评测指标和流程。其核心能力包括:端到端的评估流水线、可扩展的测试场景定义、以及自动化的结果分析。通过 eva,开发者可以更高效地对比不同语音代理方案,定位系统瓶颈,从而加速产品迭代。该项目基于 Python 构建,适合集成到现有的机器学习或 NLP 工作流中。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 219
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队ServiceNow
所属国家
定价模式free
价格说明开源框架,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型agentic-ai,asr,evaluation-framework,machine-learning,nlp,speech-ai,tts,voice-agents,voice-ai
GitHub 星标★ 219
30天Star增速
HF 下载量
上线时间2026-03-24 00:00:00
最近更新2026-09-24 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 端到端评估,覆盖 ASR 到 TTS 全链路,避免单点测试盲区
  • 专为 agentic AI 设计,支持复杂对话场景的自动化评测
  • Python 实现,易于集成到现有 ML/NLP 开发流程

不足之处

  • 项目处于早期阶段(194 星),API 和功能可能不稳定
  • 文档和社区生态待观察,实际使用案例较少

适用场景

  • 语音助手开发中,对比不同 ASR/TTS 供应商组合的整体效果
  • 智能客服系统上线前,自动化回归测试对话流畅度与任务完成率
  • 研究语音代理评测方法论,作为学术实验的基准框架

替代项目

OpenAI Evals、Ragas、DeepEval

项目介绍

eva 是评测安全领域的开源项目,由 ServiceNow 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 219。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-24。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:语音助手开发中,对比不同ASR/TTS供应商组合的整体效果。同类可对比的替代方案包括 OpenAI Evals、Ragas、DeepEval。

上一篇:RVCBench

下一篇:UltraEval-Audio

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12