benchmarks

统一跑分语音AI,延迟准确率一测便知

这是一个面向语音 AI 的可复现基准测试项目,专注于 TTS(文本转语音)、STT(语音转文本)和 S2S(语音到语音)三类任务的延迟与准确率评测。它解决的是语音 AI 领域缺乏统一、可复现评测标准的问题:不同团队各自跑分,硬件、参数、数据不一致,结果无法横向比较。项目用 Python 实现,提供标准化测试流程,让开发者能在相同条件下测量端到端响应延迟、识别准确率、合成质量等关键指标,并输出可对比的结果。核心能力包括:统一评测协议、可复现的测试脚本、覆盖主流语音模型与 API 的适配层,以及面向 AI Agent 场景的语音交互链路评测。适合在选型、调优和上线前做客观性能验证。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 100
维护状态 活跃
是否开源 是
定价模式 unknown

项目预览

项目数据

分类评测安全
开发团队coval-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型ai,ai-agents,speech-to-text,text-to-speech,voice-ai
GitHub 星标★ 100
30天Star增速
HF 下载量
上线时间2026-04-29 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-06
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 同时覆盖 TTS、STT、S2S 三类任务,评测维度比只测单一任务的工具更完整
  • 强调可复现性,统一测试协议和脚本,减少硬件与参数差异带来的跑分不可比问题
  • 用 Python 实现,便于集成到现有语音 AI 开发与 CI 流程中

不足之处

  • 项目处于早期,星标约 100,模型适配覆盖面和社区生态仍待观察
  • 文档与评测指标细节可能不够完善,长期维护情况待观察

适用场景

  • 语音 AI 选型时横向对比不同 TTS/STT 服务的延迟与准确率
  • 语音 Agent 上线前做端到端 S2S 响应延迟回归测试
  • 在 CI 中持续监控语音模型升级后的性能变化

替代项目

Hugging Face Evaluate、Open ASR Leaderboard

项目介绍

benchmarks 是评测安全领域的开源项目,由 coval-ai 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 494 个项目,GitHub 星标数为 100。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-05。

它主要面向的使用场景是:语音AI选型时横向对比不同TTS/STT服务的延迟与准确率。同类可对比的替代方案包括 Hugging Face Evaluate、Open ASR Leaderboard。

上一篇:speech-to-text-benchmark

下一篇:getIPIntel

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1527 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2986 2026-09-12