sonata-nvda

给 NVDA 装上神经语音,让屏幕阅读更自然

sonata-nvda 是一个为 NVDA 屏幕阅读器开发的语音合成器驱动插件,利用神经 TTS 模型(如 Piper)提供更自然、高质量的语音输出。它解决了 NVDA 默认合成器声音机械、不自然的问题,让视障用户在使用屏幕阅读器时获得更舒适的听觉体验。该插件将神经 TTS 模型集成到 NVDA 的语音框架中,支持多种语言和声音,并允许用户通过 NVDA 设置界面进行配置。其核心能力包括:加载 Piper 模型、实时语音合成、与 NVDA 无缝集成、低延迟响应等。作为早期项目,它展示了将现代 AI 语音技术应用于辅助功能领域的潜力,为视障用户带来更人性化的交互体验。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 73
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队mush42
所属国家
官网地址
定价模式free
价格说明开源免费,GPL-2.0许可,可自行部署使用。
访问状态
是否开源是
开源协议GPL-2.0
主要语言Python
技术栈/模型a11y,nvda,tts
GitHub 星标★ 73
30天Star增速
HF 下载量
上线时间2023-04-29 00:00:00
最近更新2026-08-30 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 集成 Piper 神经 TTS,语音自然度远超默认 eSpeak
  • 与 NVDA 原生集成,安装后可直接在设置中选择
  • 支持多语言和多种声音,用户可灵活切换

不足之处

  • 依赖外部 Piper 模型,模型文件较大,安装稍复杂
  • 早期项目,功能覆盖和稳定性有待完善,文档/社区待观察

适用场景

  • 视障用户日常使用电脑,需要更舒适的语音反馈
  • 开发者为 NVDA 添加自定义语音合成器
  • 辅助技术领域研究神经 TTS 在屏幕阅读器中的应用

替代项目

NVDA 内置 eSpeak、NVDA 内置 Windows OneCore 语音、TetraLogical 的 NVDA 语音插件

项目介绍

sonata-nvda 是音频音乐领域的开源项目,由 mush42 开发,2023 年首次发布。

它收录于音频音乐分类,该分类目前共有 738 个项目,GitHub 星标数为 73。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-30。开源免费,GPL-2.0许可,可自行部署使用。

它主要面向的使用场景是:视障用户日常使用电脑,需要更舒适的语音反馈。同类可对比的替代方案包括 NVDA 内置 eSpeak、NVDA 内置 Windows OneCore 语音、TetraLogical 的 NVDA 语音插件。

上一篇:SummerTTS

下一篇:g2pW

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09