silero-models

几行代码实现高质量语音合成与识别,CPU也能跑

Silero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模型复杂、部署困难、资源消耗大等问题。核心能力包括:提供高质量、多语言(如俄语、英语、中文等)的预训练模型,支持 PyTorch 框架,并能在 CPU 上实时运行,无需 GPU。项目通过简洁的 API 设计,让用户只需几行代码即可实现语音合成和识别,同时提供 Colab 示例,方便快速体验。此外,模型经过优化,体积小、速度快,适合边缘设备部署。整体上,它降低了语音AI的应用门槛,让开发者能专注于业务逻辑而非模型细节。

开源 free 音频音乐
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6117
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类音频音乐
开发团队snakers4
所属国家
官网地址
定价模式free
价格说明开源预训练模型,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Jupyter Notebook
技术栈/模型armenian,azerbaijani,belarus,colab,georgian,kazakh,kyrgyz,pretrained-models,pytorch,russian,speech,speech-synthesis,speech-to-text,tajik,text-to-speech,torch-hub,tts,tts-models,ukrainian,uzbek
GitHub 星标★ 6117
30天Star增速
HF 下载量
上线时间2020-09-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境,并已具备 PyTorch(README 说明模型基于 PyTorch 框架使用)
  • 可访问外网:模型由 pip 和 PyTorch Hub 按需下载
  • 按需准备语言与说话人参数(例如 language='ru'、speaker='v5_ru')

安装与启动步骤

  1. 1选择使用方式

    README 提供三种接入方式:PyTorch Hub 的 torch.hub.load()、pip 包、以及手动缓存模型与工具代码后自行修改。按需选一种。

  2. 2pip 安装 silero

    最简方式是通过 pip 安装官方包,安装后即可 from silero import silero_tts,无需手动下载模型文件。

    pip install silero
  3. 3运行 TTS 示例

    把 README 给出的示例写入 .py 文件并运行:加载俄语 v5_ru 模型,用示例文本合成音频,首次运行会自动下载模型。

    from silero import silero_tts
    model, example_text = silero_tts(language='ru',
                                     speaker='v5_ru')
    audio = model.apply_tts(text=example_text)
  4. 4或改用 PyTorch Hub

    如果不装 pip 包,也可通过 torch.hub.load() 加载同一份代码,README 未给出完整参数,具体用法见官方文档。

    torch.hub.load()
  5. 5确认模型与音频

    示例运行后 model 为已加载的 TTS 模型、example_text 为示例文本、audio 为合成结果,无报错即表示可用。

  6. 6按需缓存模型

    模型默认按需下载;若需要缓存,可手动缓存,或先调用一次对应模型,它会自动下载到缓存目录。

关键配置

配置项必填说明示例
language是选择模型语言,如俄语 ru 等,决定加载哪套模型。ru
speaker是选择说话人/模型版本标识,需与语言对应。v5_ru
text否要合成的文本,不传则使用模型返回的示例文本。example_text

如何确认成功

运行 README 示例代码无报错,并拿到 model、example_text 和 audio 三个返回结果,即表示加载与合成成功。

常见问题

Q:三种使用方式有什么区别?

A:PyTorch Hub 与 pip 包基于同一份代码,README 中所有 torch.hub.load 示例只需改为 from silero import silero_tts 即可用于 pip 包。

Q:模型下载到哪里,能否离线使用?

A:模型由 pip 和 PyTorch Hub 按需下载;需要缓存时手动缓存,或先调用一次模型,它会被下载到缓存目录。

Q:运行需要 GPU 吗?

A:不需要。README 强调模型在 CPU 和 GPU 上都很快,CPU 上即可运行。

Q:支持哪些语言和说话人?

A:README 的 Models and Speakers 一节按 V5 Turkic、V5 Caucasian、V5、V4、V3 等列出了可选模型与说话人,按需选择对应 language 与 speaker。

注意事项

  • README 的 Dependencies 一节未在节选中给出具体依赖清单,安装前请查阅官方说明。
  • README 未给出具体端口、路径与硬件参数,不要自行假设。
  • 仓库同时提供 Colab 示例,可先在线体验再本地部署。
  • 许可证信息见 README 的 Licence 一节,商用前请自行确认。

核心亮点

  • 模型轻量,CPU实时推理,无需GPU即可部署
  • API极简,几行代码完成TTS/STT,上手快
  • 多语言支持,覆盖俄语、英语等,且有Colab示例

不足之处

  • 文档/社区待观察
  • 模型语言覆盖有限,中文等支持可能不完善

适用场景

  • 快速原型开发,验证语音交互想法
  • 边缘设备或低资源环境下的语音应用
  • 教育或研究用途,学习语音模型集成

替代项目

Coqui TTS、Mozilla TTS、ESPnet

项目介绍

silero-models 是音频音乐领域的开源项目,由 snakers4 开发,2020 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(6,117)位列前 8%,在音频音乐分类的 738 个项目里位列前 5%。

近 41 天,它的 GitHub 星标从 6,061 增加到 6,117,净增 56。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。开源预训练模型,完全免费,可自行部署使用。

它主要面向的使用场景是:快速原型开发,验证语音交互想法。同类可对比的替代方案包括 Coqui TTS、Mozilla TTS、ESPnet。

上一篇:espeak-ng

下一篇:abogen

同类项目推荐

tango 开源

输入一句话,自动生成匹配的音频内容

A family of diffusion models for text-to-audio generation.

★ 1239 2026-08-09
AuK 开源

一个模型搞定语音生成、编辑与分离

AuK: An Open-Source Foundational Model for Speech Generation and Editing

★ 1236 2026-09-13
swift-tts 开源

Swift 项目三行代码接入系统 TTS,兼容 TCA 和 Combine

A straightforward package containing version for Swift modern concurrency, Point-Fre···

★ 52 2026-08-09
ai-dj 开源

现场演出中实时用 AI 生成音乐,保持人类掌控

AI music generation for live performance - Standalone (Ableton Link) + VST3/AU. 8 tr···

★ 246 2026-08-09