speech

本站收录 136 个带「speech」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083VoxCPMVoxCPM2 是一款无分词器的多语言语音生成模型,支持多语种语音合成、创意音色设计与高保真声音克隆。无需传统分词器即可直接生成语音,带来更自然、更真实的合成效★ 38,137MockingBird只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程支持,声音相似度高、合成速度快,非常适合语音克隆研究与实★ 36,902whisperXWhisperX 是一个基于 OpenAI Whisper 的自动语音识别(ASR)工具,核心解决 Whisper 原始输出时间戳不精确、无法对齐到单词级别的问★ 24,303datasetsdatasets 是 Hugging Face 推出的开源数据集库,旨在成为 AI 模型就绪数据集的中心枢纽。它解决了机器学习从业者在数据获取、处理和加载过程中★ 22,016speech-to-speechspeech-to-speech 是一个构建本地语音代理的开源项目,旨在利用开源模型实现端到端的语音交互。它解决了传统语音助手依赖云端服务、延迟高、隐私风险大等★ 13,350TTSMozilla TTS 是一个基于深度学习的文本转语音(TTS)引擎,旨在提供高质量、自然且灵活的语音合成能力。它解决了传统 TTS 系统音质生硬、定制困难的问★ 10,172AudioGPTAudioGPT 是一个多模态音频处理框架,旨在统一理解和生成语音、音乐、声音以及说话头(Talking Head)等音频相关任务。它解决了传统音频模型功能单一★ 10,169EmotiVoice网易有道开源的多音色、提示词可控 TTS 引擎,通过文本提示即可控制合成语音的情感与风格。支持多种情绪表达,中文合成效果出色,适合有声内容创作、短视频配音与情感★ 8,534annyangannyang 是一个轻量级的 JavaScript 语音识别库,通过 Web Speech API 为网站添加语音控制能力。它解决了网页端语音交互门槛高、实现★ 6,818silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123cactuscactus 是一个专为移动设备、可穿戴设备、智能家居和机器人等边缘场景设计的轻量级 AI 推理引擎。它解决了在资源受限的硬件上高效运行深度学习模型的问题,核心★ 6,080whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659ultravoxultravox 是一个专注于实时语音交互的多模态大语言模型(LLM),旨在解决传统语音助手延迟高、交互不自然的问题。它通过将音频直接作为输入模态与文本联合建模★ 4,574metavoice-srcMetaVoice 是一个基于深度学习的情感语音合成基础模型,专注于生成高度自然、富有表现力的语音。它解决了传统 TTS 系统声音机械、缺乏情感和个性化的问题,★ 4,206ApplioApplio 是一个专注于易用性和性能的语音转换工具,基于 PyTorch 实现,支持实时语音到语音转换(VC)、语音克隆和文本到语音(TTS)。它解决了传统语★ 3,770whisper-asr-webservice这是一个基于OpenAI Whisper的语音识别Web服务,将Whisper模型封装成易于调用的API接口。它解决了开发者需要快速集成语音转文字功能但不想深入★ 3,347aeneasaeneas 是一个用 Python/C 编写的开源工具集,用于自动将音频与文本进行强制对齐,即自动生成音频中每个单词或句子对应的时间戳。它解决了人工手动标注音★ 2,868lingvoLingvo 是 Google 开源的深度学习框架,专注于序列建模任务,尤其擅长语音识别、机器翻译和语言模型。它基于 TensorFlow 构建,提供了一套模块★ 2,864whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850MARS5-TTSMARS5-TTS 是 CAMB.AI 开源的语音合成模型,专注于高表现力的文本转语音和声音克隆。它解决的核心问题是传统 TTS 合成语音平淡、缺乏韵律和情感的★ 2,822speechgptSpeechGPT 是一个基于网页的语音对话应用,让你能直接与 ChatGPT 进行语音交流,而不是打字。它解决了用户在使用 ChatGPT 时只能通过文本交互★ 2,749gTTSgTTS 是一个 Python 库和命令行工具,用于调用 Google Translate 的文本转语音 API,将文本转换为 MP3 音频。它解决了开发者快速★ 2,632IMS-ToucanIMS-Toucan 是一个基于 PyTorch 的可控且快速的文本转语音(TTS)工具包,声称支持超过 7000 种语言。它旨在解决多语言语音合成中音色、情感★ 2,211openai-edge-ttsopenai-edge-tts 是一个免费、高质量的文本转语音(TTS)API 端点,旨在作为 OpenAI、Azure 或 ElevenLabs 等付费 TT★ 2,115tacotronTacotron 是一个基于 TensorFlow 实现的端到端文本转语音(TTS)模型,源自谷歌的论文《Tacotron: A Fully End-to-En★ 1,832SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432AuKAuK 是一个开源语音生成与编辑基础模型,目标是把语音合成、语音编辑、说话人提取、语音增强和音源分离等任务统一到一个模型框架中。它解决的是传统语音流水线中模型碎★ 1,413voicefixerVoiceFixer 是一个基于深度学习的通用语音修复工具,旨在恢复受损的语音信号,使其更清晰、更自然。它能够处理多种类型的语音退化,包括背景噪声、混响、削波(★ 1,381MToolsMTools 是一款基于 Python 的桌面多功能工具箱,把音视频处理、图片编辑、文本操作和编码工具整合到一个应用里,并内置 AI 增强能力。它想解决的核心问★ 1,352StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294dc_ttsdc_tts 是一个基于 TensorFlow 实现的端到端文本转语音(TTS)模型,源自论文“Efficiently Trainable Text-to-Sp★ 1,159NATSpeechNATSpeech 是一个非自回归语音合成(NAR-TTS)框架,基于 PyTorch 实现,集成了 PortaSpeech(NeurIPS 2021)和 Di★ 1,004FireRedTTSFireRedTTS 是一个基于大语言模型(LLM)的开源语音合成(TTS)系统,旨在提供高质量、自然且可控的文本到语音生成能力。它结合了语言模型、扩散模型、流★ 926diffwaveDiffWave 是一个基于扩散概率模型的神经声码器与波形合成器,由 Google Brain 团队提出,用于从梅尔频谱等条件特征高效生成高质量语音波形。它解决★ 886AnyGPTAnyGPT 是一个基于离散序列建模的统一多模态大语言模型,旨在实现任意模态之间的相互转换与理解。它解决了传统多模态模型通常只支持文本与其他单一模态(如图像或语★ 883voxtral-mini-realtime-rs这是一个用 Rust 实现 Mistral Voxtral mini 实时语音识别(ASR)和语音合成(TTS)的开源项目,基于 Burn 机器学习框架,支持本★ 823AlphaAvatarAlphaAvatar 是一个基于 LiveKit 构建的实时交互式全模态数字人框架,目标是把数字人拆解成可插拔的开源组件,让开发者自由组合实时模型、视觉形象、★ 816cboardCboard 是一个基于浏览器的增强与替代沟通(AAC)系统,专为言语障碍人群(如自闭症、脑瘫等)设计。它通过图形符号和文字转语音(TTS)技术,帮助用户以点击★ 759TTS-papersTTS-papers 是一个收集文本转语音(TTS)领域学术论文的仓库,旨在为研究人员和开发者提供系统性的论文列表。它解决了 TTS 领域文献分散、难以追踪最新★ 734MASRMASR是一个基于Pytorch的自动语音识别(ASR)框架,专注于流式与非流式识别,兼顾在线和离线场景。它解决了开发者需要同时支持实时语音交互和离线批量转写的★ 728BabelDuckBabelDuck 是一个面向初学者的 AI 对话练习应用,旨在通过模拟真实对话场景帮助用户提升语言能力。它解决了传统语言学习缺乏口语练习机会的问题,利用 Op★ 691voice-buildervoice-builder 是一个开源的文本转语音(TTS)语音构建工具,基于 JavaScript 开发,整合了 festvox、NLP 和语音合成技术。它旨★ 688chatterbox-tts-apiChatterbox TTS API 是一个本地部署的、兼容 OpenAI 接口的文本转语音服务,基于 Chatterbox 模型实现声音克隆。它解决了在本地或★ 685vits2VITS2 是一个基于 PyTorch 的单阶段文本转语音(TTS)模型,旨在提升语音合成的质量和效率。它通过对抗学习和架构设计改进,解决了传统两阶段 TTS ★ 646tacotronTacotron是Google提出的端到端语音合成模型,该项目是其论文的音频样本展示页。它解决了传统TTS系统需要复杂前端文本分析和声学建模的问题,直接通过注意★ 539android-speechandroid-speech 是一个专为 Android 平台设计的语音识别与文本转语音(TTS)封装库,旨在简化原生 Android 语音 API 的复杂调用★ 534KAN-TTSKAN-TTS 是一个基于 Python 的语音合成训练框架,旨在简化 TTS 模型的开发与训练流程。它提供了从数据预处理到模型训练、推理的完整工具链,支持多说★ 528Awesome-Singing-Voice-Synthesis-and-Singing-Voice-Conversion这是一个关于歌声合成(SVS)与歌声转换(SVC)的精选论文与项目列表,同时涵盖语音合成(TTS)、语音转换(VC)及相关领域(如音乐合成、自动音乐转录、MOS★ 494