text-to-audio
本站收录 15 个带「text-to-audio」标签的 AI 开源项目
AmphionAmphion 是一个面向音频、音乐和语音生成的开源工具包,旨在支持可复现研究,并帮助初级研究者和工程师快速入门。它集成了多种主流模型与算法,涵盖文本到语音(T★ 10,305
abogenabogen 是一个将电子书(EPUB、PDF 和纯文本)自动转换为带同步字幕的有声书的开源工具。它解决了传统有声书制作成本高、周期长的问题,让普通用户也能快速★ 6,066
MOSS-TTSMOSS-TTS 是由 MOSI.AI 和 OpenMOSS 团队开发的开源语音与声音生成模型家族,专注于高保真、高表现力及复杂真实场景的语音合成。它解决了传统★ 4,147
StreamSpeechStreamSpeech 是一个“一体化”的无缝语音模型,同时支持离线与同声传译场景下的语音识别(ASR)、语音翻译和语音合成。它解决了传统级联系统延迟高、错误★ 1,294
audio-webuiaudio-webui 是一个面向音频相关神经网络的统一 Web 界面,旨在解决音频 AI 工具分散、使用门槛高的问题。它集成了多种主流音频生成与处理模型,如 ★ 1,243
tangotango 是一个用于文本生成音频的扩散模型家族,旨在解决从文字描述直接合成高质量音频的问题。它基于文本提示生成对应的音频内容,如音效、环境声等,核心能力包括文★ 1,241
HunyuanVideo-FoleyHunyuanVideo-Foley 是腾讯混元团队开源的多模态扩散模型,用于从视频内容自动生成高保真度的拟音音频(Foley Sound)。它解决了视频后期制★ 1,061
OpenMusicOpenMusic 是一个基于 Python 的文本生成音乐(Text-to-Music)开源项目,旨在实现当前最先进的(SOTA)音乐生成效果。它解决了从文字★ 633
Awesome-LLMs-meet-Multimodal-Generation这是一个精选论文列表,聚焦于基于大语言模型(LLM)的多模态生成领域,涵盖图像、视频、3D和音频四大模态。项目系统梳理了LLM与多模态生成结合的前沿研究,包括多★ 552
nuwa-pytorchNUWA(女娲)是微软提出的多模态预训练模型,支持文本到视频、文本到图像及视频预测等任务。此项目为NUWA的PyTorch非官方实现,基于3D Transfor★ 547
mustangoMustango是一个面向可控文本生成音乐的开源模型,旨在解决现有文本到音乐生成中控制能力弱、语义对齐差的问题。它基于音乐理解模型和潜在扩散模型,通过引入音乐相★ 396
ElevenLabs-Clone这是一个自托管的 ElevenLabs 替代品,用于文本转语音、声音转换和 AI 音频生成。它基于 Docker、FastAPI 和 Next.js 构建,提供★ 129
sub-to-audiosub-to-audio 是一个将字幕文件转换为音频的工具,它利用 Coqui-ai TTS 引擎,根据字幕文件中的时间轴和文本内容,自动生成与字幕同步的语音音★ 120
word2waveWord2Wave 是一个从文本提示生成短音频样本的开源框架,基于 WaveGAN 和 COALA 模型。它解决了文本到音频生成中数据稀缺和生成质量不高的问题,★ 119
WaveGrad2WaveGrad2 是谷歌大脑团队提出的 WaveGrad 2 模型的非官方 PyTorch 实现,专注于文本到语音(TTS)合成。它采用非自回归架构,通过迭代★ 68