vqgan

本站收录 10 个带「vqgan」标签的 AI 开源项目

fish-speechfish-speech 是一个开源的文本转语音(TTS)模型,基于 VQGAN 和 Llama 架构,实现了目前最先进的语音合成效果。它解决了传统 TTS 系统★ 32,888MSMC-TTSMSMC-TTS 是一个多阶段多码本(Multi-Stage Multi-Codebook)的语音合成(TTS)开源项目,基于深度学习与 GAN 架构,结合 V★ 168feed_forward_vqgan_clip这是一个前馈式VQGAN-CLIP模型,旨在解决传统文本生成图像方法中需要针对每个输入提示词反复优化VQGAN潜空间的问题。传统方法(如VQGAN-CLIP)在★ 140pytti-notebookpytti-notebook 是一个基于 Google Colab 的图像生成与风格迁移实验笔记本,主要利用 GAN(生成对抗网络)技术实现图像动画化和风格转换★ 112maskbitMaskBit 是论文《MaskBit: Embedding-free Image Generation from Bit Tokens》的官方实现,专注于图像★ 94KoDALLEKoDALLE 是一个面向韩语文本到图像生成的开源项目,基于 OpenAI 的 DALL-E 架构,使用 PyTorch 和 VQGAN 实现。它解决了现有图像★ 86ocr-vqganOCR-VQGAN 是一个面向论文图表(figure images)的离散图像编码器,包含 tokenizer 和 detokenizer,专门用于 Paper★ 86VQGAN-CLIP-DockerVQGAN-CLIP-Docker 是一个将 VQGAN 与 CLIP 模型结合并容器化的开源项目,旨在实现零样本(zero-shot)文本到图像的生成。它解决★ 77MGVQMGVQ 是一个面向图像生成与重建的通用 tokenizer 模型,核心思路是让 VQ-VAE 在性能上超越传统 VAE。它通过多组量化(multi-group★ 55binary-latent-diffusionBinary Latent Diffusion 是一个基于 PyTorch 的潜在扩散模型实现,专注于在二值化潜在空间中进行图像生成。它解决了传统扩散模型在连续★ 51