vae
本站收录 21 个带「vae」标签的 AI 开源项目
Cross-Lingual-Voice-Cloning这是一个基于PyTorch的Tacotron 2实现,专注于跨语言语音克隆。它解决了传统语音合成系统只能使用单一语言训练数据的问题,允许用户用源语言的语音样本克★ 359
PortaSpeechPortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Portable and High-★ 341
OmniTokenizerOmniTokenizer 是一个用于图像和视频联合分词(tokenization)的统一模型,来自 NeurIPS 2024。它解决了图像和视频生成中分词器不★ 330
video_prediction这是一个基于生成对抗网络(GAN)和变分自编码器(VAE)的视频预测开源项目,核心是解决视频帧序列的未来预测问题。它采用随机对抗训练方式,能够生成多种可能的未来★ 304
LynnReal-OmniLynnReal-Omni 是一个把多种视频生成与编辑能力统一到同一框架的开源项目,基于 Python 实现。它试图解决视频生成领域模型碎片化的问题:文生视频、★ 241
Efficient-VDVAEEfficient-VDVAE 是论文“Efficient-VDVAE: Less is more”的官方 PyTorch 和 JAX 实现,旨在提升层次化变分★ 199
soft-intro-vae-pytorchSoft-IntroVAE 是 CVPR 2021 Oral 论文的官方 PyTorch 实现,旨在改进内省变分自编码器(Introspective VAE)的★ 197
Parallel-Tacotron2Parallel-Tacotron2 是 Google Parallel Tacotron 2 的 PyTorch 非官方实现,旨在解决传统自回归 TTS 模型★ 191
vae-lagging-encoder这是一个基于PyTorch的变分自编码器(VAE)改进实现,对应ICLR 2019论文《Lagging Inference Networks and Poste★ 185
lpwmlpwm(Latent Particle World Models)是一个面向视频生成与预测的物体中心世界模型,由ICLR 2026 Oral论文官方开源。它旨★ 139
VAE-for-Image-Generation这是一个用Keras实现变分自编码器(VAE)的教学型开源项目,专注于图像生成和潜在空间可视化。项目在MNIST和CIFAR10数据集上完成了VAE的完整实现,★ 122
maskbitMaskBit 是论文《MaskBit: Embedding-free Image Generation from Bit Tokens》的官方实现,专注于图像★ 94
lofi-generatorlofi-generator 是一个利用深度学习技术生成 Lo-fi 风格音乐的实验性开源项目。它针对 Lo-fi 音乐创作门槛高、灵感枯竭的问题,提供了一套基★ 83
setvaeSetVAE 是一个基于 PyTorch 的生成模型实现,来自 CVPR 2021 论文,专门针对集合结构数据(如点云、物体集合)进行层次化组合建模。它解决的是★ 80
VAENAR-TTSVAENAR-TTS 是一个基于 PyTorch 的非自回归文本转语音(TTS)合成实现,核心思路是结合变分自编码器(VAE)与非自回归生成框架,旨在解决传统自★ 74
BitVAEBitVAE 是一个图像分词器(tokenizer)的官方训练与推理代码库,属于自回归图像生成模型的基础组件。它通过将图像编码为离散的比特级 token,替代传★ 72
color-peelcolor-peel 是一个基于扩散模型的图像生成项目,旨在从形状中解耦出目标颜色,实现颜色与形状概念的分离。它通过生成一系列带有目标颜色的几何形状,并联合学习★ 68
Generative_Deep_Learning_2nd_Edition这是《만들면서 배우는 생성 AI 2판》(韩文版《动手学生成AI 第二版》)一书的官方代码仓库,包含书中所有示例代码和Jupyter Notebook教程。项★ 66
learnable-speechlearnable-speech 是一个基于可学习音频编码器的文本转语音(TTS)项目,无需与文本参考对齐即可实现语音合成。它解决了传统 TTS 系统依赖音素对★ 56
MGVQMGVQ 是一个面向图像生成与重建的通用 tokenizer 模型,核心思路是让 VQ-VAE 在性能上超越传统 VAE。它通过多组量化(multi-group★ 55
DeepMusicvStyleDeepMusicvStyle 是 ICME 2020 论文《Style-Conditioned Music Generation》的官方代码仓库,实现了一个基★ 52