pytorch-implementation

本站收录 16 个带「pytorch-implementation」标签的 AI 开源项目

manga-image-translatormanga-image-translator 是一个基于深度学习的漫画/图片文字翻译工具,能够自动检测图片中的文字区域,识别原文(主要支持日文、英文等),并翻译★ 10,454pytorch-stable-diffusion这是一个从零开始、逐行实现 Stable Diffusion 的 PyTorch 教程项目,完全基于论文《High-Resolution Image Synth★ 1,078makeMoEmakeMoE 是一个从零开始实现稀疏混合专家(MoE)语言模型的教学项目,灵感来源于 Andrej Karpathy 的 makemore。它通过 Jupyt★ 818Transformer-TTSTransformer-TTS 是一个基于 PyTorch 实现的文本转语音(TTS)项目,对应论文《Neural Speech Synthesis with ★ 694zetazeta 是一个基于 PyTorch 的模块化 AI 模型构建库,旨在帮助开发者快速搭建高性能的对话助手和大语言模型。它提供了类似乐高积木的组件,包括注意力机制★ 604CycleGAN-VC2CycleGAN-VC2 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在实现无需平行语料的音色转换。它解决了传统语音★ 572One-DMOne-DM 是一个基于扩散模型的手写文本生成工具,对应 ECCV 2024 论文《One-Shot Diffusion Mimicker for Handwr★ 566open-genieopen-genie 是 DeepMind 论文《Genie: Generative Interactive Environments》的非官方 PyTorch★ 295nonparaSeq2seqVC_code这是一个基于非平行语料库的序列到序列语音转换(Voice Conversion, VC)实现代码。传统语音转换通常需要源和目标说话人的平行语料(即相同文本),而★ 248Voice-synthesisVoice-synthesis 是一个基于 SV2TTS(说话人验证到多说话人语音合成)框架的实时语音合成实现,包含编码器、合成器和声码器三阶段。它允许用户仅用★ 170AdaSpeechAdaSpeech 是一个基于 PyTorch 的自适应文本转语音(TTS)项目,旨在为自定义声音提供高质量的语音合成能力。它针对传统 TTS 系统在适应新说话★ 163CycleGAN-VC3CycleGAN-VC3 是一个基于 CycleGAN 的语音转换(Voice Conversion)开源项目,旨在将一个人的声音转换为另一个人的声音,同时保留★ 158LGGANLGGAN 是一个基于生成对抗网络的语义引导场景生成模型,发表于 CVPR 2020。它解决的是从语义分割图(或跨视角条件)生成逼真场景图像的问题,核心创新在于★ 144SuperPianoSuperPiano 是一个基于 Jupyter Notebook 的开源项目,专注于音乐 AI 模型的训练与音乐生成。它利用 Google 的 Transfo★ 91CDFSE_FastSpeech2CDFSE_FastSpeech2 是论文《Content-Dependent Fine-Grained Speaker Embedding for Zero-★ 86LORISLORIS 是一个基于 ICML 2023 论文的长期节奏视频配乐工具,专门解决为长视频自动生成与画面节奏同步的背景音乐的问题。它通过分析视频中的运动节奏(如剪★ 64