torch

本站收录 20 个带「torch」标签的 AI 开源项目

stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151ChatTTS专为日常对话场景设计的生成式语音模型,能够生成自然流畅、富有表现力的对话语音。支持细粒度韵律与情感控制,中文合成效果出色,广泛应用于对话系统、有声内容创作与 A★ 39,879CycleGAN经典无监督图像风格迁移框架,无需成对数据即可实现照片转绘画、马变斑马等趣味效果,广泛应用于风格迁移与图像翻译领域,是计算机视觉领域教科书级的开源项目。★ 12,876superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327stable-faststable-fast 是一个专为 NVIDIA GPU 设计的 HuggingFace Diffusers 推理性能优化框架,由 WaveSpeed.ai 团★ 1,304LoongForgeLoongForge 是一个面向大模型训练的统一高性能框架,支持在 NVIDIA GPU 和昆仑芯 XPU 上训练 LLM、VLM、扩散模型及具身智能模型。它解★ 647LLaMA_MPSLLaMA_MPS 是一个面向 Apple Silicon 芯片的 LLaMA 模型推理加速项目,主要解决在 Mac 上运行 LLaMA 和 Stanford-★ 576Auto1111SDKAuto1111SDK 是一个面向 Automatic1111 WebUI 的 Python SDK 库,旨在为开发者提供简洁、稳定的编程接口来运行先进的扩散模★ 414diffusers-torchaodiffusers-torchao 是一个专注于扩散模型优化的端到端配方库,由 Hugging Face 和 PyTorch 团队联合维护。它解决的是扩散模型(★ 399VoxNovelVoxNovel 是一个将电子书转换为有声书的开源工具,核心特点是能为书中每个角色分配不同的配音演员,实现多角色语音合成。它解决的是传统 TTS 生成有声书时声★ 376open-genieopen-genie 是 DeepMind 论文《Genie: Generative Interactive Environments》的非官方 PyTorch★ 295Synthesize3DviaDepthOrSil这是一个2017年CVPR论文的开源实现,用于通过多视图深度图或轮廓图来生成和重建3D形状。项目核心是训练一个生成对抗网络(GAN)和变分自编码器(VAE)模型★ 170docmind-ai-llmDocMind AI 是一个基于 Streamlit 的开源文档分析应用,核心思路是把 LlamaIndex、LangGraph 与本地大模型串起来,让用户在自★ 155Qwen-Image-Edit-2511-LoRAs-Fast-Lazy-Load这是一个针对Qwen-Image-Edit-2511图像编辑模型的演示项目,核心亮点是支持懒加载的LoRA适配器,用于高级单图和多图编辑。项目集成了7种以上专用★ 154sdksdk 是一个通用 Python SDK,旨在简化在 Kubernetes 上运行 AI 工作负载的流程。它解决了 AI 工程师和平台团队在 Kubernete★ 151Cozy-Auto-TextureCozy-Auto-Texture 是一个 Blender 插件,利用 Stable Diffusion 文本生成图像模型,直接在 Blender 内生成免费纹★ 117eccv16_attr2imgAttribute2Image 是 ECCV 2016 论文的 Torch 实现,旨在根据属性描述生成对应的图像。该项目解决了从离散属性(如颜色、形状、类别)到★ 94tg_bot_stt_tts这是一个基于 Python 的 Telegram 机器人,核心功能是语音消息的识别与生成,即语音转文字(STT)和文字转语音(TTS)。它解决了在 Telegr★ 68textboostTextBoost 是一个面向文本到图像模型的个性化微调工具,核心解决单张参考图即可实现主体定制化生成的问题。传统方法如 DreamBooth 需要多张图像并微★ 57LightDiffusion-NextLightDiffusion-Next 是一个专注于扩散模型推理性能优化的开源项目,旨在提供最快的 Diffusion 后端、WebUI 和服务器。它解决的是扩★ 51