diffusion-transformer

本站收录 20 个带「diffusion-transformer」标签的 AI 开源项目

HunyuanVideo腾讯混元出品的大规模视频生成模型系统框架,从数据、模型到训练全面优化,支持高质量文生视频,画面细腻、语义对齐准确,为开源视频生成领域树立了重要标杆。★ 12,576InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683fantasy-talkingFantasyTalking 是一个面向数字人领域的 3D 说话人像生成框架,由 ACM MM 2025 收录。它解决的是传统说话人像生成中头部运动与表情不协调★ 1,630UNOUNO 是一个基于扩散 Transformer 的图像生成定制化方法,由清华大学提出,论文发表于 ICCV 2025。它解决的是当前定制化生成模型只能处理单主体★ 1,363SeedVR2SeedVR2 是一个基于扩散对抗后训练的一步式视频修复项目,旨在解决传统视频修复方法需要多步采样、计算量大且难以处理真实世界复杂退化的问题。它采用扩散Tran★ 890DiT-ExtrapolationDiT-Extrapolation 是 ICML 2025 论文《RIFLEx: A Free Lunch for Length Extrapolation i★ 829HunyuanImage-2.1HunyuanImage-2.1 是腾讯开源的扩散模型,专注于高分辨率(2K)文本到图像生成。它采用高效的扩散Transformer架构,解决传统扩散模型在高分★ 674f5-tts-mlxf5-tts-mlx 是 F5-TTS 模型在 Apple MLX 框架上的实现,旨在让 TTS 模型在 Apple Silicon 芯片上高效运行。它解决了 ★ 647OpenMusicOpenMusic 是一个基于 Python 的文本生成音乐(Text-to-Music)开源项目,旨在实现当前最先进的(SOTA)音乐生成效果。它解决了从文字★ 633SLASLA(Sparse-Linear Attention)是一个面向扩散Transformer(DiT)的推理加速项目,通过引入可微调的稀疏线性注意力机制,在保持★ 548omnitalkerOmniTalker 是一个基于 NeurIPS 2025 论文实现的实时文本驱动说话头生成项目,采用 JavaScript 技术栈,核心能力是在音频-视觉风格★ 426VoostVoost 是一个基于扩散 Transformer 的统一框架,用于双向虚拟试穿(try-on)和虚拟脱衣(try-off)。它解决了传统虚拟试穿模型只能单向处★ 344ComfyUI_InfiniteYouInfiniteYou 是一个基于 FLUX 的身份保持图像生成与编辑项目,荣获 ICCV 2025 Highlight。它通过 ComfyUI 原生节点集成,★ 299AdaCacheAdaCache 是 ICCV 2025 论文的官方代码,针对视频生成扩散 Transformer(DiT)推理速度慢的问题,提出内容自适应缓存机制。它通过动态★ 173IllumiCraftIllumiCraft 是一个面向可控视频生成的统一扩散模型框架,核心解决视频生成中几何结构与光照条件难以联合控制的问题。它通过将几何与光照信息融合进扩散 Tr★ 111Scaling-Diffusion-Transformers-muPScaling-Diffusion-Transformers-muP 是 NeurIPS 2025 论文的官方实现,旨在解决扩散 Transformer(DiT★ 101CAMECAME 是 ACL 2023 论文《CAME: Confidence-guided Adaptive Memory Optimization》的官方实现,一个★ 100f5-tts-swiftf5-tts-swift 是一个用 Swift 语言实现的 F5-TTS 文本转语音库,基于 MLX 框架构建,专为 Apple 生态(macOS、iOS)设计★ 91STCDiTSTCDiT 是一个面向真实世界视频增强与 AIGC 增强的扩散 Transformer 模型,核心解决视频超分辨率与生成内容在复杂运动下的时间稳定性和结构保真★ 78graftinggrafting 是 NeurIPS 2025 Oral 论文的官方代码,研究扩散 Transformer(DiT)的设计空间。它提出一种称为“嫁接”的架构编辑★ 75