dit
本站收录 17 个带「dit」标签的 AI 开源项目
LTX-VideoLightricks 官方开源的 LTX-Video 视频生成模型仓库,基于 DiT 架构实现高质量文生视频与图生视频,支持实时生成与可控编辑,为视频创作者提供★ 10,995
SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163
ComfyUI-LTXVideoComfyUI-LTXVideo 是 ComfyUI 的官方插件,用于集成 LTX-Video 视频生成模型。LTX-Video 是 Lightricks 推出★ 4,146
InfiniteYouInfiniteYou 是一个基于扩散模型的图像生成与编辑工具,核心解决身份保持下的灵活照片重绘问题。它允许用户在不丢失人物身份特征的前提下,对照片进行多种编辑★ 2,683
DiT-ExtrapolationDiT-Extrapolation 是 ICML 2025 论文《RIFLEx: A Free Lunch for Length Extrapolation i★ 829
PaddleMIXPaddleMIX是百度飞桨生态下的多模态大模型套件,旨在统一支持主流多模态任务,包括图文理解、视觉问答、图像生成等。它集成了端到端的大规模多模态预训练模型和扩★ 723
flash-diffusionFlash Diffusion 是一个加速条件扩散模型推理的开源项目,来自 AAAI 2025 Oral 论文。它通过引入先进的蒸馏技术和架构优化,显著减少扩散★ 667
OpenMusicOpenMusic 是一个基于 Python 的文本生成音乐(Text-to-Music)开源项目,旨在实现当前最先进的(SOTA)音乐生成效果。它解决了从文字★ 633
Awesome-DiT-InferenceAwesome-DiT-Inference 是一个精选的扩散模型推理加速论文与代码资源列表,专注于 DiT(Diffusion Transformer)架构。它★ 592
Open-OmniVCusOmniVCus 是一个面向视频定制生成的开源项目,基于扩散模型(Diffusion Models)和 Transformer 架构,支持通过多模态控制条件(如★ 495
OmniShowOmniShow 是字节跳动推出的统一视频生成模型,专注于人-物交互(HOI)视频生成,论文发表于 ICML 2026。它基于扩散模型(DiT/MMDiT)架构★ 475
JavisDiTJavisDiT 是一个面向音频-视频联合生成的扩散 Transformer 模型系列,由 ICLR 2026 论文官方实现。它解决的是传统视频生成中音频与画面★ 383
ComfyUI_InfiniteYouInfiniteYou 是一个基于 FLUX 的身份保持图像生成与编辑项目,荣获 ICCV 2025 Highlight。它通过 ComfyUI 原生节点集成,★ 299
SCoPESCoPE 是一个面向三维感知视频生成的开源研究项目,核心是提出「视线坐标位置编码」(Sightline-Coordinate Positional Encod★ 208
MHLAMHLA 是一个面向图像生成与语言建模的线性注意力机制改进项目,旨在解决线性注意力在表达力上的不足。传统线性注意力通过核函数近似 softmax 注意力,虽降低★ 157
OmniVAEOmniVAE 是一个面向音视频联合生成的统一变分自编码器(VAE),旨在解决音频与视频模态在生成任务中难以对齐和协同建模的问题。它通过引入跨模态对齐机制,将音★ 90
movie-genmovie-gen 是论文《Movie Gen: A Cast of Media Foundation Models》的开源社区实现,旨在复现 Meta 提出的★ 61