generative-model
本站收录 94 个带「generative-model」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733
courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487
SDVSDV(Synthetic Data Vault)是一个用于表格数据合成生成的Python库,旨在解决真实数据隐私保护、数据稀缺和测试数据获取难的问题。它提供了★ 3,567
DreamCraft3DDreamCraft3D 是一个由 ICLR 2024 收录的官方实现项目,专注于从单张 2D 图像生成高质量 3D 模型。它采用分层生成策略,结合引导扩散先验★ 3,028
MeshAnythingMeshAnything 是一个基于自回归 Transformer 的开源模型,旨在将任意 3D 表示(如点云、体素等)自动转换为艺术家风格的高质量网格(Mes★ 2,309
awesome-llm-powered-agent这是一个精心整理的关于大语言模型驱动智能体的资源列表,收录了相关论文、开源仓库、博客文章等。它旨在帮助开发者和研究者快速了解LLM Agent领域的最新进展和核★ 2,251
InfinityInfinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建★ 1,589
AdaIN-styleAdaIN-style 是一个基于 Lua 和 Torch 实现的实时任意风格迁移项目,源自论文《Arbitrary Style Transfer in Rea★ 1,569
awesome-japanese-llm这是一个专门汇总日本语大语言模型(LLM)资源的精选清单项目,旨在解决日语NLP领域模型分散、信息难找的问题。它系统整理了各类支持日语的LLM,包括开源模型、商★ 1,433
LanPaintLanPaint 是一个面向 Stable Diffusion 系列模型的免训练图像修复(inpainting)方案,同时提供 ComfyUI 自定义节点。它要★ 1,416
4DAnyone4DAnyone 是一个从单目视频生成动态 4D 人物的开源项目,由 SIGGRAPH Asia 2026 收录。它解决了从日常随意拍摄的单目视频中重建出可自由★ 1,390
MultiDiffusionMultiDiffusion 是 ICML 2023 论文的官方 PyTorch 实现,提出了一种无需额外训练即可实现可控图像生成的新方法。它通过将多个扩散生成★ 1,069
MeshAnythingV2MeshAnythingV2 是一个将任意3D表示(如点云、体素等)自动转换为艺术家级三角网格的开源项目,由ICCV 2025论文官方实现。它解决了现有3D重建★ 1,022
magvitMAGVIT 是 Google 发布的视频生成模型,基于掩码生成式视频 Transformer 架构,官方提供 JAX 实现。它解决的核心问题是高效、高质量的视★ 1,002
story-iterstory-iter 是一个面向长故事可视化的训练免框架,发表于 ICLR 2026。它解决了现有故事可视化方法在生成长序列图像时角色一致性差、情节连贯性弱的问★ 958
MidiTok专为深度学习模型设计的 MIDI 与符号音乐分词器,提供多种 tokenization 策略,可将符号音乐高效转换为模型可读的序列。是音乐生成、音乐理解等深度学★ 899
ditto-talkingheadDitto 是一个面向实时可控说话人头像合成的运动空间扩散模型,发表于 ACM MM 2025。它解决的是传统音频驱动肖像动画中动作僵硬、可控性差、实时性不足的★ 899
CraftsMan3DCraftsMan3D 是一个基于 3D 原生扩散模型的高保真网格生成工具,旨在解决从单张图片或文本描述生成高质量 3D 模型的问题。它通过 3D 原生扩散架构★ 831
DiT-ExtrapolationDiT-Extrapolation 是 ICML 2025 论文《RIFLEx: A Free Lunch for Length Extrapolation i★ 829
Paint3DPaint3D 是一个面向 3D 模型的纹理生成工具,由 CVPR 2024 论文提出。它解决的核心问题是:传统 3D 纹理生成往往依赖光照条件,导致生成的纹理★ 808
InfinityStarInfinityStar 是一个基于自回归模型的视觉生成框架,由 NeurIPS 2025 Oral 论文提出,核心思想是统一时空自回归建模(Unified S★ 788
Awesome-Model-Merging-Methods-Theories-Applications这是一个关于模型合并(Model Merging)的精选资源列表,收录了在大语言模型(LLM)、多模态大模型(MLLM)等领域中模型合并的方法、理论、应用与机遇★ 788
MagicDanceMagicDance(又称MagicPose)是一个基于扩散模型的人体姿态与面部表情重定向工具,由ICML 2024论文提出。它解决的是在保持人物身份特征(如面★ 778
texturizetexturize 是一个基于深度学习的命令行工具,用于从源图像生成照片级真实的纹理,并支持纹理的混搭、重制与变体创作。它解决的是设计师和开发者快速生成多样化纹★ 760
DiffusionFastForwardDiffusionFastForward 是一个面向扩散生成模型的开源课程与实验框架,旨在帮助学习者和开发者快速上手扩散模型。项目以 Jupyter Noteb★ 685
CopulasCopulas 是一个用于对多元数据进行建模的 Python 库,它基于 copula 理论(一种将变量间依赖结构与边缘分布分离的统计方法)来生成合成数据。它解★ 653
paint-with-words-sd这是一个基于Stable Diffusion的文本引导图像生成工具,实现了eDiff-I论文中的Paint-with-words方法。它允许用户通过文本标签化的★ 645
blended-latent-diffusionBlended Latent Diffusion 是 SIGGRAPH 2023 论文的官方实现,用于文本驱动的图像局部编辑。它解决的是传统扩散模型在编辑图像时★ 631
UniTokUniTok 是一个面向视觉生成与理解任务的统一分词器,由 NeurIPS 2025 Spotlight 论文提出。它解决了传统视觉分词器在生成任务(如自回归图★ 533
diffusion-explainerDiffusion Explainer 是一个交互式可视化工具,旨在帮助用户直观理解文本到图像生成模型(如 Stable Diffusion)的内部工作原理。它★ 499
DNA-DiffusionDNA-Diffusion 是一个将扩散概率模型应用于调控基因组学的开源项目,旨在生成具有特定调控特征的 DNA 序列。它解决了传统方法难以建模 DNA 序列复★ 489
LakonLabLakonLab 是一个专注于图像生成的开源项目,官方实现了 AsymFlow、pi-Flow 和 GMFlow 三种流匹配(Flow Matching)模型。★ 471
ladi-vtonLaDI-VTON 是一个基于潜在扩散模型(Latent Diffusion)的虚拟试穿项目,发表于 ACM MM 2023。它解决传统虚拟试穿中服装细节丢失、★ 465
InstructCVInstructCV 是一个基于指令微调文本到图像扩散模型的视觉通用框架,源自 ICLR 2024 论文。它旨在解决传统视觉模型任务单一、泛化能力弱的问题,通过★ 463
Video-P2PVideo-P2P 是一个基于 Stable Diffusion 的视频编辑工具,通过控制交叉注意力机制实现文本驱动的视频编辑。它解决了传统视频编辑需要逐帧处理★ 430
GaussianCubeGaussianCube 是 NeurIPS 2024 提出的结构化显式辐射场表示方法,旨在解决 3D 生成建模中隐式表示(如 NeRF)速度慢、显式表示(如点★ 428
Director3DDirector3D 是一个基于文本生成真实世界相机轨迹和 3D 场景的开源项目,来自 NeurIPS 2024 论文。它解决的是从单一文本描述直接合成动态 3★ 382
EscherNetEscherNet是一个基于生成模型的视图合成工具,由CVPR 2024作为Oral论文提出。它解决了从少量输入图像生成多视角一致新视图的问题,核心能力在于其可★ 381
DiffGAN-TTSDiffGAN-TTS 是一个基于 PyTorch 的文本转语音(TTS)实现,核心思想是结合扩散模型(Diffusion)和生成对抗网络(GAN),在保证高保★ 349
awesome-segment-anything-extensions这是一个精选列表,汇集了围绕 Meta 的 Segment Anything Model (SAM) 生态的各类扩展项目、工具和资源。它解决了 SAM 社区资源★ 348
PortaSpeechPortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Portable and High-★ 341
NeuralDialog-CVAENeuralDialog-CVAE 是卡内基梅隆大学赵天成等人发布的对话生成模型开源实现,对应 ACL 2017 论文。它基于条件变分自编码器(CVAE),将知★ 310
FireFlow-Fast-Inversion-of-Rectified-Flow-for-Image-Semantic-EditingFireFlow 是一个针对 FLUX-dev 模型的图像语义编辑加速方案,核心创新在于将传统需要数十步的扩散模型反演和编辑过程压缩至各 8 步,实现约 3 倍★ 295
joliGENjoliGEN 是一个基于 PyTorch 的生成式 AI 图像与视频工具集,融合了 GAN 和扩散模型,专注于解决真实世界中的图像生成与编辑问题。它提供图像到★ 289
MoDAMoDA 是一个基于多模态扩散架构的说话头生成(Talking Head Generation)项目。它解决的是如何从单张静态人像和一段音频,生成自然、逼真、口★ 274
TheChosenOneTheChosenOne 是论文《The Chosen One: Consistent Characters in Text-to-Image Diffusio★ 270
Animate3DAnimate3D是NeurIPS 2024收录的开源项目,旨在将任意静态3D模型动画化。它利用多视角视频扩散模型,从单张或少量视角的3D模型渲染图中生成连贯的★ 258
DrivingWorldDrivingWorld 是一个面向自动驾驶场景的世界模型构建项目,基于视频 GPT 架构生成驾驶视频。它解决的问题是:自动驾驶系统需要预测和理解未来道路场景,★ 245
DeceiveDDeceiveD 是 NeurIPS 2021 收录的少样本 GAN 训练方法,核心解决真实数据不足时 GAN 训练不稳定、易过拟合的问题。它提出自适应伪增强(★ 234
DiffusionFromScratchDiffusionFromScratch 是一个教学型开源项目,旨在用单个 Python 脚本从零重建 Stable Diffusion 模型,作为哈佛大学“M★ 229