autoregressive-models
本站收录 12 个带「autoregressive-models」标签的 AI 开源项目
VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733
InfinityInfinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建★ 1,589
Causal-ForcingCausal-Forcing 是 ICML 2026 论文的官方代码库,提出了一种自回归扩散模型的蒸馏方法,旨在实现高质量、实时的交互式视频生成。它解决了传统扩★ 983
InfinityStarInfinityStar 是一个基于自回归模型的视觉生成框架,由 NeurIPS 2025 Oral 论文提出,核心思想是统一时空自回归建模(Unified S★ 788
NOVANOVA 是一个面向图像与视频生成的自回归模型开源项目,核心创新在于摒弃了传统自回归生成中必需的向量量化(VQ)步骤,直接对连续特征进行建模。该项目由论文《Au★ 661
LiquidLiquid 是一个基于大型语言模型的可扩展统一多模态生成框架,已被 IJCV 接收。它旨在解决传统扩散模型在图像生成中步骤多、速度慢,且难以与语言模型统一的问★ 640
UniTokUniTok 是一个面向视觉生成与理解任务的统一分词器,由 NeurIPS 2025 Spotlight 论文提出。它解决了传统视觉分词器在生成任务(如自回归图★ 533
VibeVoiceFusionVibeVoiceFusion 是一个基于微软 VibeVoice(自回归+扩散架构)的全栈多说话人语音合成 Web 系统。它主要解决自建 TTS 系统时面临的★ 490
ImageFolderImageFolder 是一个面向自回归(AR)和变量自回归(VAR)图像生成模型的高性能图像分词器。它解决了传统图像生成中像素级建模效率低、难以捕捉全局结构的★ 307
SSR-SpeechSSR-Speech 是一个面向零样本语音编辑与合成的开源项目,旨在解决现有语音编辑和合成技术中稳定性、安全性和鲁棒性不足的问题。它基于音频编解码器(audio★ 159
LightGenLightGen 是一个高效的文本到图像生成预训练流水线,专注于解决图像生成模型训练成本高、效率低的问题。它结合了自回归模型和扩散模型的优势,提供了一套完整的预★ 132
BitVAEBitVAE 是一个图像分词器(tokenizer)的官方训练与推理代码库,属于自回归图像生成模型的基础组件。它通过将图像编码为离散的比特级 token,替代传★ 72