attention-mechanism
本站收录 31 个带「attention-mechanism」标签的 AI 开源项目
LLMs-from-scratch手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路★ 105,758
vit-pytorchvit-pytorch 是一个基于 PyTorch 实现的 Vision Transformer(ViT)模型库,由 Phil Wang(lucidrains)★ 25,525
RWKV-LMRWKV-LM 是一个将循环神经网络(RNN)与 Transformer 优势结合的下一代语言模型架构,当前版本为 RWKV-7 Goose。它解决了传统 Tr★ 14,731
DALLE-pytorchDALLE-pytorch 是 OpenAI 文本生成图像模型 DALL-E 的 PyTorch 非官方实现,旨在复现其核心架构与训练流程。该项目解决的是研究者★ 5,625
RuVectorRuVector 是一个用 Rust 构建的高性能实时向量数据库,专为 AI 应用设计,集成了图神经网络(GNN)和记忆数据库能力。它解决了传统向量数据库在实时★ 4,527
how-to-train-your-gpt这是一个从零开始构建现代大语言模型(LLM)的教学项目,以Jupyter Notebook形式呈现,每一行代码都有详细注释,并用通俗易懂的方式解释,适合初学者和★ 3,569
awesome-speech-recognition-speech-synthesis-papers这是一个收录语音识别与语音合成领域经典论文的精选列表,涵盖自动语音识别(ASR)、说话人验证、语音合成、文本转语音(TTS)、语言建模、歌声合成(SVS)和声音★ 3,132
whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850
llm-internalsllm-internals 是一个循序渐进讲解大语言模型内部原理的开源教程项目,覆盖从分词、注意力机制到推理优化的完整技术链路。它通过图文、代码示例和逐步拆解的★ 1,716
Transformer-TTSTransformer-TTS 是一个基于 PyTorch 实现的文本转语音(TTS)项目,对应论文《Neural Speech Synthesis with ★ 694
metal-flash-attentionmetal-flash-attention 是一个基于 Apple Metal 高性能计算框架的 FlashAttention 移植实现,专为在 Apple 芯★ 612
zetazeta 是一个基于 PyTorch 的模块化 AI 模型构建库,旨在帮助开发者快速搭建高性能的对话助手和大语言模型。它提供了类似乐高积木的组件,包括注意力机制★ 604
TokenFormerTokenFormer 是一个在 ICLR 2025 上获得 Spotlight 的 Transformer 架构改进方案,核心思想是将模型参数也视为 toke★ 596
nuwa-pytorchNUWA(女娲)是微软提出的多模态预训练模型,支持文本到视频、文本到图像及视频预测等任务。此项目为NUWA的PyTorch非官方实现,基于3D Transfor★ 547
parti-pytorchParti是一个基于纯注意力机制(Transformer)的文本生成图像模型,由Google Research提出。该项目是Parti的PyTorch非官方实现★ 536
Awesome-Attention-Heads这是一个关于大语言模型注意力头可解释性的精选资源库与综述项目。它系统性地整理了针对LLM中注意力头(attention heads)的解读、分析和可视化相关的研★ 416
Star-AttentionStar-Attention 是一个面向大语言模型长序列推理的高效注意力机制实现。它通过将标准注意力分解为星形拓扑结构,显著降低长序列下的计算和内存开销,从而加★ 392
seq2seq_chatbot这是一个基于TensorFlow实现的seq2seq对话系统,使用经典的编码器-解码器架构,并集成了注意力机制和束搜索(beam search)解码策略。项目以★ 335
ttslearnttslearn 是一个面向 Python 学习者的语音合成(Text-to-Speech)教学库,由日本学者开发,配套书籍《Pythonで学ぶ音声合成》使用。★ 269
transformers-explainedtransformers-explained 是一个以教学为导向的开源项目,旨在通过逐步拆解的方式,深入浅出地解释 Transformer 架构的每一个细节。它★ 218
small-dogesmall-doge 是一个早期开源的轻量级语言模型家族项目,旨在提供高效、易部署的小规模语言模型。它解决了大模型资源消耗高、部署门槛高的问题,通过精简架构和优★ 200
LLM-DropLLM-Drop 是论文《Uncovering the Redundancy in Transformers via a Unified Study of La★ 192
Attention-SinkAttention-Sink 是 ICLR 2025 的 Spotlight 论文官方实现,从实证角度研究语言模型中注意力汇聚(attention sink)现★ 164
seq2seq_chatbot_new这是一个基于TensorFlow实现的seq2seq对话系统,使用Cornell Movie Dialogs数据集训练。它实现了经典的编码器-解码器架构,并集成★ 145
simple-diffusionsimple-diffusion 是一个用 PyTorch 实现的最小化去噪扩散模型,旨在以极简代码展示扩散模型的核心原理。它解决了初学者理解扩散模型门槛高的问★ 137
Transformer-in-generating-dialogue这是一个基于Tensor2Tensor框架实现的Transformer对话生成模型,使用中文语料训练,旨在复现'Attention is all you nee★ 131
RQ-TransformerRQ-Transformer 是论文《Autoregressive Image Generation using Residual Quantization》的★ 128
TacotronTacotron 是一个基于 PyTorch 实现的端到端文本转语音(TTS)系统,专注于长句语音合成的鲁棒性。它实现了位置相对注意力机制(Location-R★ 115
setvaeSetVAE 是一个基于 PyTorch 的生成模型实现,来自 CVPR 2021 论文,专门针对集合结构数据(如点云、物体集合)进行层次化组合建模。它解决的是★ 80
ovamovam 是 CVPR 2024 论文的开源实现,旨在解决扩散模型在语义分割任务中应用时注意力图不准确的问题。它通过优化文本 token 来生成开放词汇的注意力★ 70
CausalMMCausalMM 是一个针对多模态大语言模型(MLLM)幻觉问题的开源项目,发表于 ICLR 2025。它主要解决因模态先验(如文本先验)导致的幻觉,即模型在生★ 67