transformer
本站收录 147 个带「transformer」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817
vllm面向 LLM 的高吞吐、内存高效的推理与 serving 引擎,支持 PagedAttention 等核心技术,是大规模模型部署与在线服务的事实标准之一。★ 92,945
whisper.cppwhisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 ★ 54,014
sglangSGLang 是一个高性能的大语言模型和多模态模型服务框架,旨在解决 LLM 推理服务中吞吐量低、延迟高、显存利用率不足等问题。它通过 RadixAttenti★ 36,594
fish-speechfish-speech 是一个开源的文本转语音(TTS)模型,基于 VQGAN 和 Llama 架构,实现了目前最先进的语音合成效果。它解决了传统 TTS 系统★ 32,888
hereticheretic 是一个针对语言模型的全自动审查移除工具,旨在消除模型输出中的内容限制。它通过分析模型内部机制,自动识别并绕过安全过滤层,使模型能够生成未经过滤的★ 32,529
best-of-ml-python这是一个精选的机器学习Python库排行榜,每周自动更新,按GitHub星标数排序,帮助开发者快速发现和评估优秀的ML工具。它解决了机器学习生态中库数量庞大、质★ 23,828
leedl-tutorial《李宏毅深度学习教程》是Datawhale社区维护的开源教材,源自台湾大学李宏毅老师的深度学习课程。该项目将课程内容整理为Jupyter Notebook格式,★ 16,787
MNNMNN是阿里巴巴开源的一款轻量级深度学习推理引擎,专注于移动端和边缘设备的高性能模型推理。它解决了在资源受限的设备上高效运行AI模型的问题,支持TensorFl★ 16,157
nano-vllmnano-vllm 是一个轻量级的大语言模型推理引擎,旨在以极简的代码实现 vLLM 的核心功能。它解决了 vLLM 等大型推理框架依赖重、部署复杂的问题,让开★ 15,661
RWKV-LMRWKV-LM 是一个将循环神经网络(RNN)与 Transformer 优势结合的下一代语言模型架构,当前版本为 RWKV-7 Goose。它解决了传统 Tr★ 14,731
FreeTokenFreeToken 是一个面向桌面的数据中心级模型推理引擎,旨在让个人电脑也能高效运行大规模模型。它解决了本地设备算力有限、无法流畅运行大模型的问题,通过优化的★ 13,975
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
petalsPetals 是一个去中心化的 LLM 推理与微调框架,采用 BitTorrent 风格的点对点网络,将大型语言模型(如 Llama、Falcon、BLOOM)★ 10,592
manga-image-translatormanga-image-translator 是一个基于深度学习的漫画/图片文字翻译工具,能够自动检测图片中的文字区域,识别原文(主要支持日文、英文等),并翻译★ 10,454
kimi-k3-in-ckimi-k3-in-c 是一个用纯 C99 语言实现的 Kimi K3 模型推理引擎,它声称能在单颗 CPU 上、仅用 8.24 GB 内存运行一个 2.78★ 8,795
LMFlowLMFlow 是一个面向大型基础模型的高可扩展微调与推理工具包,旨在让每个人都能轻松使用和定制大模型。它解决了大模型微调门槛高、资源消耗大、流程复杂的问题,提供★ 8,486
vllm-omni面向全模态模型的统一高效推理框架,支持文本、图像、视频、音频等多种模态的高性能推理,延续 vLLM 的工程优势,为多模态大模型应用提供稳定快速的部署方案。★ 7,135
MindSearchMindSearch 是一个基于大语言模型的多智能体 Web 搜索引擎框架,目标是打造类似 Perplexity.ai Pro 和 SearchGPT 的 AI★ 6,931
cactuscactus 是一个专为移动设备、可穿戴设备、智能家居和机器人等边缘场景设计的轻量级 AI 推理引擎。它解决了在资源受限的硬件上高效运行深度学习模型的问题,核心★ 6,080
semantic-routersemantic-router 是一个用 Go 编写的可编程混合模型路由器,专为异构 LLM 推理场景设计。它解决的核心问题是:当企业或开发者需要同时调用多个不★ 5,980
wenetWeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于 PyTorch 构建,支持 Conformer、Transf★ 5,243
AutoGPTQAutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降★ 5,067
AIGC-Interview-Book《三年面试五年模拟》是一份面向AIGC、LLM大模型、AI Agent算法工程师的面试准备资料集,由社区维护并持续更新。它系统整理了AI行业面试笔试中的核心知识★ 4,854
beataibeatai 是一份面向大众的 AI 入门学习资料,以 JavaScript 为主要示例语言,从神经网络基础讲到大型语言模型,覆盖顶层设计、微观原理、工程实现和★ 4,720
towheeTowhee 是一个专注于神经数据处理的 Python 框架,旨在让构建和运行 AI 驱动的数据管道变得简单高效。它解决的是从原始数据(文本、图像、音视频等)到★ 3,450
GPAGPA(General Purpose Audio)是一个基于Transformer的通用音频模型,由AutoArk团队开发,旨在用单一小型模型同时实现自动语音★ 3,107
vllm-ascendvllm-ascend 是 vLLM 在华为昇腾(Ascend)硬件上的社区维护插件,旨在让 vLLM 这一主流大模型推理框架能够无缝运行在昇腾 NPU 上。它★ 2,911
ai-engineering-resources这是一个面向AI工程师的学习资源合集,汇集了研究论文和博客文章,旨在帮助开发者从传统软件工程过渡到AI工程领域。项目解决了AI工程化过程中知识分散、缺乏系统路径★ 2,653
mPLUG-OwlmPLUG-Owl是阿里巴巴达摩院开发的多模态大语言模型家族,旨在让AI同时理解文本和图像,并基于指令进行对话。它解决了传统语言模型只能处理文本、无法理解视觉信★ 2,539
EasyLMEasyLM 是一个基于 JAX/Flax 构建的大语言模型(LLM)一站式解决方案,旨在简化 LLM 的预训练、微调、评估和部署流程。它解决了 LLM 开发中★ 2,516
MoBAMoBA 是一种面向长上下文大语言模型的新型注意力机制,核心思想是将输入序列划分为多个块,并采用混合专家(MoE)的思路,让每个查询只关注最相关的少数块,从而将★ 2,191
Awesome-LLM-Long-Context-ModelingAwesome-LLM-Long-Context-Modeling 是一个精选资源列表,聚焦于大语言模型的长上下文建模技术。它系统整理了相关论文、博客和开源工具★ 2,175
aiciAICI(Artificial Intelligence Controller Interface)是一个开源框架,它提出了一种全新的与大语言模型交互的方式:将★ 2,076
FireRedASRFireRedASR 是一个开源的工业级自动语音识别(ASR)模型,主要面向中文普通话、中文方言和英语的语音转文字场景。它解决了传统ASR模型在中文方言和复杂音★ 1,996
graph-fraud-detection-papers这是一个精选的图神经网络与Transformer在欺诈检测、异常检测和离群点检测领域的论文与资源列表。项目系统整理了基于图结构(如GNN、Graph Trans★ 1,897
LLMCompilerLLMCompiler 是一个面向大语言模型(LLM)的函数调用并行化框架,源自 ICML 2024 论文。它借鉴传统编译器思想,将复杂的多步骤任务分解为依赖图★ 1,890
nndeploynndeploy 是一款专注于 AI 模型部署的 C++ 框架,旨在解决深度学习模型从训练到生产环境落地时面临的碎片化问题。它提供统一的推理接口,屏蔽了不同后端★ 1,882
ru-dalleru-dalle 是一个基于俄语的文本生成图像项目,旨在让俄语用户能够使用自然语言描述生成高质量的图像。它解决了 OpenAI DALL-E 模型主要支持英语、★ 1,640
torchdistilltorchdistill 是一个基于 PyTorch 的免编码深度学习框架,专注于知识蒸馏(Knowledge Distillation)研究。它解决了知识蒸馏★ 1,633
safe-rlhfSafe RLHF 是一个基于安全强化学习的人类反馈对齐框架,旨在解决大模型价值对齐中的安全问题。传统 RLHF 通过人类反馈优化模型行为,但可能忽略安全约束,★ 1,618
VibeThinkerVibeThinker是一个基于多样性驱动优化的小型语言模型项目,核心目标是在1.5B参数规模下实现接近大型模型的推理能力。它通过创新的训练策略,让小型模型在逻★ 1,579
ai-hands-on这是一个面向AI初学者的实践学习仓库,包含一系列Jupyter Notebook和辅助文件,旨在帮助用户从零开始学习人工智能。项目覆盖了机器学习、神经网络、Tr★ 1,449
diy-llmdiy-llm 是 Datawhale 社区推出的开源大模型全栈学习项目,面向想从零理解并动手实现 LLM 的开发者与学习者。它把大模型知识拆成预训练数据、To★ 1,426
parallaxParallax 是一个分布式模型推理框架,旨在帮助用户在任何地方构建自己的 AI 集群。它通过将多个计算节点(如 GPU 服务器)聚合起来,统一调度和管理大语★ 1,392
TinyEngramTinyEngram 是一个基于 Qwen-3 和 Stable Diffusion 系列模型的研究项目,旨在复现并验证 DeepSeek 的 Engram 架★ 1,376
Large-Time-Series-ModelTimer 是一个面向时间序列预测的大规模预训练模型项目,由 ICML 2024 论文团队开源。它解决传统时间序列模型难以跨领域泛化、需要针对每个数据集单独训练★ 1,020
Cognitive-Speech-TTS这是微软官方提供的文本转语音(TTS)示例代码集,涵盖多种编程语言,属于Azure认知服务的一部分。它主要解决开发者快速接入微软神经TTS能力的问题,包括标准语★ 1,014
rasa_chatbot_cn这是一个基于 Rasa 最新版本搭建的中文对话系统示例项目,主要解决中文场景下快速构建任务型聊天机器人的问题。项目整合了 BERT 中文预训练模型用于意图分类和★ 983
athenaAthena 是一个基于序列到序列(seq2seq)架构的开源语音处理引擎,专注于语音识别(ASR)和语音合成(TTS)两大核心任务。它采用 C++ 实现,提供★ 967