transformers

本站收录 172 个带「transformers」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

generative-ai-for-beginners这是微软出品的面向初学者的生成式 AI 课程,共 21 节课,涵盖生成式 AI 的基础概念、提示工程、大语言模型、RAG、AI Agent 以及相关应用开发。课★ 120,786LLMs-from-scratch手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路★ 105,758LlamaFactory统一的 LLM 高效微调框架,支持 100+ 主流模型(LLM 与 VLM),集成 LoRA 等前沿技术,被 ACL 2024 收录,是微调领域最流行的开源工具★ 75,189ai-engineering-from-scratch这是一个面向AI工程师的免费开源课程,旨在帮助学习者从零开始掌握AI工程的核心技能。项目内容涵盖机器学习、深度学习、生成式AI、计算机视觉、大语言模型和智能体等★ 61,160vit-pytorchvit-pytorch 是一个基于 PyTorch 实现的 Vision Transformer(ViT)模型库,由 Phil Wang(lucidrains)★ 25,525peftPEFT 是一个专注于参数高效微调(Parameter-Efficient Fine-Tuning)的 Python 库,由 Hugging Face 团队维护★ 21,737ml-engineering这是一本面向机器学习工程师的开放书籍,系统梳理了大模型训练与推理全流程的工程实践。它解决的核心问题是:当模型规模从百万级跃升到百亿级时,硬件选型、分布式策略、性★ 19,062DocsGPTDocsGPT 是一个面向企业的私有 AI 平台,专注于智能文档问答与知识检索。它解决了企业内部文档分散、查找困难、信息利用率低的问题,通过自然语言交互,让用户★ 18,295Megatron-LMMegatron-LM 是 NVIDIA 主导的深度学习研究项目,专注于大规模 Transformer 模型的训练。它解决了在大规模分布式环境下训练千亿乃至万亿★ 18,031RWKV-LMRWKV-LM 是一个将循环神经网络(RNN)与 Transformer 优势结合的下一代语言模型架构,当前版本为 RWKV-7 Goose。它解决了传统 Tr★ 14,731txtaitxtai 是一个全栈 AI 框架,旨在将语义搜索、大语言模型编排和语言模型工作流整合到一个统一的工具中。它解决了从非结构化文本中高效检索信息、构建 RAG 应★ 12,988PaddleNLPPaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调★ 12,981speechbrainSpeechBrain 是一个基于 PyTorch 的开源语音工具包,旨在为语音识别、说话人识别、语音增强、语音分离、情感识别等多种语音任务提供统一、灵活且易用★ 11,848train-llm-from-scratch这是一个从零开始训练大型语言模型(LLM)的完整教程与工具集,旨在帮助开发者理解并实践LLM训练的全流程。项目覆盖了从数据下载、预处理、分词器训练、模型架构设计★ 11,753segmentation_models.pytorchsegmentation_models.pytorch 是一个基于 PyTorch 的语义分割模型库,提供 500+ 预训练骨干网络(涵盖卷积和 Transfo★ 11,749presidioPresidio 是一个开源的敏感数据检测与匿名化框架,用于在文本、图像和结构化数据中识别、脱敏、遮蔽和匿名化个人身份信息(PII)。它通过 NLP 实体识别、★ 11,095openvinoOpenVINO 是英特尔开源的 AI 推理优化与部署工具包,旨在帮助开发者将训练好的深度学习模型(如 PyTorch、TensorFlow、ONNX 等格式)★ 10,935RTranslatorRTranslator 是一款开源的 Android 实时翻译应用,完全在本地运行,无需联网,保护用户隐私。它利用 Meta 的 NLLB 模型和 ONNX R★ 10,469OpenRLHFOpenRLHF 是一个基于 Ray 的强化学习框架,专为大规模语言模型(LLM)的智能体训练而设计。它解决了传统 RLHF(人类反馈强化学习)流程中训练效率低★ 10,053inferenceXinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模★ 9,593SanaNVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像★ 9,163ipex-llmipex-llm 是英特尔推出的开源工具库,旨在加速本地大语言模型(LLM)的推理和微调。它支持在 Intel XPU(包括集成显卡、独立显卡如 Arc/Fle★ 8,853VARNeurIPS 2024 最佳论文奖的官方实现,提出视觉自回归建模(VAR),通过下一尺度预测生成图像,以超简单易用的方式达到超越扩散模型的最新效果,并揭示了视★ 8,733mlx-audio基于 Apple MLX 框架构建的语音库,集文本转语音、语音转文本与语音转语音于一体,可在 Apple Silicon 设备上高效运行。充分利用苹果芯片算力,★ 7,962SoupSoup 是一个用于微调大语言模型(LLM)的开源工具,它通过一个 YAML 配置文件即可完成整个微调流程,极大简化了操作。其核心亮点是采用“层流式训练”(La★ 7,822sdnextSD.Next:一站式 AI 生成图像与视频的 WebUI,集生成、打标与后期处理于一体,在 A1111 基础上持续进化,功能全面、社区活跃,是追求全能与稳定的★ 7,349argos-translateArgos Translate 是一个基于 Python 的开源离线翻译库,利用 OpenNMT 等神经网络模型实现高质量的机器翻译。它解决了在线翻译服务依赖网★ 6,519courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385chronos-forecastingChronos是一个基于Transformer架构的预训练时间序列预测模型库,由Amazon Science团队开发。它解决了传统时间序列预测模型需要针对每个数★ 5,926alignment-handbookalignment-handbook 是一个用于对齐语言模型(LM)与人类及 AI 偏好的开源工具箱,由 Hugging Face 团队维护。它提供了一套稳健、★ 5,684DALLE-pytorchDALLE-pytorch 是 OpenAI 文本生成图像模型 DALL-E 的 PyTorch 非官方实现,旨在复现其核心架构与训练流程。该项目解决的是研究者★ 5,625superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327transformerlab-appTransformer Lab 是一个面向 AI 研究者的开源研究环境,旨在让模型训练、评估和扩展变得无缝流畅,支持从本地硬件到 GPU 集群的灵活部署。它解决★ 5,195tiny-universetiny-universe 是一个以 Jupyter Notebook 形式呈现的大模型教学项目,旨在通过从零手搓的方式,帮助学习者深入理解大模型的内部工作原理★ 5,080AutoGPTQAutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降★ 5,067LLM-RL-VisualizedLLM-RL-Visualized 是一个专注于大语言模型(LLM)和强化学习(RL)算法可视化的开源项目,由《大模型算法》作者倾力打造。项目提供了100多张原★ 4,922Learn_PromptingLearn_Prompting 是一个专注于提示工程(Prompt Engineering)、生成式 AI 和大语言模型(LLM)的开源学习指南。它由 Lear★ 4,740PromptifyPromptify 是一个专注于提示工程(Prompt Engineering)的 Python 库,旨在帮助开发者更高效地使用 GPT 等大语言模型,并获取结★ 4,641deep-dazedeep-daze 是一个基于 OpenAI CLIP 和 Siren 隐式神经表示网络的命令行工具,用于将文本描述转化为图像。它解决了文本到图像生成中语义对齐★ 4,314SwanLabSwanLab 是一个开源、现代设计的 AI 训练跟踪与可视化工具,支持云端和自托管两种使用方式。它解决了深度学习训练过程中实验管理混乱、指标监控不便、结果对比★ 4,235spark-nlpspark-nlp 是一个基于 Apache Spark 和 Spark ML 构建的自然语言处理库,提供生产级、可扩展的 NLP 解决方案。它解决了在大数据环★ 4,158scenicScenic 是 Google 开源、基于 JAX 的计算机视觉研究库,目标是为视觉任务提供一套干净、模块化且高性能的训练与推理框架。它解决的是研究代码重复造轮★ 3,839loraxLorax 是一个专为大规模多 LoRA 推理而设计的高性能服务器,能够同时承载数千个微调后的 LLM。它解决了传统推理服务中每个微调模型需要独立部署、资源消耗★ 3,834how-to-train-your-gpt这是一个从零开始构建现代大语言模型(LLM)的教学项目,以Jupyter Notebook形式呈现,每一行代码都有详细注释,并用通俗易懂的方式解释,适合初学者和★ 3,569scikit-llmscikit-llm 是一个将大语言模型无缝集成到 scikit-learn 生态的开源 Python 库。它解决了传统机器学习流程中难以直接调用 LLM 的问★ 3,534Torch-PruningTorch-Pruning 是一个基于 PyTorch 的结构化剪枝工具库,核心实现 CVPR 2023 论文 DepGraph(依赖图)算法,旨在解决传统剪枝★ 3,358llm-guardllm-guard 是一个面向大语言模型交互的安全工具包,旨在检测和缓解各类安全威胁,如提示注入、越狱攻击、敏感信息泄露等。它通过输入输出验证、内容过滤、异常检★ 3,212whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850dalle-playgrounddalle-playground 是一个基于 Web 的文本生成图像交互界面,最初支持 DALL-E Mini,现已转向 Stable Diffusion。它解★ 2,738