deep-learning
本站收录 773 个带「deep-learning」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817
stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151
LLMs-from-scratch手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路★ 105,758
opencvOpenCV(Open Source Computer Vision Library)是一个开源的计算机视觉和机器学习软件库,提供超过2500种优化算法,涵盖图★ 91,011
cs-video-courses这是一个精心整理的计算机科学视频课程清单,收录了全球顶尖大学和机构的免费视频讲座,涵盖算法、人工智能、系统、理论、生物信息学、计算物理等广泛领域。项目解决了计算★ 83,580
Prompt-Engineering-GuidePrompt-Engineering-Guide 是一个系统化的提示工程指南库,汇集了论文、教程、笔记本和资源,覆盖提示工程、上下文工程、RAG 和 AI Ag★ 78,724
AI-For-Beginners微软出品的AI入门教程,专为初学者设计,用12周24课时的结构系统讲解人工智能核心知识。课程覆盖神经网络基础、计算机视觉(CNN)、自然语言处理(RNN)、生成★ 69,261
ultralyticsUltralytics 是计算机视觉领域最流行的开源工具包,提供 YOLO 系列目标检测模型(包括 YOLOv8、YOLO11 及最新的 YOLO26)的一站式★ 62,103
ai-engineering-from-scratch这是一个面向AI工程师的免费开源课程,旨在帮助学习者从零开始掌握AI工程的核心技能。项目内容涵盖机器学习、深度学习、生成式AI、计算机视觉、大语言模型和智能体等★ 61,160
Real-Time-Voice-CloningReal-Time-Voice-Cloning 是一个基于深度学习的实时语音克隆工具,能在5秒内克隆任意说话人的声音,并生成任意文本的语音。它解决了传统TTS需★ 60,156
yolov5YOLOv5 是 Ultralytics 团队开发的基于 PyTorch 的目标检测框架,是目前计算机视觉领域最流行的开源项目之一。它解决了实时目标检测、实例分★ 58,097
supervisionsupervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者在目标检测、分割、分类等任务中重复编写样板代码的问题,提★ 51,079
Made-With-ML一套面向生产级机器学习应用的完整学习课程,手把手教你如何开发、部署并持续迭代 ML 应用。内容覆盖从实验到上线的全流程实践,配有代码示例,适合希望系统掌握工程化★ 49,652
TTS面向文本转语音的深度学习工具包,历经研究与生产环境双重考验。支持多语言、多语音模型,提供丰富的预训练模型与训练接口,既能快速搭建 TTS 服务,也能满足深入探索★ 46,083
streamlitStreamlit 是一个开源的 Python 应用框架,专为数据科学家和机器学习工程师设计,旨在将数据脚本快速转化为可交互的 Web 应用。它解决了传统数据应★ 45,850
rayRay 是一个面向 AI 计算的分布式引擎,由核心分布式运行时和一组 AI 库组成,用于加速机器学习工作负载。它解决了大规模分布式训练、调参、推理和服务部署中的★ 43,949
ColossalAIColossalAI是一个旨在降低大型AI模型使用门槛的开源项目,专注于让大模型的训练、微调和推理更便宜、更快速、更易获取。它解决了大模型开发中显存不足、训练效★ 41,445
mediapipeMediaPipe 是 Google 开源的跨平台机器学习解决方案框架,专为实时和流媒体场景设计。它解决的是开发者难以高效构建、部署和优化多模态 ML 应用的问★ 37,118
500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code这是一个收录了约500个AI、机器学习、深度学习、计算机视觉和自然语言处理项目的代码合集仓库,本质上是面向学习者和开发者的资源索引。它解决的核心问题是:初学者面★ 37,051
MockingBird只需 5 秒即可克隆一个声音,实现任意文本的实时语音合成。项目基于 PyTorch,提供训练与推理全流程支持,声音相似度高、合成速度快,非常适合语音克隆研究与实★ 36,902
diffusersHugging Face 官方出品的扩散模型工具库,基于 PyTorch,提供图像、视频、音频生成领域最先进的扩散模型,接口统一、开箱即用,是研究与生产环境中最★ 34,633
label-studio支持多类型数据标注的开源工具,覆盖图像、文本、音频、视频等多种数据格式,输出格式标准化,方便直接对接模型训练流程。提供灵活的标注界面、协作审核机制与丰富的集成能★ 28,371
pytorch-CycleGAN-and-pix2pixPyTorch 实现的经典图像到图像转换框架,包含 pix2pix 与 CycleGAN 两大模型,支持风格迁移、图像修复、超分辨率等任务,是学习与复现 GAN★ 25,254
CV这是一份已完结的深度学习综合学习笔记,整合了多个知名课程的精髓,包括土堆的Pytorch教程、李沐的《动手学深度学习》、吴恩达的《深度学习》以及大飞的《大模型A★ 23,851
best-of-ml-python这是一个精选的机器学习Python库排行榜,每周自动更新,按GitHub星标数排序,帮助开发者快速发现和评估优秀的ML工具。它解决了机器学习生态中库数量庞大、质★ 23,828
learnopencvLearn OpenCV 是一个专注于 OpenCV 与计算机视觉教学的开源项目,由 Satya Mallick 等人维护,提供大量 C++ 和 Python ★ 23,171
datasetsdatasets 是 Hugging Face 推出的开源数据集库,旨在成为 AI 模型就绪数据集的中心枢纽。它解决了机器学习从业者在数据获取、处理和加载过程中★ 22,016
serve基于云原生技术栈构建多模态 AI 应用的框架,让开发者可以像搭积木一样编排微服务化的 AI 流水线。它天然支持文本、图像、音视频等多种模态的模型编排与扩展,配合★ 21,864
machine-learning-for-trading这是一个与《Machine Learning for Trading》第三版配套的开源代码仓库,旨在帮助读者和开发者系统学习如何将机器学习技术应用于金融交易。项★ 21,121
awesome-production-machine-learning这是一个精选清单,汇集了部署、监控、版本管理和扩展机器学习系统的开源工具与库。它解决了机器学习模型从实验到生产落地过程中工具分散、选型困难的问题,帮助工程师和数★ 20,963
ai-guide这是一个面向开发者和AI爱好者的开源知识库与导航站,由程序员鱼皮维护。项目核心是提供从入门到进阶的AI学习路径,涵盖Vibe Coding零基础教程、OpenC★ 20,588
web-llmweb-llm 是一个高性能的浏览器端大语言模型推理引擎,基于 WebGPU 和 TVM 技术,让 LLM 无需服务器即可直接在浏览器中运行。它解决了传统 LL★ 19,205
camelCAMEL 是一个多智能体框架,旨在通过角色扮演和任务导向的对话,让多个 AI 智能体协同解决复杂问题。它解决了单智能体在复杂任务中能力受限的问题,通过定义不同★ 17,797
Auto-claude-code-research-in-sleepARIS(睡眠中自动研究):基于纯 Markdown 的轻量级技能集,支持跨模型评审循环、想法发现与实验自动化,无框架锁定,兼容 Claude Code、Cod★ 16,824
cvatCVAT(Computer Vision Annotation Tool)是一个开源的计算机视觉标注平台,旨在帮助AI团队高效构建高质量视觉数据集。它解决了从原★ 16,821
leedl-tutorial《李宏毅深度学习教程》是Datawhale社区维护的开源教材,源自台湾大学李宏毅老师的深度学习课程。该项目将课程内容整理为Jupyter Notebook格式,★ 16,787
labelmelabelme 是一个基于 Python 的图像标注工具,主要用于计算机视觉和深度学习任务中的数据准备。它解决了研究人员和开发者需要手动标注图像以构建训练数据集★ 16,201
MNNMNN是阿里巴巴开源的一款轻量级深度学习推理引擎,专注于移动端和边缘设备的高性能模型推理。它解决了在资源受限的设备上高效运行AI模型的问题,支持TensorFl★ 16,157
stable-diffusion-webui-colabstable-diffusion-webui-colab 是一个基于 Google Colab 的 Stable Diffusion WebUI 一键部署方案。★ 15,915
nano-vllmnano-vllm 是一个轻量级的大语言模型推理引擎,旨在以极简的代码实现 vLLM 的核心功能。它解决了 vLLM 等大型推理框架依赖重、部署复杂的问题,让开★ 15,661
unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519
vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157
RWKV-LMRWKV-LM 是一个将循环神经网络(RNN)与 Transformer 优势结合的下一代语言模型架构,当前版本为 RWKV-7 Goose。它解决了传统 Tr★ 14,731
dlibdlib 是一个用 C++ 编写的现代机器学习工具包,旨在帮助开发者构建真实世界的机器学习和数据分析应用。它解决了从算法原型到产品部署过程中的工程化难题,提供了★ 14,453
carlaCARLA 是一个开源的自动驾驶研究模拟器,基于 C++ 和虚幻引擎构建,提供高保真的城市环境、车辆动力学、传感器模拟(如摄像头、激光雷达)以及交通流控制。它解★ 14,443
nni微软开源的 AutoML 工具包,覆盖机器学习生命周期的自动化,包括特征工程、神经网络架构搜索、模型压缩与超参调优等环节。借助丰富的搜索算法与可视化面板,帮助团★ 14,364
open_clipOpen_CLIP 是 CLIP 模型的开源实现,由 LAION 等社区维护,旨在复现并扩展 OpenAI 的 CLIP 模型。它解决了 CLIP 原始代码未开★ 14,174
litgptLitGPT 是一个基于 PyTorch 的高性能大语言模型(LLM)训练与部署框架,由 Lightning AI 团队开发。它内置了 20 多种主流 LLM ★ 13,687
pytorch-grad-campytorch-grad-cam 是一个用于计算机视觉模型可解释性的高级工具库,基于 PyTorch 实现 Grad-CAM 及其多种变体。它解决了深度学习模型★ 12,984
deep-learning-drizzle这是一个深度学习相关学习资源的精选合集,汇集了全球顶尖大学和机构的免费视频讲座,覆盖深度学习、强化学习、机器学习、计算机视觉和自然语言处理等核心领域。项目以分类★ 12,956