deep-neural-networks

本站收录 39 个带「deep-neural-networks」标签的 AI 开源项目

learnopencvLearn OpenCV 是一个专注于 OpenCV 与计算机视觉教学的开源项目,由 Satya Mallick 等人维护,提供大量 C++ 和 Python ★ 23,171vosk-apivosk-api 是一个离线语音识别 API,支持 Android、iOS、Raspberry Pi 和服务器端,提供 Python、Java、C# 和 Nod★ 15,157deep-learning-drizzle这是一个深度学习相关学习资源的精选合集,汇集了全球顶尖大学和机构的免费视频讲座,覆盖深度学习、强化学习、机器学习、计算机视觉和自然语言处理等核心领域。项目以分类★ 12,956techniques这是一个专注于卫星与航空影像深度学习技术的开源项目,汇集了针对地球观测数据的卷积神经网络、数据集构建、图像分类等核心方法。它解决了遥感领域缺乏系统化深度学习实践★ 10,269neural-doodle基于深度神经网络与语义风格迁移的涂鸦作画工具,可将简单涂鸦变成精致画作,支持照片无缝纹理生成、图像风格迁移与样例放大,趣味性与实用性兼备。★ 9,851notebooks这是一个计算机视觉领域的教程合集,基于 Jupyter Notebook 编写,旨在帮助开发者从基础到前沿系统学习视觉模型与技术。项目覆盖了从 ResNet 等★ 9,696DeepPavlovDeepPavlov 是一个开源的深度学习对话系统库,旨在帮助开发者和研究人员快速构建端到端的聊天机器人和对话助手。它解决了从零搭建对话系统时面临的工程复杂性和★ 6,995courses这是一个精选的AI学习资源集合,收录了关于人工智能、机器学习、深度学习、计算机视觉、自然语言处理、多模态、生成模型和MLOps等领域的课程与资料链接。项目以Ma★ 6,487sportssports 是一个专注于计算机视觉在体育领域应用的开源项目,主要解决体育视频和图像中的目标检测、关键点检测、球员追踪、动作识别等问题。项目以足球为主要场景,提★ 5,395CTranslate2CTranslate2 是一个专为 Transformer 类模型设计的高性能推理引擎,用 C++ 编写,支持 CPU(含 AVX、AVX2、NEON 等指令集★ 4,690LLMBook-zh.github.io《大语言模型》是一本由中国人民大学赵鑫教授团队编写的中文开源教材,旨在系统性地介绍大语言模型的技术原理、架构设计与应用实践。全书覆盖从基础概念到前沿进展的完整知★ 4,584BitNetBitNet 是微软论文《BitNet: Scaling 1-bit Transformers for Large Language Models》的 PyTo★ 1,946DoRADoRA(权重分解低秩适配)是ICML 2024口头报告论文的官方PyTorch实现,一种参数高效微调方法。它通过将预训练权重分解为幅度和方向两个分量,并对方向★ 1,000vision_pilotvision_pilot 是一个免费且完全开源的 L2 级高级驾驶辅助系统(ADAS)软件栈,采用端到端人工智能技术驱动。它旨在为开发者、研究人员和汽车爱好者提★ 905MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597DigiHumanDigiHuman 是一个基于 C# 的 3D 角色自动动画框架,利用姿态估计和地标生成技术,将单目摄像头或视频中的人体动作实时映射到 3D 模型上。它解决了传★ 588StyleSwinStyleSwin 是一个基于 Transformer 的高分辨率图像生成模型,发表于 CVPR 2022。它针对传统 GAN 在生成高分辨率图像时依赖卷积结构★ 543fsdl-text-recognizer-2022-labs这是一个完整的深度学习项目,源自 Full Stack Deep Learning 2022 课程的实验代码,用于构建文本识别系统。项目解决了从零开始搭建生产级★ 531speech_datasetspeech_dataset 是一个面向语音识别(ASR)研究的中文语音数据集仓库,旨在为深度学习语音模型提供训练与评估所需的音频资源。项目整理了多种来源的语音★ 471webcam-pix2pix-tensorflowwebcam-pix2pix-tensorflow 是一个基于 TensorFlow 的实时图像转换项目,它利用 pix2pix 生成对抗网络,将摄像头实时画面★ 361DiffGAN-TTSDiffGAN-TTS 是一个基于 PyTorch 的文本转语音(TTS)实现,核心思想是结合扩散模型(Diffusion)和生成对抗网络(GAN),在保证高保★ 349PortaSpeechPortaSpeech 是一个基于 PyTorch 的非自回归文本转语音(TTS)实现,源自论文《PortaSpeech: Portable and High-★ 341Machine-Learning-Goodness这是一个面向机器学习与深度学习学习者的综合资源库,收录了ML/DL项目、Jupyter Notebook教程、速查表(cheat codes)、AI/AGI实用★ 286fusion_benchFusionBench 是一个专注于深度模型融合的综合性基准测试与工具包。它解决了深度学习领域中多个独立训练模型如何高效、有效地融合成一个更强大模型的问题,旨在★ 240Matlab-GANMatlab-GAN 是一个基于 MATLAB 实现多种生成对抗网络(GAN)的开源项目,涵盖从基础 GAN 到 Pixel2Pixel、CycleGAN 等经★ 209Cross-Speaker-Emotion-Transfer这是一个基于PyTorch实现的跨说话人情感迁移语音合成项目,源自字节跳动的研究成果。它解决的核心问题是:在文本到语音(TTS)合成中,如何让一个说话人的声音表★ 193polynomial_netsΠ-nets(多项式神经网络)是CVPR'20论文的官方实现,并扩展至T-PAMI-21版本。该项目旨在用多项式函数替代传统神经网络中的非线性激活和权重组合,通★ 174NLP-pretrained-model这是一个自然语言处理预训练模型的集合仓库,收录了基于Keras、MXNet等深度学习框架的多种预训练模型,涵盖词向量、句向量、文本分类等常见NLP任务。项目旨在★ 169awesome-ai-cybersecurity这是一个专注于AI与网络安全交叉领域的精选资源清单,旨在为安全从业者、研究人员和爱好者提供高质量、组织良好的学习与工具集合。项目解决了该领域信息分散、资源难找的★ 156GraspGPT_publicGraspGPT_public 是 GraspGPT 和 FoundationGrasp 模型的官方代码实现,专注于机器人抓取领域。它解决的是机器人如何根据视觉★ 149Deep-Learning-Coursera这是一个存放 deeplearning.ai 在 Coursera 上《深度学习专项课程》编程练习和个人作业的仓库,包含神经网络与深度学习、改善深层网络、结构化★ 137ChatbotChatbot 是一个基于 Python3 和深度学习技术的多用途聊天机器人项目。它通过人工神经网络和深度神经网络模型,旨在为开发者提供一个可训练、可扩展的对话★ 131cog-musicgen-remixercog-musicgen-remixer 是一个基于 MusicGen-Chord 模型的音乐混音工具,旨在利用 AI 技术对现有音乐进行智能重混。它解决了传统★ 105seq2seq-chatbot这是一个基于TensorFlow的序列到序列(seq2seq)对话机器人实现,旨在通过深度神经网络构建端到端的聊天模型。项目解决了传统规则式聊天机器人缺乏上下文★ 99fsdl-text-recognizer-2022这是 FSDL(Full Stack Deep Learning)2022 课程的配套完整项目代码仓库,对应课程实验的最终答案版本。项目以文本识别(OCR)为实★ 83Awesome-3D-Generation这是一个精选的3D生成资源列表,汇集了AI驱动的3D内容创作相关的论文、工具和资源。项目旨在为研究人员、开发者和爱好者提供一个系统性的导航,帮助用户快速了解3D★ 79cog-musicgen-chordcog-musicgen-chord 是一个基于 MusicGen 的音频生成项目,主要实现了和弦条件控制功能。它解决了 MusicGen 原生模型无法根据指定★ 69FFTNetFFTNet 是一个基于 FFT 的实时、说话人相关的神经声码器,用于语音合成(TTS)系统中的波形生成。它解决了传统声码器(如 WaveNet)推理速度慢、难★ 64PhyXPhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智慧’”。它通过设计一系列需要物理常识和因果推断的任务,来测试大★ 55