distributed-training

本站收录 18 个带「distributed-training」标签的 AI 开源项目

Made-With-ML一套面向生产级机器学习应用的完整学习课程,手把手教你如何开发、部署并持续迭代 ML 应用。内容覆盖从实验到上线的全流程实践,配有代码示例,适合希望系统掌握工程化★ 49,652pytorch-image-modelspytorch-image-models(常被称为 timm)是 PyTorch 生态中规模最大的图像编码器与骨干网络集合,由 Hugging Face 维护。★ 37,182PaddleNLPPaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调★ 12,981skypilot面向前沿 AI 团队的计算平台,将分散在不同云厂商的 GPU 算力整合成一台“AI 超级计算机”。它支持在多云环境下统一调度资源、自动选型最优实例并显著节省成本★ 10,665metaflowNetflix 开源的 AI/ML 系统构建与管理框架,帮助开发者轻松编写、运行和部署机器学习流水线。它提供了简洁的 Python API,支持本地开发与云端规★ 10,283rllmrllm是一个致力于将强化学习(RL)技术普及到大型语言模型(LLM)训练与推理中的开源框架。它主要解决当前LLM在复杂推理、决策和智能体任务中依赖监督微调、泛★ 5,851FedMLFedML 是一个统一且可扩展的机器学习库,专注于大规模分布式训练、模型服务和联邦学习。它提供跨云调度器 FedML Launch,支持在任意 GPU 云或本地★ 4,067determinedDetermined 是一个开源机器学习平台,旨在简化分布式训练、超参数调优、实验追踪和资源管理。它支持 PyTorch 和 TensorFlow,提供统一的 ★ 3,241alpaAlpa 是一个用于训练和服务大规模神经网络的计算框架,其核心目标是自动并行化。它解决了用户在分布式系统上运行超大模型时面临的并行策略选择复杂性问题,通过自动将★ 3,178efficient-dl-systems这是一个面向深度学习系统的高效实现课程材料仓库,由多伦多大学等机构维护,内容涵盖深度学习系统的高效训练、推理、部署等核心主题。项目通过Jupyter Noteb★ 1,039haloHalo 是由 White Circle 开源的大语言与多模态模型训练框架,用 Python 编写。它面向从微调到强化学习后训练的完整流程,核心能力包括分布式训★ 798tapestryTapestry 是一个旨在让每个国家和参与者拥有自己前沿 AI 的开源项目。它通过组建全球联盟,共同训练一个共享的前沿基础模型,各合作伙伴基于此构建并拥有符合★ 277tracemlTraceML 是一个开源的 PyTorch 训练性能诊断工具,旨在帮助开发者定位和解决训练过程中的性能瓶颈。它通过自动捕获和分析训练运行时的性能数据,提供可视★ 185PrimusPrimus 是面向 AMD GPU 的大规模基础模型训练框架,目标是在 AMD 硬件上提供灵活且高性能的分布式训练能力。它解决的核心问题是:主流训练框架(如 ★ 131tensorcircuit-ngTensorCircuit-NG 是新一代基于张量网络的量子软件框架,专为 AI 原生设计。它解决量子计算模拟中计算复杂度高、与机器学习框架集成难的问题,核心能★ 92LUMI-AI-GuideLUMI AI Guide 是一个帮助用户将机器学习应用从中小型计算环境迁移到 LUMI 超级计算机的指南项目。它针对 LUMI 这一欧洲高性能计算平台,提供从★ 81redcoRedCoast是一个轻量级工具,旨在自动化分布式训练和推理流程,特别针对大语言模型和扩散模型。它解决了在联邦学习、差分隐私等场景下,多机多卡环境配置复杂、代码★ 69remote-gpu-trainerremote-gpu-trainer 是一个面向深度学习实验生命周期的 Agent Skill 工具,旨在解决远程 GPU 训练中实验管理混乱、结果不可复现、交★ 63