ml-infrastructure
本站收录 11 个带「ml-infrastructure」标签的 AI 开源项目
skypilot面向前沿 AI 团队的计算平台,将分散在不同云厂商的 GPU 算力整合成一台“AI 超级计算机”。它支持在多云环境下统一调度资源、自动选型最优实例并显著节省成本★ 10,665
metaflowNetflix 开源的 AI/ML 系统构建与管理框架,帮助开发者轻松编写、运行和部署机器学习流水线。它提供了简洁的 Python API,支持本地开发与云端规★ 10,283
rllmrllm是一个致力于将强化学习(RL)技术普及到大型语言模型(LLM)训练与推理中的开源框架。它主要解决当前LLM在复杂推理、决策和智能体任务中依赖监督微调、泛★ 5,851
determinedDetermined 是一个开源机器学习平台,旨在简化分布式训练、超参数调优、实验追踪和资源管理。它支持 PyTorch 和 TensorFlow,提供统一的 ★ 3,241
efficient-dl-systems这是一个面向深度学习系统的高效实现课程材料仓库,由多伦多大学等机构维护,内容涵盖深度学习系统的高效训练、推理、部署等核心主题。项目通过Jupyter Noteb★ 1,039
aqueductAqueduct 是一个已停止维护的开源基础设施项目,旨在帮助用户在任意云基础设施上运行大语言模型(LLM)和机器学习(ML)工作负载。它通过提供统一的接口和编★ 518
actions-ml-cicdactions-ml-cicd 是一个 GitHub Actions 的集合,旨在简化 MLOps 流程。它解决的是机器学习项目在持续集成和持续部署(CI/CD★ 206
monai-deploy-app-sdkMONAI Deploy App SDK 是 MONAI 项目的一部分,专注于医疗影像 AI 应用的全生命周期管理。它提供了一套框架和工具,帮助开发者设计、开发★ 138
mlinframlinfra 是一个专注于机器学习基础设施和 MLOps 工具链快速部署的开源项目。它旨在解决 ML 团队在搭建和运维机器学习平台时面临的复杂性和重复劳动问题★ 115
get-beamget-beam 是一个面向 AI 基础设施的早期开源项目,旨在让用户以无服务器(Serverless)方式运行 GPU 推理和训练任务。它解决了传统 GPU ★ 104
nboxnbox 是 NimbleBox 平台的官方 Python 包,旨在将平台的所有 API 封装为命令行工具和可复用的 Python 模块,从而简化机器学习工作流★ 87