surogate

用 C++ 和 CUDA 把大模型微调速度拉到极致

surogate 是一个专注于大语言模型训练与微调的高性能开源项目,基于 C++ 和 CUDA 实现,旨在提供“光速”般的训练体验。它针对 NVIDIA GPU 深度优化,支持 llama、qwen 等主流模型架构,覆盖 SFT(监督微调)等关键训练场景。项目解决了传统训练框架(如 PyTorch)在性能上的瓶颈,通过底层算子融合、显存管理和并行调度,显著提升训练吞吐量并降低资源消耗。其核心能力包括高效的 CUDA 内核、灵活的微调配置接口以及面向生成式 AI 的端到端训练管线,适合需要极致性能的 AI 研究者和工程团队。作为早期项目,它已获得 804 颗星标,展现出社区对高性能训练工具的强烈需求。

开源 unknown 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 813
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类模型训练
开发团队invergent-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型cuda,deep-learning,fine-tuning,generative-ai,llama,llm,llms,nvidia-gpu,qwen,sft
GitHub 星标★ 813
30天Star增速
HF 下载量
上线时间2026-01-02 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

核心亮点

  • 基于 CUDA 深度优化,训练吞吐量显著高于传统框架
  • 原生支持 llama、qwen 等主流模型,开箱即用
  • C++ 实现,内存和计算资源控制更精细

不足之处

  • 文档/社区待观察
  • 仅支持 NVIDIA GPU,硬件兼容性受限
  • 早期项目,生态和工具链尚不成熟

适用场景

  • 大模型高效微调,降低训练成本
  • 生成式 AI 模型的快速迭代实验
  • 对训练性能有极致要求的科研或生产环境

替代项目

Unsloth、Axolotl、LLaMA-Factory

项目介绍

surogate 是模型训练领域的开源项目,由 invergent-ai 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(813)位列前 30%,在模型训练分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:大模型高效微调,降低训练成本。同类可对比的替代方案包括 Unsloth、Axolotl、LLaMA-Factory。

上一篇:Nemotron

下一篇:can-i-finetune-this

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13