pretraining

本站收录 25 个带「pretraining」标签的 AI 开源项目

LLMs-from-scratch手把手教你用 PyTorch 从零实现一个 ChatGPT 级别的 LLM,逐行讲解代码与原理,是深入理解 Transformer 架构与大模型训练的最佳学习路★ 105,758Llama-ChineseLlama-Chinese 是 Llama 中文社区维护的开源项目,旨在构建最好的中文 Llama 大模型开源生态。它实时汇总最新的 Llama 学习资料,提供★ 14,762LMOpsLMOps是一个聚焦于大语言模型(LLM)和多模态大模型(MLLM)能力落地的通用技术项目。它解决的是从模型到实际应用之间的工程化鸿沟,提供一系列工具、方法和最★ 4,477mPLUG-OwlmPLUG-Owl是阿里巴巴达摩院开发的多模态大语言模型家族,旨在让AI同时理解文本和图像,并基于指令进行对话。它解决了传统语言模型只能处理文本、无法理解视觉信★ 2,539HRM-TextHRM-Text 是一个基于 HRM 架构的 1B 参数文本生成模型,专注于通过任务完成和潜在空间推理增强生成能力。它解决了小型语言模型在复杂推理任务上表现不足★ 2,106GraphGenGraphGen 是一个面向大语言模型监督微调的数据合成框架,核心思路是用知识图谱驱动合成数据生成。它从给定知识源(如文档、知识库)中抽取实体与关系,构建知识图★ 1,226Awesome-Robotics-3DAwesome-Robotics-3D 是一个精选资源列表,专注于大模型(LLM/VLM)时代下机器人领域的 3D 视觉研究。它系统整理了相关论文、代码和网站,★ 825MARSMARS 是一个专注于大模型训练优化的开源项目,其核心创新在于利用方差缩减(Variance Reduction)技术来提升训练效率。它解决了传统随机梯度下降(★ 723Craw4LLMCraw4LLM 是一个面向大语言模型预训练的高效网页爬取工具,源自同名学术论文。它解决的是传统爬虫抓取网页时内容冗余、噪声大、与训练目标不匹配的问题,通过将爬★ 665LoongForgeLoongForge 是一个面向大模型训练的统一高性能框架,支持在 NVIDIA GPU 和昆仑芯 XPU 上训练 LLM、VLM、扩散模型及具身智能模型。它解★ 582PITIPITI是一个基于预训练的图像到图像翻译框架,核心思想是“预训练即一切”,旨在解决传统图像翻译模型需要大量配对数据、训练成本高且泛化能力弱的问题。它利用大规模预★ 504TPATPA(Tensor ProducT ATTenTion)是一个NeurIPS 2025 Spotlight论文的开源实现,提出了一种新型注意力机制,旨在替代标★ 463PonderV2PonderV2 是一个面向 3D 视觉基础模型的开源预训练框架,发表于 T-PAMI 2025。它提出一种通用的预训练范式,旨在解决 3D 模型训练数据稀缺、★ 377ChatPLUGChatPLUG 是一个面向中文开放域对话的开源系统,基于 encoder-decoder 架构,融合了指令微调与知识增强技术。它旨在解决中文场景下开放域对话中★ 323LLMInternSkillLLMInternSkill 是一个面向大模型方向求职者的开源工具箱,以 Codex Skill 形式提供简历优化、职位匹配、证据审查、面试模拟和项目挖掘五大核★ 323GeoPTGeoPT 是一个面向物理仿真的预训练模型框架,其核心思路是通过“提升几何预训练”技术,让模型在无需大量标注数据的情况下,学习物理系统的几何与动力学规律。它解决★ 263RLPRLP 是一个将强化学习作为预训练目标的开源模型项目,由 ICLR 2026 论文官方实现,基于 PyTorch。它旨在解决传统预训练模型仅关注监督学习或自监督★ 254minimind-deep-dive这是一个以 MiniMind 开源大模型源码为切入点,面向中文读者的深度学习笔记项目。它逐行精读预训练、SFT、DPO、PPO、GRPO 等核心训练机制,帮助读★ 222hands-on-llmhands-on-llm 是一个面向中文开发者的 LLM 全栈动手学习项目,核心目标是把大模型从理论到落地的完整链路拆解成可运行的代码与实验。它包含三大部分:一★ 125GRAPEGRAPE 是一个面向图神经网络的表示位置编码方法,由 ICLR 2026 论文提出。它通过将节点分组并学习组级别的表示位置编码,解决了传统位置编码在捕捉图结构★ 120HLAHLA 是一个官方开源项目,对应论文《HLA: Higher-order Linear Attention》。该项目旨在解决传统线性注意力在建模高阶特征交互时表★ 105AutoMathTextAutoMathText 是一个面向数学文本的自主数据选择工具,基于 ACL 2025 论文实现。它利用零样本生成式分类器,自动从海量文本中筛选出高质量数学语料★ 92LongRecipeLongRecipe 是一个针对大语言模型长上下文泛化能力的高效训练方案。它通过模拟长序列训练效果,将长文本压缩成短序列的“配方”,在不显著增加计算成本的前提下★ 79RoseRose 是一个基于 PyTorch 的优化器,提出了一种名为 Range-Of-Slice Equilibration 的优化方法。它通过范围归一化的梯度更新★ 77data_iodata_io 是一个面向 HRM-Text(人力资源领域文本)预训练的数据管道项目,专注于构建和清洗用于训练 HR 相关大模型的高质量文本数据集。它解决了 H★ 74