SepLLM
开源
压缩冗余片段,让大模型推理快 2.5 倍
SepLLM 是一个针对大语言模型推理加速的开源项目,核心思想是将输入序列中的连续片段压缩为单个分隔···
汇聚全球AI模型训练与微调项目,LoRA、全参微调、蒸馏、训练框架工具大全。
共收录 524 个开源项目
SepLLM
开源
压缩冗余片段,让大模型推理快 2.5 倍
SepLLM 是一个针对大语言模型推理加速的开源项目,核心思想是将输入序列中的连续片段压缩为单个分隔···
Chain-of-Embedding
开源
不生成文字,用嵌入链提前预判大模型输出质量
Chain-of-Embedding 是 ICLR 2025 论文的官方代码与数据仓库,提出了一种无需生成输出即可让大语言···
notebooks
开源
照着 Notebook 改数据路径,就能微调 250+ 大模型
这是 Unsloth 官方维护的 Jupyter Notebook 合集,收录 250 多个面向文本、视觉、音频、嵌入和 TTS···
spirit-lora-trainer
开源
拖拽配置,一键训练 Flux1 LoRA,告别命令行烦恼
Spirit Lora Trainer 是一个基于 kohya-ss sd-scripts 的 Flux1-LoRA 训练工具包,旨在简化 LoRA 模···
SLED
开源
不训练不微调,用模型自己纠正自己,让回答更靠谱
SLED 是一种用于提升大语言模型事实准确性的解码策略,通过自我逻辑演化(Self Logits Evolution)···
MARS
开源
用方差缩减技术,让大模型训练更快更稳
MARS 是一个专注于大模型训练优化的开源项目,其核心创新在于利用方差缩减(Variance Reduction)技···
rlhf-summary-notes
开源
快速理清RLHF算法脉络,一份笔记入门
这是一个关于RLHF(基于人类反馈的强化学习)算法的简明总结笔记项目。它旨在为研究者和工程师提供···
nunchaku
开源
让 12B 扩散模型在 6GB 显存上流畅跑,量化加速一步到位
nunchaku 是 ICML 2025 Spotlight 论文 SVDQuant 的官方开源实现,专注于 4-bit 扩散模型的量化推理···
VideoTuna
开源
用你的数据定制专属视频生成模型,让 AI 更懂你的风格。
VideoTuna 是一个专注于视频生成模型微调的开源工具,旨在让开发者能够轻松地针对特定风格、主题或···
llemr
开源
把病历变成指令,微调大模型看懂医疗数据
llemr 是一个针对电子健康记录(EHR)的指令微调框架,源自 NeurIPS'24 DB 的 Spotlight 论文。它旨···
FastVideo
开源
生成提速几十倍,再也不用干等出片
统一的视频生成加速框架,将推理与后训练(post-training)流程整合一体,通过高效优化实现更快的视···
GEM
开源
微调时保住模型创造力,让生成不再千篇一律
GEM 是论文《Preserving Diversity in Supervised Fine-tuning of Large Language Models》的官方代···
BlaGPT
开源
小数据集上快速对比语言模型架构与技巧
BlaGPT 是一个用于基准测试语言模型架构、层和技巧的实验性游乐场,专注于在较小数据集上进行灵活实···
evo-memory
开源
给Transformer装上可扩展的神经记忆,突破上下文长度限制
evo-memory 是一个用于训练和评估神经注意力记忆模型的开源项目,目标是为 Transformer 架构提供通···
qapyq
开源
一键策展海量图像视频,自动标注裁剪遮罩,加速 LoRA 训练
qapyq 是一个面向大规模图像/视频数据集的 AI 辅助媒体策展工具,专为 LoRA 和扩散模型训练流程设计···
MyLLM
开源
跟着 Notebook 从数据到应用跑通大模型全流程
MyLLM 是一个面向大语言模型全流程学习的开源教学项目,用 Jupyter Notebook 串联从数据到应用的完···
AdaptiveDiffusion
开源
不重训直接加速扩散模型,生成更快更省算力
AdaptiveDiffusion 是一个无需训练的扩散模型加速推理方案,发表于 NeurIPS 2024。它针对 Stable D···
Fast-LLM
开源
让 LLM 训练跑满 GPU,少等快出结果
Fast-LLM 是 ServiceNow Research 开源的 LLM 训练加速框架,目标是把大模型预训练与微调推到接近硬···
mantis
开源
轻量级时间序列分类基础模型,小样本也能精准分类
Mantis 是一个面向时间序列分类任务的轻量级基础模型,旨在解决传统时间序列模型依赖大量标注数据、···
MoE-plus-plus
开源
零计算专家,让MoE模型更快更省,性能不减
MoE++ 是一个针对混合专家(Mixture-of-Experts, MoE)模型的加速框架,核心思想是引入“零计算专家···
CausalMM
开源
破解注意力因果,减少多模态模型瞎编乱造
CausalMM 是一个针对多模态大语言模型(MLLM)幻觉问题的开源项目,发表于 ICLR 2025。它主要解决因···
AlphaEdit
开源
不改模型结构,精准修改大模型知识,性能不塌方
AlphaEdit 是一个面向大语言模型的知识编辑工具,基于零空间约束方法,能在不重新训练模型的前提下···
LLMEmb
开源
让大模型嵌入更精准,提升检索与语义匹配效果
LLMEmb 是 AAAI 2025 Oral 论文的官方实现,专注于大语言模型的嵌入表示学习。它解决的核心问题是:···
RewardModelingBeyondBradleyTerry
开源
用新理论替代Bradley-Terry,让奖励建模更准
这是一个关于偏好奖励建模的开源项目,是ICLR 2025论文的官方实现。论文重新思考了基于Bradley-Ter···