pretrained-models

本站收录 33 个带「pretrained-models」标签的 AI 开源项目

transformersHugging Face 出品的模型定义框架,支持文本、视觉、音频与多模态模型,覆盖推理与训练全流程,是当前研究和生产中最主流的开源模型生态基石。★ 166,817pytorch-image-modelspytorch-image-models(常被称为 timm)是 PyTorch 生态中规模最大的图像编码器与骨干网络集合,由 Hugging Face 维护。★ 37,182QwenQwen(通义千问)是阿里巴巴云推出的开源大语言模型系列,包含对话模型和预训练模型。该项目提供了从0.5B到72B多种规模的模型权重,支持中英文及多语言,覆盖聊★ 21,881open_clipOpen_CLIP 是 CLIP 模型的开源实现,由 LAION 等社区维护,旨在复现并扩展 OpenAI 的 CLIP 模型。它解决了 CLIP 原始代码未开★ 14,174PaddleNLPPaddleNLP 是百度飞桨生态下的自然语言处理库,定位为易用且强大的大模型与小模型库,内置丰富的模型动物园。它解决从文本分类、序列标注到大规模预训练模型微调★ 12,981petalsPetals 是一个去中心化的 LLM 推理与微调框架,采用 BitTorrent 风格的点对点网络,将大型语言模型(如 Llama、Falcon、BLOOM)★ 10,592LMFlowLMFlow 是一个面向大型基础模型的高可扩展微调与推理工具包,旨在让每个人都能轻松使用和定制大模型。它解决了大模型微调门槛高、资源消耗大、流程复杂的问题,提供★ 8,486InternLMInternLM 是由上海人工智能实验室开源的大型语言模型系列,涵盖 InternLM、InternLM2、InternLM2.5 和 InternLM3 等多★ 7,280silero-modelsSilero Models 是一个提供预训练语音模型的集合,专注于让文本转语音(TTS)和语音识别(STT)变得极其简单。它解决了开发者在使用语音技术时面临的模★ 6,123chronos-forecastingChronos是一个基于Transformer架构的预训练时间序列预测模型库,由Amazon Science团队开发。它解决了传统时间序列预测模型需要针对每个数★ 5,926awesome-pretrained-chinese-nlp-models这是一个高质量中文预训练模型、大模型、多模态模型及大语言模型的精选集合,旨在为中文NLP从业者提供一站式模型资源导航。项目系统整理了从BERT、GPT到LLaM★ 5,593superduperSuperduper 是一个端到端的开源框架,用于构建自定义 AI 应用和智能代理。它解决了将 AI 模型(如 LLM、预训练模型)与现有数据基础设施(尤其是 ★ 5,327LLMBook-zh.github.io《大语言模型》是一本由中国人民大学赵鑫教授团队编写的中文开源教材,旨在系统性地介绍大语言模型的技术原理、架构设计与应用实践。全书覆盖从基础概念到前沿进展的完整知★ 4,584LimiXLimiX 是一个专注于结构化数据建模的开源项目,旨在增强通用人工智能(AGI)对表格、数据库等结构化数据的理解与生成能力。它解决了当前大语言模型在处理非文本结★ 4,327Open3D-MLOpen3D-ML 是 Open3D 的扩展库,专注于 3D 机器学习任务,如点云语义分割、物体检测和实例分割。它提供统一的数据集加载接口(支持 Semanti★ 2,351CogViewCogView 是智源研究院开源的文本生成图像模型,源自 NeurIPS 2021 论文。它基于 Transformer 架构,将文本描述转化为高质量图像,解决★ 1,799lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692CogView2CogView2是清华大学与智谱AI联合推出的文本生成图像模型,基于层次化Transformer架构,在CogView基础上显著提升生成速度与图像质量。它解决的★ 950diffwaveDiffWave 是一个基于扩散概率模型的神经声码器与波形合成器,由 Google Brain 团队提出,用于从梅尔频谱等条件特征高效生成高质量语音波形。它解决★ 886vision-aided-ganvision-aided-gan 是一个 CVPR 2022 Oral 论文的开源实现,核心思想是利用现成的预训练模型(如 CLIP、DINO 等)来辅助 GA★ 423fuzi.mingcha夫子·明察司法大模型是山东大学、浪潮云和中国政法大学联合研发的中文司法领域大模型,以ChatGLM为底座,通过海量无监督司法语料和有监督微调数据训练而成。它解决★ 395Awesome_Multimodel_LLMAwesome_Multimodel_LLM 是一个精选资源列表,专注于多模态大语言模型(MLLM)领域。它系统整理了相关数据集、微调技术、上下文学习、视觉推理★ 379STU-NetSTU-Net 是基于最大公开医学图像分割数据集(超过10万标注)训练的超大规模预训练模型,参数量达14亿,是截至2023年4月最大的医学图像分割模型。它旨在解★ 373wavegradWaveGrad 是一个基于分数匹配的快速高质量神经声码器,由 Google Research 提出,用于从梅尔频谱图生成原始音频波形。它解决了传统神经声码器(★ 299Large-Scale-MedicalLarge-Scale-Medical 是一个面向大规模三维医学影像预训练的开源项目,发表于 TPAMI 2026。它针对医学影像分析中标注数据稀缺、模型泛化能★ 288HugsVisionHugsVision 是一个基于 Hugging Face 生态的计算机视觉工具包装库,旨在让开发者用极简的代码调用最新的视觉模型。它解决了传统视觉任务中模型集★ 199Tacotron2-PyTorch这是一个基于PyTorch实现的Tacotron 2文本转语音(TTS)模型,旨在提供比原始实现更快的训练速度和更灵活的参数控制。它解决了Tacotron 2在★ 148TEMPOTEMPO 是一个基于提示词(prompt)的生成式预训练Transformer模型,专为时间序列预测任务设计,是ICLR 2024的官方开源实现。它针对传统时★ 143MAMA-MIAMAMA-MIA是一个面向乳腺癌诊断研究的多中心动态对比增强磁共振成像(DCE-MRI)公开数据集,包含来自多个医疗中心的影像数据及专家标注的病灶分割结果。该项★ 117STU-NetSTU-Net 是一个基于大规模预训练的医学图像分割模型,参数量达 14 亿,是目前已知最大的医学分割模型。它利用超过 10 万个标注的公开数据集进行训练,旨在★ 116EEGMambaEEGMamba 是一个基于 Mamba 架构的脑电信号(EEG)基础模型,发表于 Neural Networks 2025。它利用状态空间模型的高效序列建模能★ 100Awesome-LLMs-ICLR-24Awesome-LLMs-ICLR-24 是一个专门整理 ICLR 2024 会议上所有大语言模型(LLM)相关论文的资源合集。它解决了研究者难以系统追踪顶级会★ 72PSECPSEC是一个面向智能体(Agent)的技能扩展与组合框架,其核心思想是在参数空间中实现技能的动态扩展与灵活组合。它解决的是智能体在面对新任务时,如何高效复用已★ 67