self-supervised-learning
本站收录 30 个带「self-supervised-learning」标签的 AI 开源项目
PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689
lightly-trainlightly-train 是一个面向视觉模型的一体化训练框架,支持 YOLO、ViT、RT-DETR、DINOv3 等主流架构,覆盖预训练、微调和蒸馏全流程。★ 1,692
getigeti 是英特尔推出的计算机视觉模型训练平台,旨在用更少的数据和更短的时间构建高性能视觉模型。它解决了传统深度学习模型开发中数据标注成本高、训练周期长、调参复★ 1,344
GigaAMGigaAM是一个面向语音识别任务的基础模型,旨在为俄语及其他语言的语音识别提供开箱即用的解决方案。它解决了传统语音识别系统需要大量标注数据和复杂训练流程的问题★ 833
ModelsGenesisModels Genesis 是医学图像分析领域最早的基础模型之一,由 MICCAI 2019 青年科学家奖和 MEDIA 2020 最佳论文奖背书。它通过自监★ 794
ICASSP-2023-24-Papers这是一个汇集ICASSP 2023和2024会议论文的仓库,旨在为声学、语音和信号处理领域的研究者提供一站式的论文集合。项目解决了学术会议论文分散、难以系统追踪★ 525
Remote-Sensing-RVSARemote-Sensing-RVSA 是遥感领域的基础模型开源项目,对应 TGRS'22 论文《Advancing Plain Vision Transfor★ 469
stable-pretrainingstable-pretraining 是一个用于预训练基础模型和世界模型的 Python 库,主打可靠、极简和可扩展。它主要解决深度学习研究中预训练流程复杂、复★ 320
xcodecxcodec 是一个面向音频语言模型的语义编解码器,由香港科技大学等机构在 AAAI 2025 提出。它针对传统音频编解码器(如 EnCodec)在语义信息保留★ 316
Awesome-Foundation-Models-for-Weather-and-Climate这是一个关于天气与气候基础模型的综合资源列表,收录了近年来基于深度学习的基础模型在气象和气候数据理解方面的研究进展。项目系统梳理了相关模型、数据集、基准测试和论★ 299
Large-Scale-MedicalLarge-Scale-Medical 是一个面向大规模三维医学影像预训练的开源项目,发表于 TPAMI 2026。它针对医学影像分析中标注数据稀缺、模型泛化能★ 288
FrancaFranca 是一个用于可扩展视觉表示学习的开源项目,其核心创新在于提出嵌套套娃聚类(Nested Matryoshka Clustering)方法。该方法通过★ 282
GeoPTGeoPT 是一个面向物理仿真的预训练模型框架,其核心思路是通过“提升几何预训练”技术,让模型在无需大量标注数据的情况下,学习物理系统的几何与动力学规律。它解决★ 263
Awesome-Foundation-Models-on-Graphs这是一个关于图基础模型的精选资源列表,汇集了图基础模型领域的论文、代码和数据集。它旨在解决图基础模型研究资料分散、难以系统获取的问题,为研究人员和开发者提供一站★ 226
BiaPyBiaPy 是一个开源的 Python 库,旨在简化生物图像分析流程的构建。它基于深度学习,提供从数据预处理、模型训练到结果可视化的端到端解决方案。核心能力包括★ 212
pathology-foundation-models这是一个汇总病理学基础模型与特征提取器的开源列表项目,旨在为计算病理学研究者提供一站式的模型资源导航。项目系统整理了近年来发布的病理学基础模型(如基于自监督学习★ 207
femrFEMR是一个面向电子健康记录(EHR)的大规模自监督学习框架。它解决的核心问题是:医疗数据通常以非结构化的时间序列事件形式存在,难以直接用于机器学习模型。FE★ 182
latent-pose-reenactment这是CVPR 2020论文《Neural Head Reenactment with Latent Pose Descriptors》的官方实现,用于数字人头部★ 181
papagei-foundation-modelPaPaGei 是一个面向光学生理信号(如PPG)的开源基础模型项目,相关论文已被ICLR'25接收。它旨在解决生理信号领域标注数据稀缺、模型泛化能力差的问题,★ 179
ssl-wearablesssl-wearables 是一个面向可穿戴设备数据的自监督学习开源项目,基于英国生物银行(UK-Biobank)超过70万人天的加速度计数据构建。它解决了可穿★ 166
BEVTBEVT 是 CVPR 2022 论文《BEVT: BERT Pretraining of Video Transformers》的官方 PyTorch 实现。★ 161
conditional-motion-propagation这是一个CVPR 2019的官方代码项目,专注于视频中的条件运动传播问题。其核心目标是解决视频中物体运动信息的预测与传播,尤其在交互式视频标注场景下,能够根据用★ 159
awesome-artificial-intelligence-research这是一个面向 AI 研究者的精选资源清单(Awesome List),系统整理了人工智能各子领域的前沿论文、工具、数据集与学习资料,覆盖推荐系统、计算机视觉、机★ 133
speech_course这是一个面向语音技术学习者的深度学习课程项目,以 Jupyter Notebook 形式呈现,覆盖自动语音识别(ASR)、说话人识别、关键词唤醒、文本转语音(T★ 116
EndoDACEndoDAC 是一个面向内窥镜手术场景的自监督深度估计模型,发表于 MICCAI 2024。它解决了基础模型(如 DINOv2)直接应用于内窥镜图像时因域差异★ 97
HuBERT-ECGHuBERT-ECG 是一个基于自监督学习的心电信号(ECG)基础模型,旨在为广泛且可扩展的心脏应用提供通用表征。它借鉴了语音处理中的 HuBERT 方法,通过★ 82
video-to-videoReshoot-Anything 是一个基于自监督学习的视频重拍(video reshooting)模型,旨在解决现实场景中随意拍摄视频的视角转换与动态重拍问题★ 78
gen2seggen2seg 是一个基于生成式模型(如 Stable Diffusion)实现通用实例分割的开源项目,对应 ICLR 2026 论文。它旨在解决传统分割模型依★ 77
AudioMAE-pytorchAudioMAE-pytorch 是掩码自编码器(Masked Autoencoder)在音频领域的非官方 PyTorch 实现,基于论文《Masked Aut★ 71
MIRAGEMIRAGE 是一个多模态基础模型与基准测试集,专为视网膜光学相干断层扫描(OCT)图像的全面分析而设计,相关论文发表于 npj Digital Medicin★ 54