representation-learning

本站收录 29 个带「representation-learning」标签的 AI 开源项目

EVAEVA是北京智源人工智能研究院(BAAI)开源的一系列视觉基础模型,专注于视觉表示学习。它通过大规模对比学习预训练,为图像分类、目标检测、语义分割等下游视觉任务★ 2,695cambrianCambrian-1 是一个以视觉为中心设计的开源多模态大语言模型(MLLM)家族。它解决的是当前多模态模型在视觉感知能力上受限的问题,强调通过视觉中心的设计来★ 2,011ONE-PEACEONE-PEACE 是一个跨视觉、音频、语言三种模态的通用表示模型,旨在探索一种能处理无限模态的统一表征框架。它解决了传统模型只能处理单一或少数模态、难以共享和★ 1,060PointLLMPointLLM 是一个让大语言模型直接理解三维点云的开源多模态模型,解决了传统大模型只能处理文本和图像、无法感知三维结构的问题。它首次将点云编码器与 LLaM★ 1,056ModelsGenesisModels Genesis 是医学图像分析领域最早的基础模型之一,由 MICCAI 2019 青年科学家奖和 MEDIA 2020 最佳论文奖背书。它通过自监★ 794VLM2VecVLM2Vec 是一个将视觉语言模型(VLM)适配为多功能嵌入模型的开源项目,核心解决多模态内容(图像、文本、视频等)的统一向量化表示问题。它提出了 MMEB(★ 689tokenize-anythingTokenize Anything via Prompting 是一个来自 ECCV 2024 的视觉模型,旨在通过统一的提示框架将任意视觉概念(如物体、区域、★ 600RefAlignRefAlign 是一个用于参考视频生成的表示对齐框架,旨在解决现有视频扩散模型在生成时难以保持参考对象外观一致性的问题。它通过引入表示对齐机制,将参考图像或视★ 472SuPreMSuPreM 是一个面向医学影像分析的3D预训练模型库,基于ICLR 2024 oral论文提出。它利用9,262个CT体数据和25个标注类别进行监督预训练,解★ 433TOTEMTOTEM 是一个面向通用时间序列分析的开源模型,核心思路是将连续的时间序列数据离散化为 token(令牌),从而将时间序列分析任务统一转化为类似自然语言处理的★ 373FiT3DFiT3D 是一个针对二维基础模型(如 DINOv2、MAE 等)进行三维感知微调的开源框架,其研究成果发表于 ECCV 2024。核心问题是:现有的二维视觉特★ 331Awesome-Foundation-Models-for-Weather-and-Climate这是一个关于天气与气候基础模型的综合资源列表,收录了近年来基于深度学习的基础模型在气象和气候数据理解方面的研究进展。项目系统梳理了相关模型、数据集、基准测试和论★ 299FrancaFranca 是一个用于可扩展视觉表示学习的开源项目,其核心创新在于提出嵌套套娃聚类(Nested Matryoshka Clustering)方法。该方法通过★ 282TSLANetTSLANet 是一个面向时间序列任务的轻量级基础模型,发表于 ICML 2024。它结合卷积操作与自适应频谱分析,旨在统一处理分类、回归、异常检测和插补等多种★ 267ShapeLLMShapeLLM 是一个面向具身交互的通用 3D 物体理解模型,由 ECCV 2024 论文提出。它解决了传统 3D 模型难以同时处理点云感知、语言对齐和交互推★ 248Awesome-Foundation-Models-on-Graphs这是一个关于图基础模型的精选资源列表,汇集了图基础模型领域的论文、代码和数据集。它旨在解决图基础模型研究资料分散、难以系统获取的问题,为研究人员和开发者提供一站★ 226Efficient-VDVAEEfficient-VDVAE 是论文“Efficient-VDVAE: Less is more”的官方 PyTorch 和 JAX 实现,旨在提升层次化变分★ 199conditional-motion-propagation这是一个CVPR 2019的官方代码项目,专注于视频中的条件运动传播问题。其核心目标是解决视频中物体运动信息的预测与传播,尤其在交互式视频标注场景下,能够根据用★ 159foundation-cancer-image-biomarker这是一个与2024年发表于《Nature Machine Intelligence》的论文配套的代码与评估仓库,聚焦于癌症影像生物标志物的基础模型。该项目旨在解★ 136MiniGPT-3DMiniGPT-3D 是一个面向 3D 点云理解与对话的开源项目,旨在让大语言模型(LLM)直接理解三维空间信息。它解决了传统方法需要高算力或复杂多模态融合的问★ 134EventGPTEventGPT 是一个面向事件流(event stream)理解的多模态大语言模型框架,源自 CVPR 2025 论文。它解决的是传统视觉模型难以高效处理高时★ 115AlphaRecAlphaRec 是 ICLR 2025 Oral 论文《Language Representations Can be What Recommenders N★ 108VisCyVisCy 是一个面向单细胞表型分析的开源计算机视觉工具库,主要服务于生物图像分析场景。它把深度学习模型封装成可直接调用的组件,用于从显微图像中提取单细胞层面的★ 104CoBRACoBRA 是一个用于复现和控制 LLM 智能体行为的开源框架,源自 CHI 2026 最佳论文。它通过将经典社会科学实验引入智能体测试,提供了一套可复现的方法★ 98OmniVAEOmniVAE 是一个面向音视频联合生成的统一变分自编码器(VAE),旨在解决音频与视频模态在生成任务中难以对齐和协同建模的问题。它通过引入跨模态对齐机制,将音★ 90FoundADFoundAD 是 ICLR 2026 论文《Foundation Visual Encoders Are Secretly Few-Shot Anomaly ★ 86robustness-foundation-models本项目是NeurIPS 2022教程《基础模型的根基鲁棒性》的官方配套代码库,由亚马逊云科技等机构的研究者维护。它聚焦于大模型(如CLIP、BERT等)在对抗攻★ 72IISANIISAN 是一个面向推荐系统的多模态基础模型高效适配开源项目。它解决了在推荐场景中直接使用大规模多模态模型(如视觉-语言模型)时计算成本高、适配效率低的问题。★ 54MergeVQMergeVQ是一个面向视觉生成与表征学习的统一框架,核心思路是将token合并(Token Merging)与向量量化(Quantization)结合,在Im★ 51