clip
本站收录 32 个带「clip」标签的 AI 开源项目
X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569
VLMEvalKitVLMEvalKit 是一个开源的大语言多模态模型(LMMs)评估工具包,旨在解决多模态模型评测标准不统一、评测流程繁琐的问题。它支持 220 多个主流 LMM★ 4,418
hcaptcha-challengerhcaptcha-challenger 是一个利用多模态大语言模型(如 GPT-4V、Gemini、CLIP)自动解决 hCaptcha 验证码的开源 Pyth★ 2,516
cambrianCambrian-1 是一个以视觉为中心设计的开源多模态大语言模型(MLLM)家族。它解决的是当前多模态模型在视觉感知能力上受限的问题,强调通过视觉中心的设计来★ 2,011
clearcamClearCam 是一个开源的智能安防摄像头增强工具,通过 AI 技术为普通 RTSP 摄像头添加物体检测、追踪、移动通知和视频搜索能力。它解决了传统安防摄像头★ 1,633
Video-ChatGPTVideo-ChatGPT 是一个面向视频对话的多模态大模型,发表于 ACL 2024。它结合了大型语言模型(如 Vicuna、LLaMA)与预训练视觉编码器(★ 1,512
Stable-Diffusion-NCNNStable-Diffusion-NCNN 是一个基于 C++ 和 NCNN 推理框架的 Stable Diffusion 轻量级实现,支持在移动端(如 And★ 1,069
SmartJavaAISmartJavaAI 是一个基于 Java 的免费离线 AI 算法工具箱,旨在为 Java 开发者提供开箱即用的 AI 能力,解决 Java 生态中缺乏易用 ★ 919
aphantasiaaphantasia 是一个基于 CLIP 模型的文本生成图像与视频的开源工具。它利用 CLIP 的语义理解能力,结合 FFT(快速傅里叶变换)、DWT(离散小★ 789
PaddleMIXPaddleMIX是百度飞桨生态下的多模态大模型套件,旨在统一支持主流多模态任务,包括图文理解、视觉问答、图像生成等。它集成了端到端的大规模多模态预训练模型和扩★ 723
SkyPaint-AI-DiffusionSkyPaint-AI-Diffusion 是一个基于 Stable Diffusion 优化的中文 AI 绘画模型,旨在解决中文用户使用文本生成图像时提示词理★ 646
keras_cv_attention_modelskeras_cv_attention_models 是一个基于 TensorFlow/Keras 的计算机视觉模型库,汇集了众多主流和前沿的视觉骨干网络,如 B★ 626
openclipOpenClip 是一个用 Python 编写的开源工具,专门解决长视频中精彩片段难以快速定位的问题。它借助大语言模型和 AI 分析能力,自动从数小时的长视频里★ 566
diffusion-explainerDiffusion Explainer 是一个交互式可视化工具,旨在帮助用户直观理解文本到图像生成模型(如 Stable Diffusion)的内部工作原理。它★ 499
EVEEVE是北京智源人工智能研究院(BAAI)推出的免编码器视觉语言模型系列。传统视觉语言模型通常依赖预训练的视觉编码器(如ViT)来提取图像特征,而EVE直接以像★ 376
GenSimGenSim 是一个利用大语言模型自动生成机器人仿真任务的开源项目,旨在解决机器人学习中任务设计高度依赖人工、耗时且难以规模化的问题。它通过 GPT-4 等 L★ 360
ViP-LLaVAViP-LLaVA是CVPR 2024收录的多模态大模型,旨在让模型理解任意视觉提示(如点、框、涂鸦等),而不仅限于文本指令。它解决了现有视觉语言模型只能处理全★ 338
FiT3DFiT3D 是一个针对二维基础模型(如 DINOv2、MAE 等)进行三维感知微调的开源框架,其研究成果发表于 ECCV 2024。核心问题是:现有的二维视觉特★ 331
Image-MetaHubImage-MetaHub 是一个本地优先的数字资产管理工具,专门为 AI 生成图像设计。它解决了生成式 AI 用户面临的核心痛点:图像文件与生成参数(如提示词★ 323
Disco_Diffusion_LocalDisco_Diffusion_Local 是一个让 Disco Diffusion 在本地运行的配置与教程项目,主要解决原版依赖 Google Colab 在★ 316
VideoGPT-plusVideoGPT-plus 是论文《VideoGPT+: Integrating Image and Video Encoders for Enhanced V★ 294
TargetCLIPTargetCLIP 是 ECCV 2022 论文的官方 PyTorch 实现,专注于基于图像的 CLIP 引导本质迁移。它解决的是在图像编辑中,如何将参考图像★ 231
StyleGAN3-CLIP-notebooks这是一个Jupyter Notebook集合,旨在结合NVIDIA的StyleGAN3与OpenAI的CLIP模型,实现基于文本引导的图像生成。用户可以通过输入★ 213
clip-genCLIP-GEN 是一个基于 CLIP 的文本生成图像模型,核心创新在于无需语言标注训练。传统文本到图像模型依赖大量图文配对数据,而 CLIP-GEN 利用 C★ 147
yasd-discord-botyasd-discord-bot 是一个基于 Python 的 Discord 机器人,旨在将 Stable Diffusion 图像生成能力无缝集成到 Dis★ 110
LodeDBLodeDB 是一个用 Rust 编写、提供 Python 接口的嵌入式向量数据库,主打本地优先、默认精确检索、多模态与 GPU 加速。它要解决的问题是:现有向★ 101
vqgan-clip-appvqgan-clip-app 是一个基于 Python 的本地图像生成工具,利用 VQGAN-CLIP 或 CLIP 引导扩散模型,将文本描述转化为图像。它解决★ 100
FoundADFoundAD 是 ICLR 2026 论文《Foundation Visual Encoders Are Secretly Few-Shot Anomaly ★ 86
WinCLIPWinCLIP 是 CVPR 2023 论文《WinCLIP: Zero-/few-shot anomaly classification and segmen★ 74
CLIP-API-serviceCLIP-API-service 是一个基于 OpenAI CLIP 模型封装的即用型 API 服务,旨在将 CLIP 的图文跨模态能力以简单易用的 HTTP ★ 67
Fast_text2StyleGANFast_text2StyleGAN 是一个将自然语言与预训练人脸生成器 StyleGAN 对接的开源项目,来自论文《Text-Free Learning of★ 65
clip-ganclip-gan 是一个利用 CLIP 模型引导生成式对抗网络(GAN)自动创作音乐视频的开源实验项目。它解决了传统音乐视频制作成本高、创意受限的问题,通过将 ★ 54