image-processing
本站收录 80 个带「image-processing」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
opencvOpenCV(Open Source Computer Vision Library)是一个开源的计算机视觉和机器学习软件库,提供超过2500种优化算法,涵盖图★ 91,011
supervisionsupervision 是一个专注于计算机视觉的可复用工具库,旨在简化视觉任务的开发流程。它解决了开发者在目标检测、分割、分类等任务中重复编写样板代码的问题,提★ 51,079
OCRmyPDFOCRmyPDF 是一个开源命令行工具,专门为扫描版 PDF 文件添加 OCR 文本层,让原本不可搜索的扫描文档变得可搜索、可复制、可索引。它解决的核心问题是:★ 34,903
segmentation_models.pytorchsegmentation_models.pytorch 是一个基于 PyTorch 的语义分割模型库,提供 500+ 预训练骨干网络(涵盖卷积和 Transfo★ 11,749
korniaKornia 是一个基于 PyTorch 的可微计算机视觉库,专注于几何视觉和空间 AI。它解决了深度学习与经典视觉算法之间的鸿沟,提供了一组可微分的图像变换、★ 11,390
manga-image-translatormanga-image-translator 是一个基于深度学习的漫画/图片文字翻译工具,能够自动检测图片中的文字区域,识别原文(主要支持日文、英文等),并翻译★ 10,454
neural-doodle基于深度神经网络与语义风格迁移的涂鸦作画工具,可将简单涂鸦变成精致画作,支持照片无缝纹理生成、图像风格迁移与样例放大,趣味性与实用性兼备。★ 9,851
mmagicOpenMMLab 推出的多模态生成智能创作工具箱,提供开箱即用的 AIGC 能力、易用 API 与丰富模型库,涵盖文生图、图像/视频修复与增强等任务,是搭建生★ 7,470
remove-ai-watermarks这是一个用于移除AI生成图像水印的命令行工具和Python库,主要针对Google Gemini(Nano Banana)的可见星标水印、SynthID隐形水印★ 5,716
towheeTowhee 是一个专注于神经数据处理的 Python 框架,旨在让构建和运行 AI 驱动的数据管道变得简单高效。它解决的是从原始数据(文本、图像、音视频等)到★ 3,450
catalystCatalyst 是一个面向深度学习研究与开发的 Python 框架,旨在加速从实验设计到模型部署的全流程。它解决了深度学习项目中代码重复、实验管理混乱、复现困★ 3,387
SnapOtterSnapOtter 是一个开源、可自托管的文件处理工具,旨在解决个人和企业处理图片、视频、音频、PDF 及文档时依赖云端服务导致的数据隐私和合规问题。它集成了格★ 2,755
CV-CUDACV-CUDA 是字节跳动与英伟达联合开源、面向云规模图像处理与计算机视觉的 GPU 加速库。它针对传统 OpenCV 在 CPU 上处理高并发视频流时吞吐不足★ 2,727
emgucvEmgu CV 是 OpenCV 图像处理库的跨平台 .NET 封装,让 C#、VB.NET、F# 等 .NET 开发者无需编写 C++ 代码,即可直接调用 O★ 2,301
triangletriangle 是一个用 Go 语言编写的命令行工具,能将普通图片转换成由德劳内三角剖分算法生成的计算机艺术风格图像。它解决了用户快速将照片或图像转化为低多边★ 2,069
fastdupfastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识★ 1,911
PyTorch-CycleGAN这是一个基于PyTorch的CycleGAN清洁可读实现,用于无配对图像到图像的转换。它解决了传统GAN需要成对训练数据的问题,通过循环一致性损失实现两个域之间★ 1,321
withoutbg-pythonwithoutbg-python 是 withoutbg 背景移除服务的官方 Python SDK,通过 pip install withoutbg 即可安装。★ 1,270
BoofCVBoofCV 是一个用纯 Java 编写的高性能计算机视觉库,主要面向机器人、移动端和嵌入式场景。它解决了 Java 生态中缺少可离线运行、无需本地依赖的视觉算★ 1,199
comfyuiComfyUI 是一个基于节点的 Stable Diffusion 图形用户界面,通过将图像生成流程拆分为可连接的模块,让用户能够灵活地构建和定制 AI 绘画工★ 1,066
JarvisArtJarvisArt 是一个基于大语言模型的智能照片修图代理,旨在解放人类艺术创造力。它通过理解用户的自然语言指令,自动完成从图像分析、风格迁移到细节调整等一系列★ 872
4KAgent4KAgent 是一个基于智能体(Agent)的任意图像 4K 超分辨率开源项目,发表于 NeurIPS 2025。它解决传统超分模型对输入图像类型敏感、难以处★ 831
caercaer 是一个面向计算机视觉研究的高性能 Python 库,旨在减少样板代码,让研究者专注于核心算法。它整合了图像处理、数据增强、模型训练与评估等常用功能,提★ 818
APTAPT 是一个开源的 AI 生产力工具,旨在通过本地化部署和隐私保护提升用户效率。它内置了 ChatGPT、DeepSeek、Phi、Qwen 等模型的本地专属★ 770
texturizetexturize 是一个基于深度学习的命令行工具,用于从源图像生成照片级真实的纹理,并支持纹理的混搭、重制与变体创作。它解决的是设计师和开发者快速生成多样化纹★ 760
SparkVSRSparkVSR 是一个基于稀疏关键帧传播的交互式视频超分辨率工具,由 ECCV 2026 论文提出。它解决传统视频超分方法计算量大、无法实时交互的问题,通过智★ 741
kornia-rskornia-rs 是用 Rust 编写的底层 3D 计算机视觉库,定位为 Kornia 生态的 Rust 实现。它解决的核心问题是:Python 视觉库在性能★ 718
ISP-GuideISP-Guide 是一个关于图像信号处理(ISP)的综合性学习指南,旨在帮助开发者系统理解从图像/视频传感器原始数据到最终数字图像的完整处理流程。它通过整理和★ 712
HiDTHiDT 是 CVPR 2020 Oral 论文《High-Resolution Daytime Translation Without Domain Labe★ 652
Exclusively-Dark-Image-DatasetExclusively Dark Image Dataset(ExDARK)是一个面向低光照视觉研究的图像数据集,由12,000张从极暗环境到黄昏(覆盖10种光★ 644
character_select_stand_alone_app这是一个基于 Electron 的桌面独立应用,用于角色选择与 AI 图像生成。它主要面向 wai-il 模型,支持通过 ComfyUI 和 WebUI(A11★ 627
AlbumentationsXAlbumentationsX 是经典图像增强库 Albumentations 的延续版本,面向计算机视觉训练场景,提供高性能、多样化的数据增强能力。它解决的核★ 563
light-ocrlight-ocr 是一个面向 Node.js 和 C++ 的快速离线 OCR 库,基于 PP-OCRv6 模型,解决在本地环境中进行文字识别时依赖云端 API★ 508
AI-CatalogAI-Catalog 是一个精心编排的 AI 工具与资源大全,旨在解决 AI 领域信息过载、工具分散难以发现的问题。它通过分类整理的方式,收录了涵盖对话助手、智★ 491
FILTER.jsFILTER.js 是一个用纯 JavaScript 实现的图像、视频处理与计算机视觉库,目标是在浏览器和 Node.js 环境中提供类似 OpenCV 的能力★ 399
JovimetrixJovimetrix 是一个基于 ComfyUI 的扩展节点包,专注于通过波形调制和数学运算实现动画参数控制。它解决了 ComfyUI 中节点间数据格式不统一和★ 397
ImageIndexerImageIndexer 是一个本地优先的图像索引与标注工具,用 Python 编写。它解决的是个人或小团队海量图片难以检索和管理的问题。核心能力是自动扫描指定★ 397
vision_tutorialvision_tutorial 是一个面向计算机视觉入门与 RoboMaster 算法组培训的开源教程项目。它把图像处理、深度学习与机器人视觉的常见知识点整理成★ 382
Deep-Exemplar-based-Video-Colorization这是一个基于深度学习的视频上色工具,来自CVPR 2019论文。它利用参考图像(示例图)为灰度视频自动添加自然色彩,解决传统视频上色中颜色不一致、需要人工干预的★ 370
Comprehensive-Data-Science-AI-Project-Portfolio这是一个精选的AI、数据工程和DevOps项目合集,包含真实世界应用、先进技术和教程,面向数据科学和机器学习的学习者与实践者。项目以Jupyter Notebo★ 351
Construction-Hazard-DetectionConstruction-Hazard-Detection 是一个面向建筑工地安全的开源计算机视觉项目。它基于 YOLO 目标检测模型,自动识别工人未佩戴安全帽★ 350
ComfyUI-post-processing-nodesComfyUI-post-processing-nodes 是一个为 ComfyUI 设计的后处理节点集合,旨在扩展图像生成工作流的后期效果能力。它解决的是 C★ 259
piccantepiccante 是一个用 C++ 编写的高动态范围(HDR)图像处理库,旨在为计算机视觉和图像处理领域提供一套完整的 HDR 工具链。它解决了 HDR 图像从★ 255
chitrachitra 是一个面向全栈深度学习的多功能 Python 库,旨在简化从模型构建到 API 开发再到模型部署的完整流程。它解决了深度学习项目中常见的工程化痛点★ 234
Stable-Diffusion-Latent-Space-ExplorerStable-Diffusion-Latent-Space-Explorer 是一个基于 diffusers 库的 Stable Diffusion 实验工具箱★ 228
BiaPyBiaPy 是一个开源的 Python 库,旨在简化生物图像分析流程的构建。它基于深度学习,提供从数据预处理、模型训练到结果可视化的端到端解决方案。核心能力包括★ 212
unofficial-claude-api这是一个非官方的 Claude API 封装库,基于 Python 实现,通过 Firefox 浏览器和 geckodriver 驱动,自动模拟登录 Claud★ 204
GammaCVGammaCV 是一个面向浏览器环境的 WebGL 加速计算机视觉库,使用 JavaScript 编写。它把图像处理与特征提取等常见 CV 操作搬到 GPU 上★ 195
noai-watermarknoai-watermark 是一个开源的 Python 命令行工具,用于移除图像中的隐形 AI 水印(如 SynthID、StableSignature、Tr★ 192