image
本站收录 28 个带「image」标签的 AI 开源项目
satoriVercel 开源的高性能 HTML/CSS 转 SVG 渲染库,无需浏览器即可在服务端将网页元素渲染为矢量图,常用于生成社交媒体卡片、OG 封面与自定义图片,★ 13,991
robotgoRobotGo 是一个基于 Go 语言的原生跨平台 RPA(机器人流程自动化)与 GUI 自动化库,旨在帮助开发者用 Go 语言轻松实现桌面端的自动化操作。它解★ 10,845
OmniGenOmniGen 是一个统一图像生成框架,基于扩散模型,通过单一模型实现文生图、图像编辑、多图融合、角色一致性生成等多种任务,无需额外模块或复杂pipeline。★ 4,345
awesome-virtual-try-on这是一个围绕虚拟试穿(Virtual Try-On)方向的精选资源合集,系统整理了相关的研究论文、开源项目、代码实现、数据集与学术工作坊。虚拟试穿要解决的是电商★ 3,189
novelai-botnovelai-bot 是一个基于 Koishi 框架开发的画图机器人插件,主要面向 NovelAI 和 Stable Diffusion 用户。它解决了在聊天★ 2,554
ComfyUI-RMBGComfyUI-RMBG 是一个专为 ComfyUI 设计的自定义节点,用于高级图像背景移除和对象、人脸、衣物及时尚分割。它集成了 RMBG-2.0、INSPY★ 2,127
fastdupfastdup 是一个开源的图像与视频数据集分析工具,旨在帮助深度学习从业者快速发现数据集中的问题并提升数据质量。它通过高效的算法在短时间内扫描海量数据,自动识★ 1,911
UniPicUniPic 是一个开源的 SOTA 多图像编辑模型,专注于通过自然语言指令对多张输入图像进行联合编辑。它解决了传统图像编辑模型只能处理单张图像、难以理解多图之★ 875
album-aialbum-ai 是一个 AI 优先的相册应用,让你用自然语言与本地相册对话。它解决了传统相册只能按时间、地点或手动标签检索的痛点,通过集成 LLM Visio★ 795
weirweir 是一个已弃用的 Common Lisp 项目,旨在构建一个用于创建生成式系统的框架。它提供了一套工具和抽象,帮助开发者以编程方式生成图形、图案或交互式★ 638
AI-CatalogAI-Catalog 是一个精心编排的 AI 工具与资源大全,旨在解决 AI 领域信息过载、工具分散难以发现的问题。它通过分类整理的方式,收录了涵盖对话助手、智★ 491
ConSinGANConSinGAN 是单图像生成对抗网络(GAN)的 PyTorch 实现,源自论文《Improved Techniques for Training Sing★ 442
potatopotato 是一个轻量级、可移植的数据标注工具,旨在为 AI 研究和开发提供灵活高效的标注解决方案。它解决了传统标注工具部署复杂、难以定制、难以适应多模态数据★ 425
Outfit-Anyone-in-the-WildOutfit Anyone in the Wild 是一个基于 Stable Diffusion 的虚拟试穿开源项目,旨在解决传统虚拟试穿中受限于固定姿势、背景★ 269
nonebot-plugin-novelai这是一个基于 NoneBot2 的 QQ 机器人插件,用于对接 Stable Diffusion WebUI 或 NovelAI/Naifu 后端,让用户在聊天★ 214
arbitrary-text-to-image-papers这是一个持续更新的论文列表,系统梳理了任意文本到图像生成领域的学术资源。项目按技术路线分类整理,涵盖基于GAN、场景图、对话交互等不同范式的论文,并为每篇论文附★ 210
Awesome-ICCV2023-Low-Level-Vision这是一个整理ICCV 2023及2021低层视觉(Low-Level Vision)方向论文与代码的精选列表,涵盖去模糊、去噪、图像增强、修复、超分辨率等子领域★ 194
VEFX-BenchVEFX-Bench 是一个面向通用视频编辑与视觉特效(VFX)的综合性基准测试项目。它旨在解决视频编辑和特效领域缺乏统一、全面评估标准的问题,为生成式 AI ★ 175
qapyqqapyq 是一个面向大规模图像/视频数据集的 AI 辅助媒体策展工具,专为 LoRA 和扩散模型训练流程设计。它解决了训练数据准备中繁琐的标注、裁剪和遮罩问题★ 164
website-to-gifwebsite-to-gif 是一个 GitHub Action,用于将指定网站页面自动转换为 GIF 动图。它解决了文档、演示或社交媒体中需要展示网页动态效果★ 162
wondaWonda 是一个运行在终端里的 AI 内容创作命令行工具,基于 TypeScript 开发。它主要解决创作者在命令行环境中高效生成和编辑图像内容的需求,无需切★ 155
Ming-UniVisionMing-UniVision 是一个统一图像理解与生成的联合模型开源项目,核心创新在于提出连续统一分词器(Continuous Unified Tokenize★ 144
Recluse-BotRecluse-Bot 是一个开源的 Discord 多功能机器人,提供超过 200 条命令,涵盖聊天、娱乐、图片、信息查询、服务器管理和实用工具等类别。它旨在★ 120
scanbot-sdk-example-androidscanbot-sdk-example-android 是 Scanbot SDK 官方提供的 Android 示例工程,用 Kotlin 编写,展示如何在原生★ 114
html-gethtml-get 是一个 JavaScript 库,用于从任意网站抓取 HTML 内容,并针对纠错与速度做了专门优化。它解决的核心问题是:普通 fetch 或 ★ 103
dalle3-playground这是一个非官方的 DALL·E 3 在线游乐场,基于 TypeScript 开发,用于快速体验 OpenAI 图像生成 API。它解决了开发者或普通用户需要编写★ 94
achatbotachatbot 是一个开源的聊天机器人架构,专为语音、视觉及多模态助手设计,支持本地(CPU/GPU 受限)和远程(I/O 受限)运行。它整合了 ASR(语音★ 90
Stable-Diffusion-Video2Video这是一个为AUTOMATIC1111/stable-diffusion-webui编写的小型脚本,用于将视频逐帧通过img2img模式处理,实现视频到视频的风格★ 62