gradio

本站收录 52 个带「gradio」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

stable-diffusion-webui最流行的 Stable Diffusion Web UI,通过浏览器界面运行 SD 模型,支持文生图、图生图、超分辨率、蒙版重绘等丰富功能与庞大的扩展生态,是 ★ 165,151ebook2audiobookebook2audiobook 是一个将电子书自动转换为有声书的开源工具,支持 EPUB、PDF 等格式,内置 1158 多种语言和声音克隆功能。它解决了传统有★ 20,249stable-diffusion-webui-colabstable-diffusion-webui-colab 是一个基于 Google Colab 的 Stable Diffusion WebUI 一键部署方案。★ 15,915voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962stable-diffusion-webui-dockerstable-diffusion-webui-docker 是一个基于 Docker 的 Stable Diffusion WebUI 部署方案,旨在简化 St★ 7,305FunClipFunClip 是一个基于阿里达摩院 FunASR 语音识别模型的开源视频剪辑工具,主要解决视频中语音内容的快速定位与剪辑问题。它提供本地 Gradio 网页界★ 6,354agentic-rag-for-dummies这是一个用 LangGraph 构建的模块化 Agentic RAG 教程项目,旨在帮助开发者快速掌握检索增强生成(RAG)智能体的核心概念与实现。它解决了传统★ 4,216Ask-AnythingAsk-Anything 是一个基于大语言模型的多模态视频理解对话助手,核心解决“让 AI 看懂视频并自然对话”的问题。它支持多种主流语言模型(如 miniGP★ 3,354TTS-WebUITTS-WebUI 是一个集成了多种主流语音与音频生成模型的一站式 Web 界面,基于 Gradio 和 React 构建。它解决了用户在不同 TTS、语音克隆★ 3,276InternGPTInternGPT(iGPT)是一个开源的AI模型演示平台,旨在让开发者轻松展示和交互体验多种前沿AI模型。它集成了DragGAN、ChatGPT、ImageB★ 3,206OmAgentOmAgent 是一个用于快速构建多模态语言智能体的开源框架,旨在帮助开发者从原型到生产环境无缝部署。它解决了传统语言模型在处理图像、视频等非文本数据时的局限,★ 2,666Anime2SketchAnime2Sketch 是一个专门从动漫/插画图像中提取线稿的开源工具。它基于生成对抗网络(GAN)和深度学习技术,能够自动将彩色动漫图片转换为干净、清晰的线★ 2,130text-generation-webui-colabtext-generation-webui-colab 是一个基于 Google Colab 的 Jupyter Notebook 项目,为运行大型语言模型(L★ 2,093sd-webui-text2videosd-webui-text2video 是一个为 Stable Diffusion WebUI(Auto1111)开发的扩展插件,旨在让用户无需额外安装复杂的依★ 1,322sd-webui-inpaint-anythingsd-webui-inpaint-anything 是一个基于 Stable Diffusion WebUI 的扩展,它将 Segment Anything 的★ 1,295binioubiniou 是一个自托管的 WebUI,聚合了 30 多种生成式 AI 模型,覆盖图像、音频、视频等模态。它基于 Gradio 构建,集成 Hugging F★ 1,151image-multiple-angles-3d-camera这是一个基于 Three.js 和 Gradio 构建的 3D 交互式图像生成工具,允许用户通过拖拽 3D 空间中的相机或调整滑块(方位角、仰角、距离)来自由控★ 1,016Local_Pdf_Chat_RAG这是一个用纯原生 Python 实现的 RAG(检索增强生成)框架,专注于本地 PDF 文档的智能问答。它解决了本地文档无法直接与大模型对话的问题,通过 FAI★ 957unpromptedunprompted 是一个专为 Stable Diffusion 工作流设计的模板语言,以 Automatic1111 WebUI 扩展形式提供。它解决的是在★ 807rag-chatbotrag-chatbot 是一个基于 RAG(检索增强生成)技术的本地 PDF 对话工具,允许用户直接与多个 PDF 文档进行自然语言交互。它解决了传统 PDF ★ 688Multi-Modality-ArenaMulti-Modality-Arena 是一个基于 Gradio 构建的多模态模型评测平台,灵感来自 Chatbot Arena,但专注于视觉-语言模型(VL★ 566forge-filmforge-film 是一个基于 Python 的多模型 DAG 驱动并行 AI 影视生成引擎。它解决传统 AI 视频生成中场景逐个生成、耗时漫长的问题,通过将★ 537Semi-Auto-NovelAI-to-PixivSemi-Auto-NovelAI-to-Pixiv 是一个面向 NovelAI 用户的批量图像生成与发布工具,通过 WebUI 提供一站式操作。它解决了手动逐★ 424Awesome-MLOPSAwesome-MLOPS 是一个精选资源列表,旨在帮助初学者从零开始系统掌握 MLOps(机器学习运维)。它聚合了从基础概念到高级实践的各类学习材料,包括教程★ 383ACE-Step-StudioACE-Step-Studio 是一个便携式 AI 音乐生成工具,旨在让用户完全离线地创作完整歌曲,包括人声、翻唱和音乐视频。它解决了传统 AI 音乐生成依赖云★ 357ultimate-rvcultimate-rvc 是一个基于检索式语音转换(RVC)的音频内容创作应用,主要用于生成歌曲翻唱和语音合成。它解决了普通用户难以训练和使用高质量语音模型的问★ 330stable-diffusion-xl-demo这是一个基于Gradio的Stable Diffusion XL 1.0演示Web UI,旨在为SDXL模型提供一个简单易用的图形界面。它解决了SDXL模型部署★ 278inpaint-anythingInpaint Anything 是一个基于浏览器的图像修复工具,它将 Meta 的 Segment Anything 模型(SAM)与 Stable Diff★ 274Outfit-Anyone-in-the-WildOutfit Anyone in the Wild 是一个基于 Stable Diffusion 的虚拟试穿开源项目,旨在解决传统虚拟试穿中受限于固定姿势、背景★ 269akcioAkcio 是一个用于演示检索增强生成(RAG)概念的开源项目。它通过结合大语言模型(LLM)与向量数据库,在生成回答前先从知识库中检索相关文档,从而提升输出的★ 258sd-webui-replacersd-webui-replacer 是一个面向 Stable Diffusion WebUI 的扩展插件,主要解决图像或视频中特定物体的替换问题。它通过检测提示★ 241whisper-auto-transcribe这是一个基于 OpenAI Whisper 的自动音频转写工具,旨在提供简单易用的语音转文本解决方案。它解决了普通用户在使用 Whisper 时面临的命令行操作★ 229asmr-dubberasmr-dubber 是一个用 Python 编写的音视频字幕与配音工具,主要面向 ASMR、音声作品等需要跨语言处理的场景。它把语音识别(ASR)、台本导入★ 212batchlinks-webuibatchlinks-webui 是一个面向 Stable Diffusion 用户的批量下载工具,以 Gradio 界面集成到 SD WebUI 中,支持一次★ 185stable-diffusion-webui-Layer-DividerLayer-Divider 是一个 stable-diffusion-webui 的扩展插件,利用 Meta 的 Segment Anything Model ★ 185PromptGallery-stable-diffusion-webuiPromptGallery-stable-diffusion-webui 是一个为 Stable Diffusion WebUI 设计的提示词图库扩展,旨在解决★ 161chat_with_your_docs这是一个基于Python构建的文档对话助手,旨在让用户通过自然语言与多种先进AI模型交互,从PDF、网页和YouTube视频中提取信息。项目集成了Ollama、★ 160sd.cpp-webuisd.cpp-webui 是一个基于 Gradio 的轻量级 Web 界面,专为 stable-diffusion.cpp 设计。stable-diffusio★ 159PapersChatPapersChat 是一个基于代理式 AI 的论文对话工具,让你能直接与本地论文聊天,同时也能从 ArXiv 和 PubMed 获取相关论文信息。它解决了科研★ 157voice_clone_labvoice_clone_lab 是一个基于 Qwen3-TTS 的本地语音克隆工具,用户只需提供几分钟的音频样本,即可微调模型并生成与目标音色一致的语音。项目提★ 152modelscope-studiomodelscope-studio 是一个基于 Gradio 的第三方组件库,旨在帮助开发者高效构建 AI 应用界面。它集成了 Ant Design、Ant D★ 151Minimalistic-Comfy-Wrapper-WebUIMCWW(Minimalistic-Comfy-Wrapper-WebUI)是一个基于 Gradio 的 ComfyUI 附加界面,专注于推理场景,不依赖节点图★ 141multimodal-chatmultimodal-chat 是一个基于 Python 和 Gradio 构建的多模态聊天界面,集成了多种工具,支持通过 Anthropic Claude 和★ 133text-guided-image-colorization这是一个交互式图像着色工具,结合了Stable Diffusion (SDXL)和BLIP模型,并采用ControlNet方法进行重训练。用户可以通过Gradi★ 108NeuroSandboxWebUINeuroSandboxWebUI 是一个本地运行的神经网络模型 WebUI,基于 Python 和 Gradio 构建,支持文本、图像、视频、3D 和音频等多★ 106LLMinatorLLMinator 是一个基于 Gradio 的对话助手工具,旨在让用户直接从 Hugging Face 运行开源大语言模型。它解决了普通用户配置本地 LLM ★ 98PaperBanana-CNPaperBanana-CN 是一个面向科研人员的科学图表生成与编辑工作台,基于 Gradio 构建,提供中文界面。它解决科研绘图中流程繁琐、工具分散的问题,核★ 84HiggsAudio-StudioHiggsAudio-Studio 是一个面向 Windows 的便携式文本转语音(TTS)工具,集成了 Higgs Audio v3 模型和 AI 文本导演功★ 84OpenAI-TTS-GradioOpenAI-TTS-Gradio 是一个基于 Gradio 构建的轻量级 Web 界面,用于调用 OpenAI 的文本转语音(TTS)API。它解决了非开发者★ 60SD-WebUI-BatchCheckpointPromptSD-WebUI-BatchCheckpointPrompt 是一个 Stable Diffusion WebUI 的扩展脚本,用于批量测试不同 checkpo★ 54