whisper

本站收录 173 个带「whisper」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

voiceboxvoicebox 是一个开源的 AI 语音工作室,旨在提供一站式的声音克隆、语音转写和语音合成能力。它解决了个人开发者和小团队难以高效构建高质量语音 AI 应用★ 55,989whisper.cppwhisper.cpp 是 OpenAI 的 Whisper 语音识别模型的高性能 C/C++ 移植版。它解决了 Whisper 原始 Python 实现依赖 ★ 54,014meetilyMeetily 是一款基于 Rust 构建的隐私优先 AI 会议助手,专为 macOS 和 Windows 设计。它解决的核心问题是会议记录的低效与隐私泄露风险★ 31,241whisperXWhisperX 是一个基于 OpenAI Whisper 的自动语音识别(ASR)工具,核心解决 Whisper 原始输出时间戳不精确、无法对齐到单词级别的问★ 24,303buzzBuzz 是一款运行在个人电脑上的离线语音识别与翻译工具,基于 OpenAI 的 Whisper 模型。它能够将音频或视频文件中的语音实时转录为文字,并支持多语★ 21,745voice-provoice-pro 是一个面向创作者和开发者的 Gradio WebUI 工具,集成了多种前沿的语音技术。它解决了音频内容生产中语音合成、克隆、分离和翻译的碎片★ 12,962PaddleSpeechPaddleSpeech 是百度开源的端到端语音工具包,基于飞桨深度学习框架,提供从语音识别、语音合成到说话人验证、语音翻译、关键词唤醒等全链路能力。它解决了语★ 12,689WhisperLiveKitWhisperLiveKit 是一个实时、本地的语音转文字工具包,基于 OpenAI Whisper 模型,提供流式语音识别(ASR)、说话人分离(speake★ 11,103RTranslatorRTranslator 是一款开源的 Android 实时翻译应用,完全在本地运行,无需联网,保护用户隐私。它利用 Meta 的 NLLB 模型和 ONNX R★ 10,469inferenceXinference 是一个统一推理引擎,旨在解决多模型部署与调用碎片化问题。它允许开发者通过修改一行代码,将 GPT 替换为任何开源大语言模型、语音模型或多模★ 9,593openwhispropenwhispr 是一款开源的语音转文字听写应用,主打隐私优先和跨平台支持。它解决了用户在使用语音输入时对云端数据隐私的担忧,允许用户通过自带密钥(BYOK★ 8,837vibevibe 是一款基于 OpenAI Whisper 的本地语音转文字桌面应用,支持 macOS、Windows 和 Linux。它解决了用户需要快速、私密地将语★ 7,655argmax-oss-swift专为 Apple Silicon 打造的端侧语音 AI 框架,支持在设备本地运行语音识别与合成等模型,无需联网与云端依赖。基于 Swift 开发,性能高效、隐私★ 6,385cactuscactus 是一个专为移动设备、可穿戴设备、智能家居和机器人等边缘场景设计的轻量级 AI 推理引擎。它解决了在资源受限的硬件上高效运行深度学习模型的问题,核心★ 6,080whisper-diarization这是一个基于OpenAI Whisper的自动语音识别与说话人分离工具,解决的是多说话人场景下语音转写时无法区分谁在说话的问题。它结合Whisper的强大多语种★ 5,659YouDub-webuiYouDub-webui 是一个开源的 AI 视频本地化工具,旨在将 YouTube 或 Bilibili 视频自动翻译并配音成中文。它解决了视频内容跨语言传播★ 5,553SmartSubSmartSub 是一款免费开源的桌面端一站式字幕工具,主要解决视频创作者和翻译者在字幕生成、翻译、配音和烧录过程中的效率问题。它基于 Whisper、FunA★ 5,423wenetWeNet 是一个面向生产环境的端到端语音识别工具包,旨在解决学术模型与工业部署之间的鸿沟。它基于 PyTorch 构建,支持 Conformer、Transf★ 5,243AI-Youtube-Shorts-Generator这是一个开源工具,旨在将长格式的YouTube视频自动转换为适合短视频平台(如TikTok、Shorts、Reels)的9:16竖屏短片。它解决了内容创作者需要★ 5,168LLPlayerLLPlayer 是一款专为语言学习设计的开源媒体播放器,基于 C# 开发。它解决了语言学习者在使用普通播放器时无法高效对照原文和译文、难以获取生词释义、以及缺★ 4,315WhisperLiveWhisperLive 是一个基于 OpenAI Whisper 的近乎实时语音转写工具,旨在解决传统 Whisper 离线处理延迟高、无法用于直播或对话场景的★ 4,301speachesspeaches 是一个基于 faster-whisper 构建的语音识别服务,提供与 OpenAI API 兼容的接口,支持实时转录、文件转录和翻译功能。它解★ 3,691openscreenOpenScreen 是一款免费开源的屏幕录制与演示视频制作工具,旨在替代付费的 Screen Studio。它基于 Electron 和 Rust 构建,利用★ 3,358ruby-openairuby-openai 是一个用 Ruby 编写的 OpenAI API 客户端库,旨在让 Ruby 开发者能够轻松、优雅地调用 OpenAI 的各种服务,包括★ 3,222willowwillow 是一个开源的、本地化的、自托管的语音助手,旨在成为 Amazon Echo 和 Google Home 的替代品。它基于 ESP32 硬件和 ES★ 3,116whishperwhishper 是一个基于 Whisper 模型的本地语音转文字工具,提供网页界面,让用户无需上传数据即可完成音频转录、翻译和字幕编辑。它解决了云端语音服务带★ 3,077openaiOpenAI 是一个由 Betalgo Ranul 开发的 .NET 库,用于调用 OpenAI 服务 API。它解决了 .NET 开发者无法方便地使用官方 O★ 3,026faster-whisper-GUIfaster-whisper-GUI 是一个基于 PySide6 的桌面图形界面工具,旨在为 faster-whisper 语音识别模型提供易用的操作界面。它解★ 3,004OpenSuperWhisperOpenSuperWhisper 是一款专为 macOS 打造的语音听写应用,旨在提供高效、准确的语音转文字服务。它解决了 macOS 自带听写功能在识别准确率★ 2,969HexHex 是一款专为 macOS 打造的语音转文字工具,基于 Swift 和 SwiftUI 构建,核心目标是实现从语音到文字的快速、精准转换。它利用 OpenA★ 2,901whisper-timestampedwhisper-timestamped 是一个基于 OpenAI Whisper 的语音识别增强工具,专门为多语言自动语音识别提供词级时间戳和置信度。它解决了标★ 2,850foundry-localfoundry-local 是一个面向本地设备的高性能 AI 推理基础设施,基于 C++ 构建,核心目标是让大语言模型和语音识别模型在本地硬件上高效运行。它利用★ 2,572AudioNotesAudioNotes 是一个基于 Python 的语音转文字笔记工具,旨在快速从音视频文件中提取内容并整理成结构化的 Markdown 笔记。它解决了手动听写和★ 2,521youtube-shorts-pipeline这是一个全自动生成YouTube Shorts视频的流水线工具,核心解决从新闻素材到成片并上传的端到端自动化问题。它先抓取新闻内容,通过Claude等AI生成脚★ 2,303WhisperJAVWhisperJAV 是一个面向日语成人视频(JAV)场景的自动语音识别(ASR)与字幕生成工具。它解决了通用语音识别模型在噪声环境、多人对话、特殊语气词等场景★ 2,287kalosmkalosm 是一个用 Rust 编写的本地预训练 AI 模型推理框架,旨在让开发者能够以极低的延迟和完全可控的方式在本地运行大语言模型、语音识别和图像生成等模★ 2,229claude-real-videoclaude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法直接处理视频的问题,通过从视频 UR★ 2,191OnnxStreamOnnxStream 是一个轻量级的 ONNX 推理库,用 C++ 编写,专为资源受限环境设计。它解决了在低内存、低算力设备(如树莓派 Zero 2)上运行大型★ 2,089openai-kotlinopenai-kotlin 是一个基于 Kotlin 的 OpenAI API 客户端,支持多平台(Kotlin Multiplatform)和协程(Corou★ 1,846typewhisper-mactypewhisper-mac 是一款专为 macOS 设计的本地语音转文字工具,基于 Apple Silicon 芯片和 WhisperKit 框架,实现完全★ 1,811obs-localvocalobs-localvocal 是一个专为 OBS Studio 设计的本地语音识别与字幕插件,利用 OpenAI Whisper 等 AI 模型在本地实时将音频★ 1,619voxtypevoxtype 是一款面向 Linux Wayland 桌面的离线语音转文字工具,用 Rust 编写。它解决的核心问题是:在 Wayland 合成器(如 Hyp★ 1,575amicalamical 是一款本地优先的开源 AI 听写应用,旨在让用户摆脱键盘,通过语音实现 3 倍速的文字输入。它基于 Electron 和 Next.js 构建,支★ 1,540minutesminutes 是一个开源的、注重隐私的对话记忆层,使用 Rust 编写。它旨在解决会议、想法和语音备忘录等信息碎片化、难以检索的问题。其核心能力是自动将音频(★ 1,519ai-dev-galleryai-dev-gallery 是一个面向 Windows 开发者的开源示例项目集合,旨在帮助开发者学习如何将本地 AI 模型和云端 API 集成到 Window★ 1,504nightingaleNightingale 是一款基于机器学习的开源卡拉 OK 应用,用 TypeScript 与 Rust 构建,目标是把普通电脑变成能自动分离人声与伴奏、还能给★ 1,479CrisperWhisperCrisperWhisper 是一个基于 OpenAI Whisper 的语音识别增强工具,专注于解决标准 Whisper 输出中时间戳不精确和缺少语气词(如“★ 1,432Speech-AI-ForgeSpeech-AI-Forge 是一个围绕 TTS(文本转语音)生成模型构建的开源项目,提供 API 服务器和基于 Gradio 的 WebUI。它整合了多种主★ 1,420mlx-tunemlx-tune 是一个专为 Apple Silicon Mac 设计的 LLM 微调工具,基于 MLX 框架原生运行,让开发者无需云端 GPU 即可在本地完成★ 1,414transcribe-anythingtranscribe-anything 是一个基于 Whisper 的多后端语音转文字工具,目标是让本地音视频转写变得又快又简单。它支持输入本地文件或在线 UR★ 1,403